Image-Text-to-Text
PaddleOCR
Safetensors
English
Chinese
multilingual
paddleocr_vl
ERNIE4.5
PaddlePaddle
image-to-text
ocr
document-parse
layout
table
formula
chart
seal
spotting
conversational
custom_code
Eval Results
Instructions to use PaddlePaddle/PaddleOCR-VL-1.5 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PaddleOCR
How to use PaddlePaddle/PaddleOCR-VL-1.5 with PaddleOCR:
# See https://www.paddleocr.ai/latest/version3.x/pipeline_usage/PaddleOCR-VL.html to installation from paddleocr import PaddleOCRVL pipeline = PaddleOCRVL(pipeline_version="v1.5") output = pipeline.predict("path/to/document_image.png") for res in output: res.print() res.save_to_json(save_path="output") res.save_to_markdown(save_path="output") - Notebooks
- Google Colab
- Kaggle
zhangyue66 commited on
Commit ·
264a95e
1
Parent(s): 143b689
update
Browse files
image_processing_paddleocr_vl.py
CHANGED
|
@@ -339,6 +339,7 @@ class PaddleOCRVLImageProcessor(BaseImageProcessor):
|
|
| 339 |
images = make_list_of_images(images)
|
| 340 |
|
| 341 |
if input_data_format is None:
|
|
|
|
| 342 |
input_data_format = ChannelDimension.LAST if isinstance(images[0], Image.Image) else infer_channel_dimension_format(images[0])
|
| 343 |
|
| 344 |
if do_convert_rgb:
|
|
|
|
| 339 |
images = make_list_of_images(images)
|
| 340 |
|
| 341 |
if input_data_format is None:
|
| 342 |
+
# We assume that all images have the same channel dimension format.
|
| 343 |
input_data_format = ChannelDimension.LAST if isinstance(images[0], Image.Image) else infer_channel_dimension_format(images[0])
|
| 344 |
|
| 345 |
if do_convert_rgb:
|