PaddleOCR 3.5采用Transformers后端替换传统CNN,提升文档识别精度和泛化能力。对需要处理文档提取、表单识别任务的程序员是更好的开源选项。
engine="transformers"
PaddleOCR 继续提供 OCR 模型系列(如 PP-OCRv5)和文档解析模型系列(如 PaddleOCR-VL 1.5),而 Transformers 成为运行它们的支持后端之一。
在 Hugging Face Spaces 试用实时演示:https://huggingface.co/spaces/PaddlePaddle/paddleocr-3.5-transformers-demo
PaddleOCR 3.5 引入了更灵活的推理引擎接口。开发者可以通过 engine 参数选择后端,并通过 engine_config 传递后端特定的选项。
实际上,这意味着:
PaddleOCR 管理这些任务背后的流水线,因此开发者无需手动调用每个内部组件。
Transformers 成为运行受支持 PaddleOCR 模型的支持推理后端之一。
开发者可以通过 engine_config 配置后端相关选项,如 dtype、设备放置和注意力实现。
此版本主要涉及推理后端层:PaddleOCR 继续提供 OCR 和文档解析功能,而 Transformers 为受支持的 PaddleOCR 模型提供另一个自然适配 Hugging Face 中心环境的后端选项。更大的 Document AI 工作流仍掌握在开发者和应用构建者手中。
对于 RAG、Document AI 和文档 agent 应用,困难通常在 LLM 之前开始。
开发者首先需要将 PDF、扫描文档、截图、表格、图表、公式和复杂页面布局转换为可靠的结构化数据。如果这个摄取步骤不够有力,下游 LLM 工作流可能会遗漏关键信息、检索错误的上下文或产生不可靠的答案。
PaddleOCR 通过提供 OCR 系列模型(如 PP-OCRv5)和文档解析系列模型(如 PaddleOCR-VL-1.5)来帮助解决这一文档摄取挑战。
通过 PaddleOCR 3.5,这些功能现在更容易与 Transformers 中心堆栈连接。受支持的 PaddleOCR 模型可以使用 Transformers 后端运行,而 PaddleOCR 继续在幕后管理 OCR 或文档解析流水线。
对于开发者,这意味着减少了集成摩擦,提供了从文档到下游 RAG、agent、搜索、分析或自动化工作流的更自然的路径。
安装 PaddleOCR 3.5、PaddleX、Transformers 和与你硬件兼容的 PyTorch 构建。
例如,在 CUDA 12.6 环境中:
python -m pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu126
python -m pip install "paddleocr==3.5.0" "paddlex==3.5.2" "transformers>=5.4.0"
对于 CPU、ROCm 或其他环境,请安装与你目标硬件匹配的 PyTorch 构建。
从命令行运行:
paddleocr ocr \
-i https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png \
--device gpu:0 \
--engine transformers
或使用 Python API:
from paddleocr import PaddleOCR
pipeline = PaddleOCR(
device="gpu:0",
engine="transformers",
use_doc_orientation_classify=False,
use_doc_unwarping=False,
use_textline_orientation=False,
engine_config={
"dtype": "float32",
},
)
results = pipeline.predict(
"https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png"
)
for result in results:
print(result)
Hugging Face Space 使用 float32 以获得广泛的兼容性。对于你自己的硬件,可以通过 engine_config 调整后端特定的选项:
engine_config = {
"dtype": "bfloat16",
"device_type": "gpu",
"device_id": 0,
"attn_implementation": "sdpa",
}
最佳配置取决于你的模型、硬件和部署环境。
当你希望 PaddleOCR 的 OCR 和文档解析功能更自然地适配 Hugging Face 中心堆栈时,使用 Transformers 后端。
如果你正在构建 RAG、Document AI、搜索、分析或 agent 应用,并且已经依赖 PyTorch / Transformers 基础设施进行模型加载、实验、部署或模型工件管理,这尤其有用。
Transformers 后端在以下情况是好的选择:
为已经使用 Transformers 的团队提供更熟悉的开发体验,
为受支持的 PaddleOCR 模型提供 Hub 兼容的模型发现和分发,
与现有 PyTorch / Transformers 服务的更轻松集成。
当最大化 OCR 或文档解析吞吐量是首要任务时,PaddleOCR 的默认 paddle_static 后端通常是推荐的选择。
此版本不是关于用一个后端替换另一个。而是给开发者更多灵活性:使用 PaddleOCR 获得 OCR 和文档解析功能,并选择最适合你堆栈的推理后端。
在 Hugging Face Spaces 试用 PaddleOCR 3.5 Transformers 演示:
https://huggingface.co/spaces/PaddlePaddle/paddleocr-3.5-transformers-demo
在 Hub 上探索 PaddleOCR 模型:
https://huggingface.co/PaddlePaddle/models
PaddleOCR 3.5 将 OCR 和文档解析功能更接近 Transformers 中心工作流,同时给开发者自由构建周围更大的 Document AI 应用。
PaddleOCR 文档:https://www.paddleocr.ai/
PaddleOCR GitHub:https://github.com/PaddlePaddle/PaddleOCR
PaddlePaddle 在 Hugging Face 的组织:https://huggingface.co/PaddlePaddle
PaddleOCR 3.5 Transformers 演示(Spaces):https://huggingface.co/spaces/PaddlePaddle/paddleocr-3.5-transformers-demo
我们衷心感谢支持 PaddleOCR 3.5 Transformers 集成的 Hugging Face 工程师。
特别感谢 Anton Vlasjuk 的端到端参与,包括审查和合并所有相关的拉取请求。
我们也感谢 Raushan Turganbay 和 Yoni Gozlan 的宝贵 PR 审查和反馈。
他们的指导帮助改进了 Hugging Face 社区的集成质量、文档和开发者体验。
本文提到的 Spaces:1
更多来自此作者的内容
Hugging Face 上的 PP-OCRv6:从 1.5M 到 34.5M 参数的 50 语言 OCR
喜欢这篇文章和支持。
注册或登录以评论