0.9B小模型实现多语言文档解析,精度快又省资源
PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model
- 用0.9B小模型融合视觉与语言,支持109种语言
- 在109语言上达到顶尖性能,识别文本/表格/公式等元素准确
- 适合实际部署,推理快且资源消耗极低
本文提出PaddleOCR-VL,一种面向文档解析的领先且高效模型。其核心为PaddleOCR-VL-0.9B,一个紧凑但强大的视觉语言模型(VLM),融合了基于NaViT风格的动态分辨率视觉编码器与ERNIE-4.5-0.3B语言模型,实现精准元素识别。该模型高效支持109种语言,擅长识别复杂元素(如文本、表格、公式和图表),同时保持极低资源消耗。在多个公开及内部基准上进行全面评估,PaddleOCR-VL在页面级文档解析和元素级识别任务中均达到当前最优表现,显著优于现有方案,且在与顶级VLM对比中表现出强竞争力,推理速度迅速。这些优势使其非常适合真实场景中的实际部署。代码已开源:https://github.com/PaddlePaddle/PaddleOCR。
原文摘要 · Abstract (English)
In this report, we propose PaddleOCR-VL, a SOTA and resource-efficient model tailored for document parsing. Its core component is PaddleOCR-VL-0.9B, a compact yet powerful vision-language model (VLM) that integrates a NaViT-style dynamic resolution visual encoder with the ERNIE-4.5-0.3B language model to enable accurate element recognition. This innovative model efficiently supports 109 languages and excels in recognizing complex elements (e.g., text, tables, formulas, and charts), while maintaining minimal resource consumption. Through comprehensive evaluations on widely used public benchmarks and in-house benchmarks, PaddleOCR-VL achieves SOTA performance in both page-level document parsing and element-level recognition. It significantly outperforms existing solutions, exhibits strong competitiveness against top-tier VLMs, and delivers fast inference speeds. These strengths make it highly suitable for practical deployment in real-world scenarios. Code is available at https://github.com/PaddlePaddle/PaddleOCR .
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。