阿里云今日宣布,正式开源其最新研发的文档解析模型OvisOCR2。该模型在OmniDocBench v1.6评测中以96.58分的综合成绩打破纪录,成为全球首个超越传统流水线方法的端到端文档解析模型,标志着文档处理领域迎来关键技术突破。
传统文档解析方案采用"流水线模式",需通过版面分析模型定位文字区域,再由内容识别模型提取具体信息,最后拼接输出结果。这种分阶段处理方式虽成熟稳定,但存在误差累积、部署复杂、维护成本高等问题,尤其在处理复杂版式文档时表现受限。
OvisOCR2创新采用端到端架构,仅需输入文档图像即可直接生成符合自然阅读顺序的Markdown格式输出,完整保留文本、公式、表格及视觉元素信息。这种"单模型多任务"设计将传统需要多个模型协作完成的工作整合为单一推理过程,在简化部署流程的同时显著提升处理精度。
技术实现层面,该模型基于Qwen3.5-0.8B架构开发,通过构建"真实数据+合成数据"的双引擎训练体系突破性能瓶颈。其中合成数据专门针对表格公式交织、多栏排版、长文本输出等复杂场景进行强化训练,配合监督微调、强化学习、策略蒸馏等四阶段训练流程,使这个仅0.8B参数的紧凑模型达到行业领先水平。
开源生态建设方面,OvisOCR2采用Apache 2.0协议开放源代码,已适配vLLM等主流推理框架,可无缝集成至Qwen3.5技术生态。开发者无需额外适配即可调用模型能力,快速构建企业知识库、RAG检索、智能问答等文档处理应用。
当前模型已通过GitHub等平台开放下载,配套发布包含详细训练方案的技术文档。阿里云表示将持续优化模型性能,重点提升对中文古籍、手写体等特殊文档类型的处理能力,推动文档解析技术向更高效、更智能的方向发展。


