7月24日,阿里巴巴正式对外开源文档理解模型ovisocr2。该模型在权威评测基准omnidocbench v1.6中斩获96.58分的综合成绩,刷新榜单历史最高分,成为首个在该基准上全面超越传统流水线方案、荣登榜首的端到端文档解析模型,标志着文档智能技术路线迎来关键性跃迁。
图 OvisOCR2 在 OmniDocBench v1.6 上的综合及分项表现。端到端架构首次实现榜单登顶
文档解析是大语言模型走向产业落地的核心支撑能力。无论是企业级知识库构建、RAG增强检索,还是多轮智能问答系统,其底层均依赖于将PDF、扫描图像等非结构化文档,精准、鲁棒地转化为机器可理解、可推理的结构化语义表达。
过往多年,行业主流采用“流水线式”解析范式:先由版面分析模块定位图文区域,再交由OCR、公式识别、表格解析等专用模型分别处理内容,最终拼接整合。该路径虽经长期打磨趋于稳定,却始终面临误差逐级放大、系统耦合度高、运维调试繁琐等结构性短板。
OvisOCR2另辟蹊径,聚焦页面粒度的统一建模,打造真正意义上的端到端文档理解模型:仅需输入单张文档图像,即可一次性生成严格遵循人类阅读逻辑的Markdown格式输出,完整涵盖正文、数学公式、结构化表格及图像标注等多模态语义要素。原本需多个异构模型协同完成的任务,如今在一个轻量模型内闭环解决。
在当前文档解析领域最具公信力的开放评测集OmniDocBench v1.6上,OvisOCR2以96.58分历史性突破,首次验证端到端范式在精度、鲁棒性与泛化性上的全面领先优势。
小模型大性能,0.8B参数达成SOTA水准
OvisOCR2基于Qwen3.5-0.8B进行深度后训练优化,整体参数量仅为0.8B。为突破小模型能力边界,研发团队构建了高效协同的数据引擎体系:真实采集文档保障页面布局与语义分布的真实性;高质量合成数据则定向覆盖多栏排版、公式嵌套表格、超长段落等典型难点场景。二者有机融合,显著提升模型在复杂业务环境中的适应能力。
PHP中文网提供Qwen-1.0.2.6 MacOS官方客户端下载,专为苹果电脑优化的阿里通义千问桌面应用。本版本深度适配Mac系统,支持本地高效运行与多模态交互,集成超长上下文处理、AI写作、代码生成及智能体构建等核心功能。通过官方渠道下载,确保安全稳定,助您实现智能办公与创作升级。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜
图 OvisOCR2 数据引擎体系训练策略融合监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)与模型集成四大关键技术,形成层层递进、能力叠加的多阶段训练范式,充分激发紧凑模型的表达潜力。
OvisOCR2以极简参数规模实现业界最优性能。相比动辄数十亿参数的通用大模型,或必须串联部署两个独立模型的传统流水线方案,它仅凭单一0.8B模型即达成SOTA效果。更低的GPU显存占用、更快的端到端推理延迟、更少的工程适配工作,使企业用户无需投入高端算力集群,即可享有顶尖文档解析能力。对于强调实效性与投入产出比的实际应用,OvisOCR2提供了“性能最强、成本最低”的开箱即用解法。
项目全面开源,深度融入千问技术生态
OvisOCR2已依据Apache 2.0协议完全开源,同步上线Hugging Face、魔搭(ModelScope)等主流AI开放平台,支持自由下载、研究及商业化部署。模型原生兼容vLLM等业界常用推理框架,并与Qwen3.5全系列推理栈深度对齐,开发者可零改造接入现有流程。
作为阿里云MaaS(Model-as-a-Service)平台的重点开源成果,OvisOCR2进一步拓展了通义千问模型家族在文档智能方向的能力边界,为开发者与企业用户打通从本地试用、定制优化到云端规模化服务的全链路支持。端到端方法首次登顶权威榜单,也预示着文档智能正加速告别高耦合系统工程时代,迈向更轻量、更统一、更高效的模型原生新范式。










