7月24日,阿里巴巴正式开源一款参数量仅为0.8b的轻量级文档解析模型——ovisocr2。在业界公认的权威评测基准omnidocbench v1.6中,该模型以96.58的综合得分位居榜首,成为首个在各项指标上全面超越传统分阶段流水线方案的端到端文档理解模型,标志着文档智能技术迈入全新的范式变革阶段。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

作为RAG检索、智能问答及企业级知识库构建的关键底层能力,文档解析长期以来依赖“版面分析→内容识别”的多步串联架构,存在系统维护难度大、错误传播严重、工程部署繁琐等固有缺陷。OvisOCR2基于Qwen3.5-0.8B进行深度后训练,彻底摆脱流水线依赖,仅需单次前向推理,即可按人类自然阅读顺序,精准生成涵盖纯文本、数学公式、结构化表格及图像区域的完整Markdown格式输出。
PHP中文网提供Qwen-1.0.2.6 MacOS官方客户端下载,专为苹果电脑优化的阿里通义千问桌面应用。本版本深度适配Mac系统,支持本地高效运行与多模态交互,集成超长上下文处理、AI写作、代码生成及智能体构建等核心功能。通过官方渠道下载,确保安全稳定,助您实现智能办公与创作升级。
技术层面,模型采用真实文档数据与高质量合成数据协同增强的训练策略,并融合监督微调(SFT)、强化学习(RL)、在线策略蒸馏(OPD)以及多模型集成四大关键技术,充分挖掘小规模模型的表达上限与泛化能力。
当前,OvisOCR2已依据Apache 2.0开源协议,在Hugging Face平台与魔搭(ModelScope)社区同步开放全部代码与权重,原生支持vLLM等主流高效推理框架,可零改造接入千问(Qwen)全系生态。依托其“小体积、高精度、低开销”的特性,该模型显著降低了高性能文档解析对显存资源与计算硬件的要求,加速推动文档智能从繁复的系统集成模式,转向轻量、敏捷、可规模化的模型驱动新范式。










