☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜
5月24日,字节跳动seed团队携手香港科技大学,共同推出一项面向多模态大语言模型(lmm)长文档训练的前沿研究成果。研究团队以阿里巴巴开源的
本研究的核心洞见直指当前LMM训练中的核心瓶颈:在多模态长文档场景下,采用问答对(QA)驱动的监督训练,其效果远超传统依赖OCR转录文本的训练方式。实验数据显示,单纯将图像中文字提取为纯文本并用于训练,不仅无法增强模型在超长上下文中的目标定位精度,反而引发显著性能退化;而若借助独立专用模型(如
依托这一数据策略优化,MMProLong 仅使用 128,000个Token 的训练开销,便展现出卓越的长文本鲁棒性——即便输入长度扩展至 256,000甚至512,000个Token,模型性能仍保持稳定,未出现明显衰减。在权威评测基准 MMLongBench 与 MM-NIAH(“大海捞针”)上,其表现大幅领先于 InternVL3-38B 和
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
该成果为当前大模型发展路径提供了全新视角——区别于 DeepSeek 等团队通过视觉表征压缩与架构重排序来提升长上下文能力的技术路线,本研究证实:仅通过对训练数据结构的精细化设计,无需修改模型底层结构,即可达成同等甚至更优的长程推理能力跃迁。这为构建支持更长模态序列、更复杂多步推理的智能体系统,开辟了一条更具成本效益与工程可行性的技术通路。










