☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

蚂蚁开源团队正式推出并全面开源百灵系列首款原生多模态大模型——Ling-3.0-flash-VL。该模型在 Ling-3.0-flash 的 MoE 架构基础上深度演进,整体参数规模达 124B,单次推理仅激活约 5.5B 参数,天然支持图像、文本与视频三类输入,并具备高达 256K Token 的超长上下文窗口。
研发过程中,团队聚焦于提升大模型在真实场景下的可靠性与执行效率。针对业内广泛存在的“视觉能力引入会削弱文本理解能力”这一担忧,实际训练结果展现出截然相反的趋势:原生多模态联合训练不仅显著拓宽了模型的应用维度,更同步强化了其文本理解与生成能力。
为增强任务执行的准确性,Ling-3.0-flash-VL 首创视觉反馈驱动机制。模型通过“观察执行输出→比对预设目标→识别偏差所在→自主调整策略”的完整闭环流程,将传统静态“一次性生成”升级为具备持续自检与动态优化能力的智能过程,从而显著提升最终输出的稳定性和可信度。
同时,该模型延续了 Ling-3.0-flash 在 Agent 工作流中作为高性能执行单元的核心特性。在视觉反馈闭环运行下,它可在保障高质量输出的同时,维持极高的响应效率与资源利用率,以更低计算开销和更短耗时,高效支撑端到端复杂任务的落地执行。











