5 月 20 日,阿里云峰会盛大启幕,阿里巴巴集团副总裁、阿里云智能首席技术官、阿里巴巴合伙人周靖人现场宣布:通义千问 qwen3.7 系列大模型正式上线。其中旗舰型号 qwen3.7-max 定位为“全能智能体基座”,在代码生成、逻辑推理、多工具协同调用等核心能力上实现突破性跃升,并在多项国际权威评测中刷新国产大模型历史最佳排名。

综合性能方面,Qwen3.7-Max 登顶 Arena AI 全球大模型文本综合榜单第 13 名,力压 Gemini 3 Flash 与 GPT-5.5 等海外主流模型,成为该榜单前 15 名中唯一上榜的国产大模型。细分维度表现同样突出:数学能力位列全球第 7,编程能力位居全球第 10,专家级应用、软件工程及 IT 领域均稳居全球第 9。视觉方向,Qwen3.7-Plus 预览版在视觉综合榜单中排名全球第 16,助力阿里实验室视觉技术整体实力跃居全球第 5。在知识理解、逻辑推演等主流评测体系中,Qwen3.7 全面超越 Kimi K2.6、智谱 GLM5.1、DeepSeek V4 Pro、opus4.6-Max 等国内外最新竞品模型,持续领跑国内大模型梯队。
工具调用与编程能力成为本次迭代的核心亮点。Qwen3.7 编程智能体可支撑高复杂度工程开发任务,在 TerminalBench 2.0 测试中斩获 69.7 分,高于 DS-V4-ProMax 的 67.9 分;SWE-Pro 与 SciCode 编程基准测试得分分别达 60.6 和 53.5,均处于行业前列。尤为值得关注的是,在一项持续 35 小时、累计触发超 1000 次工具调用的长周期压力实验中,Qwen3.7 展现出卓越的稳定性与连贯推理能力,成功完成端到端任务闭环。办公自动化场景下,其在 SpreadsheetBench-V1 测试中取得 87.0 分,达到业界顶尖水准。









