☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

文 | 周鑫雨
编辑 | 张雨忻
《智能涌现》独家获悉,近期,腾讯混元多模态理解方向负责人胡瀚已正式提出离职,投身创业。
此前,胡瀚曾任职于微软亚洲研究院视觉计算组,担任首席研究员。2025 年初加入腾讯后,主导视觉大模型相关研究。随后在组织调整中,他转入大语言模型部下属的“Frontier”前沿技术研究组,专注多模态理解方向,向姚顺雨汇报。
值得注意的是,胡瀚亦深度参与了世界模型相关技术的探索与构建。
与此同时,腾讯大语言模型部负责人姚顺雨正密集推进团队结构优化——胡瀚原先所带领的研究小组,或将整体转向世界模型这一更具前瞻性的技术路径。
截至发稿,腾讯方面尚未就上述信息作出回应。
大语言模型仍是混元最核心的战略重心
自 2026 年年中起,混元体系内部的人事更迭持续展开。7 月初,前 OpenAI 研究院成员、麻省理工学院博士田永龙正式加入大语言模型部。据内部消息,他将接替胡瀚,牵头视觉语言模型(VLM)方向的研发工作,并向姚顺雨直接汇报。
自姚顺雨履新以来,“补齐能力短板、加速推动混元基座模型跻身第一梯队”,已成为腾讯 AI 发展的核心主线。
其中一项关键动作,便是重构资源分配机制——将顶尖人才与稀缺算力集中投向大语言模型部主导的基础模型研发。
例如,在 AI Lab 撤销后,其核心研发力量悉数并入大语言模型部;伴随姚顺雨上任,该部门的人才引进节奏也显著加快,包括来自字节跳动 Seed Infra 团队及后训练团队的多位骨干。
6 月 5 日,在腾讯云 AI 产业应用大会上,腾讯集团高级执行副总裁、云与智慧产业事业群 CEO 汤道生,曾以略带挑战的语气向姚顺雨发问:“外界普遍认为腾讯在 AI 领域起步偏晚,你是否认同这一判断?”
但事实上,“顺雨比公司高层更焦虑。”一位混元内部研究员向《智能涌现》透露。他指出,姚顺雨多次在高层会议上为混元争取额外算力支持。
另一处细节印证了其紧迫感:“晚点 LatePost”曾报道,在 Hy3 正式发布前一个月,一批关键训练数据出现异常。姚顺雨罕见地使用严厉措辞警示团队:“数据质量至关重要。若再发生同类问题,责任人立即离岗。”
重新评估多模态理解的价值边界
当各条 AI 技术路线尚未形成明显领先优势时,腾讯亟需对不同技术方向的投入产出比进行再校准。
一方面,胡瀚长期深耕的多模态理解技术已进入相对成熟阶段,进一步加大投入所能带来的边际收益正在快速收窄。
“当前文字、图像、视频识别准确率普遍可达 85% 以上,”一位多模态方向研究员表示,“真正的难点在于视觉推理——即让模型真正‘读懂’图像与视频背后的语义逻辑。而这一能力,单靠多模态建模难以突破,必须依赖语言模型底层推理能力的跃升。”
技术红利逐步消退的同时,多模态理解所能撬动的商业化路径也愈发模糊。
过去,该方向在腾讯 AI 架构中占据重要地位,主要源于计算机视觉技术可高效对接广告、游戏、长短视频等高变现业务板块。
但相较生成式 AI,多模态理解所支撑的“图像识别”“图文生成”等典型场景,缺乏清晰的付费转化路径。
“用户不会为‘识图’功能买单,市场上免费替代方案比比皆是。”一位元宝产品负责人坦言,真正具备付费意愿的,是文档摘要、PPT 自动生成、行业研报撰写等办公类刚需场景——这些能力背后,实则是模型在推理、代码生成、Agent 协作等方面的综合体现。
另一方面,腾讯在算力基建上的投入规模,相较字节、阿里仍处追赶态势。
2025 年财报显示,腾讯全年资本开支为 792 亿元;而截至 2026 年 3 月,阿里巴巴财年资本开支已达 1260 亿元;彭博社援引知情人士称,字节跳动计划在 2026 年将 AI 基础设施投入提升至最高 700 亿美元。
在资源总量受限的前提下,混元内部不可避免地面临“僧多粥少”的现实压力。此时,暂缓边际效益递减的多模态理解研究,将战略重心转向更具长期价值的世界模型等前沿领域,成为腾讯基于投入回报比做出的理性选择。
7 月 6 日,姚顺雨交出其加盟腾讯后的首份重磅成果:大模型 Hy3。在同等参数量级的中等尺寸模型中,Hy3 已可与 GLM-5.2、DeepSeek V4 Pro 等头部模型正面竞逐。
置于腾讯 AI 自身的发展坐标系中,姚顺雨上任半年来所推动的组织重构、基础设施(数据、Infra、评测体系)升级,以及回归基座模型的战略定力,已使混元初步具备冲击全球 AI 第一梯队的实力。
(《智能涌现》作者李炤锋亦有贡献。)











