随着hy3正式版的发布,一个月前姚顺雨与汤道生之间的那场对话,再度频繁出现在关于腾讯ai的各类讨论中。
6月初,在腾讯云AI产业应用大会上,腾讯集团高级执行副总裁、云与智慧产业事业群CEO汤道生,与腾讯首席AI科学家姚顺雨同台展开深度对谈。
当被问及外界对腾讯AI推进节奏的质疑时,姚顺雨笑着回应汤道生:“这问题好像该我来问你。”彼时听来像一句轻松调侃,如今回溯,却更像是腾讯AI内部权责结构的一次坦率亮相。
模型能力能否迎头赶上,由姚顺雨负责作答;而模型能力能否真正落地于产业、产品与营收,则需汤道生及腾讯各业务线共同交卷。
腾讯在AI产品化道路上起步并不迟滞,但其通用大模型在公众视野中的存在感始终偏弱——从主力AI助手“元宝”的演进路径中便可见一斑。2025年2月,元宝正式接入DeepSeek-R1满血版本,用户可在混元与DeepSeek-R1之间自由切换。
此后,混元团队虽陆续释放声量,但聚焦点主要集中于图像生成、视频生成与3D建模等垂直方向。混元图像、混元视频、混元3D系列均曾在开源社区引发热议,登上多项技术榜单,下载量屡创新高;然而这些技术热度,并未自然沉淀为用户对腾讯通用大模型实力的强认知。
这种不疾不徐的状态,直到今年被马化腾亲手打破。
5月的腾讯股东大会上,马化腾以“上了船,才发现漏水;现在站上去了,却还坐不稳”来形容腾讯AI当前处境,并坦承:公司在AI基础能力上的早期积累确实不够扎实。腾讯首次公开承认自己正处于“补课阶段”。
也正是在此背景下,姚顺雨被推至聚光灯下。
去年底,腾讯重构大模型研发体系,新设AI Infra部、AI Data部及数据计算平台部;姚顺雨出任“CEO/总裁办公室”首席AI科学家,同时兼任AI Infra部与大语言模型部双料负责人。
今年3月,腾讯正式裁撤AI Lab,部分核心成员并入大语言模型部,加入混元研发序列,并统一向姚顺雨汇报。
Hy3在多项基准测试中表现亮眼,但真实场景下的综合能力仍待持续验证。不过面对“掉队”的舆论压力,姚顺雨与混元团队,已率先帮腾讯AI稳住了第一层公众形象。
1
Hy3的“交卷”,首先体现在腾讯终于拿出了一份经得起产品检验的模型成果。
据腾讯官方披露,Hy3目前已集成至WorkBuddy、CodeBuddy、元宝、Marvis、ima等多款核心产品;自preview版本上线以来,日均Token消耗量激增20倍。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在WorkBuddy平台上,主动选择Hy3 preview的用户数量增长达6倍。内部办公场景测评显示,任务成功率由72%跃升至90%,平均耗时缩短34%。元宝借助Hy3上线文件交付功能后,常识性错误率下降50%,幻觉率降幅超50%。
在6月的腾讯云大会上,姚顺雨谈及模型与产品关系时强调:“实用性价值远高于刷榜价值。”Hy3正式版在实际产品中逐步形成正向反馈闭环,恰是这一理念最真实的注脚。
ima与Marvis同样提供了有力佐证。
公开信息显示,ima的知识库问答推理质量提升近19%,Agent系统稳定性达95.1%;Marvis在核心业务场景的任务完成率提升至93.7%,多Agent协同调度准确率达92%。
更早前的Hy3 preview版本,已在多个评测中悄然揭示其底层设计逻辑。
Hugging Face社区一篇技术分析文章将Hy3 preview部署于WorkBuddy真实办公环境进行实测:要求模型处理一份逾百页的技术手册,先完成长文档结构化知识抽取,再据此自动生成10道深度测试题,最终将题目、评分规则与答案解析打包为单文件HTML互动游戏。
在长文本理解与代码生成任务中,Hy3 preview展现出较快的信息处理速度、精准的复杂指令解析能力,以及清晰的任务拆解逻辑;在文本抽取环节,能有效识别文档关键节点;在代码生成环节,输出结果无明显Bug,首次运行即成功通过。
该案例直观解释了为何Hy3系列更适合嵌入WorkBuddy这类长链路办公场景中进行评估。
6月大会上,姚顺雨谈及加盟腾讯的动因时表示,这里“有大量优质问题,也有丰富的产品载体”。在他看来,预训练与后训练之后,模型究竟该服务于何种场景、创造何种价值,最终须由产品来定义与验证。
Hy3正式版,正是这一判断的首次集中兑现,也是混元团队组织重构后的首个重量级对外成果。
一个月前,汤道生曾在会上向姚顺雨提问:作为你在腾讯的首秀,Hy3 preview究竟带来了哪些实质性改变?
姚顺雨答道:“核心三点:其一,重建基础设施——涵盖预训练与强化学习全流程;其二,重构数据与评估体系——如何定义更贴近现实的问题、拓展数据分类维度、提升数据质量;其三,许多关键决策属于‘taste driven’,并无标准公式可循。”
他所强调的“定义真实问题”,从Hy3公布的大量实测反馈来看,正是本轮模型迭代的核心取向:让能力真正支撑起一线业务任务。而这恰恰是此前腾讯相对薄弱的一环。
姚顺雨还在会上透露,团队曾抽调“后训练最强骨干”支援元宝的后训练工作。
当时预训练尚未就绪,不少算法工程师对此安排存疑;但事后复盘发现,此举极大增强了产品团队对模型团队的信任感,也为Hy3 preview顺利落地元宝打下关键基础。
随后他补充道:“技术可以辩论,最难的是彼此信任与换位思考。”
这个细节,让外界对大厂模型“一号位”的角色认知更为立体——他不仅是技术领军人物,更是连接模型与产品、推动跨团队协同的关键枢纽。
而高举姚顺雨旗帜的腾讯,亦不遗余力地强化其外部影响力。
1月,姚顺雨出席腾讯青云奖学金颁奖典礼,为青年研究者颁发荣誉。首届青云奖学金面向15位青年学者提供总计50万元支持,含20万元现金资助与30万元异构云算力资源。
6月,“腾讯2026青云计划”正式启动,围绕AI大模型、基础架构与高性能计算等方向设立技术课题,鼓励青年人才深度参与混元、微信、游戏等前沿项目。
姚顺雨为腾讯AI树立的第一重人设,是专注夯实模型底座的形象;Hy3的诞生,终使腾讯AI拥有了可量化、可验证的阶段性成果。
2
对腾讯而言,Hy3无疑是一份亟需的答卷;但置于整个大模型行业坐标系中,它仍面临若干亟待突破的能力边界。
尤其值得注意的是,姚顺雨本人曾明确提出“唯最强模型方能赢得付费”的主张。
今年1月,在清华主办的AGI-Next峰会上,他在探讨To B市场时指出:“智能水平越高,生产力提升越显著,溢价空间也越可观。”

这位腾讯CEO首席科学家进一步阐释:企业客户对模型能力的付费意愿呈现显著头部效应;在编程等高频生产力场景中,低质模型带来的排错与监控成本,往往远超模型本身的价差。
回看此言,它反过来成为Hy3必须直面的压力源。
腾讯公布的270位专家盲测结果显示,Hy3平均得分2.67/4,略高于GLM-5.1的2.51/4。该成绩确证Hy3取得进步,但对比对象已是竞对上一代主力模型。
GLM-5.1早已非智谱当前主推版本,最新发布的GLM-5.2已支持百万级上下文窗口,并在Coding、Agent及长程工具调用等方面实现全面跃升。
换言之,Hy3证明腾讯已奋力追近一段距离,但距离国产模型第一梯队仍有差距。
6月大会上,姚顺雨谈及性价比时,明确将性能置于成本之前。他指出:“很多人最终发现,采用Opus这类高性能模型反而更省钱——因为一次就把事做对,节省了大量人力成本。”
他进一步拆解:性价比之“性”为先,“能”字当头;若性能不足,所谓“性价比”便无从谈起,成本优化更成空谈。
这句话同样适用于审视Hy3:低价策略与低激活参数虽利于快速获客,但企业客户最终买单的,是“一次做对”的确定性能力。
在此维度上,Hy3尚需更多真实B端场景的长期验证。
Hy3的第二重能力短板,在于原生多模态能力的缺席——这一问题在历代Hy通用模型升级讨论中持续被提及。
作为主打办公场景的Agent底层引擎,现实中用户的输入绝非仅限于纯文本:PPT版式调整、Excel图表识别、网页后台图标状态判别……皆属常态。
若Hy3无法直接解析视觉信号,则不得不依赖混元多模态模块或OCR等中间层工具协同处理。
这一缺陷在腾讯自身生态中尤为敏感,尤其是Hy3未来或将接入微信等C端入口。用户提交给AI的原始材料,常常并非规整文本,而可能是一张截图、一份扫描件,甚至一段模糊录屏。
与此同时,混元的主要对手已在原生多模态赛道深耕多年。
数周前,火山引擎发布豆包2.1 Pro。公开报道显示,其在Coding、Agent与VLM(视觉语言模型)三大方向同步升级;发布会上展示的芯片设计RTL测试案例中,模型连续运行近18小时,历经9轮迭代,完整跑通仿真、测试与综合验证流程。
在一个3D虚拟城市构建案例中,依托豆包2.1 Pro,实现了500余个智能Agent协同运作,完成上千次工具调用,生成超百栋建筑实体。
阿里近期推出的Qwen3.7-Plus,亦延续统一视觉与语言表征的多模态Agent路线,兼容图像、视频、屏幕、网页及文本输入,并支持GUI操作、命令行交互与工具环境任务执行。
相较之下,Hy3目前仍是一份纯粹的语言模型答卷。
6月大会上,姚顺雨展望AI未来时坦言:“AI是一场长跑,下半场才刚刚启幕。”他还指出,Coding Agent、多模态与具身智能将持续演进。
但从Hy3当前展现的能力图谱来看,腾讯已握有进入下半场的入场券,却尚未拿到决胜终局的密钥。
而在AI产业竞争格局中,模型固然是所有能力的根基,但它无法单独回答一家公司AI业务发展的全部命题。
3
姚顺雨交出Hy3这份阶段性答卷,但腾讯AI是否真正提速,还需观察整个组织如何放大这一代模型的价值势能。
回望那句“感觉应该是我问你的问题”,它不仅抛向汤道生,更指向马化腾、微信团队,以及所有期待AI赋能的业务单元。应用层能否让用户切实感知变化,远比参数发布更具说服力。
姚顺雨在《The Second Half》中写道:AI下半场将从“解决问题”迈向“定义问题”。落于腾讯语境,即转化为另一重叩问:坐拥微信、游戏、广告、办公与云等庞大业务矩阵,腾讯究竟该优先定义哪些AI问题?
过去三个月,腾讯在B端与C端同步加速。
6月,腾讯云AI产业应用大会发布效率智能体工具集:个人侧升级QClaw、WorkBuddy、元宝、ima与腾讯文档;企业侧推出WorkBuddy企业版,并同步升级ClawPro、ADP与企点营销云。
伴随Hy3正式发布,上述产品均已迎来新一代模型底座。
Hy3正逐步渗透腾讯核心业务场景。微信公众号AI分身与客服专项评测中,意图识别准确率达98.94%;微信读书标签标注准确率较Hy3 preview提升14.1%;WeGame《流放之路:降临》AI游戏助手接入Hy3后,多轮推理与工具调度综合成功率升至92%,幻觉率由4.5%降至2.8%。
这些数据表明,Hy3正向腾讯核心生态持续外溢,但这远远不够。微信、游戏、广告与企业服务能否将其转化为高频刚需任务,将决定腾讯AI能否从阶段性成果升维为长期品牌认知。
5月股东大会上,马化腾坦言腾讯虽已“站上去”,却仍“坐不稳”。所谓“坐不稳”,不单源于模型能力尚待加强;更深层的挑战在于:应用层能否将模型能力切实转化为用户体验升级与商业价值增量。
而在云厂商正面交锋的AI云战场,竞争态势亦日趋白热化。
字节方面,火山引擎此前披露,豆包大模型日均Token调用量突破180万亿,一年内增长超10倍;IDC数据显示,火山引擎在中国公有云MaaS服务市场份额达49.5%。模型调用量,已成为云市场心智建设的关键指标。
Omdia《中国AI云市场份额2025》报告显示,2025年中国AI云市场规模约567亿元。其中阿里云以38.1%份额居首,火山引擎以20.4%位列第二,百度云、腾讯云、天翼云分列第三至第五,腾讯云市占率仅为个位数。
而在云之外,腾讯面临的命题更为复杂:微信、游戏与广告均在积极探寻AI新增量。Hy3展现出不俗的Agent能力,但如何挖掘出真正具备C端高粘性的使用场景,仍是相关产品团队亟待厘清的课题。

1月AGI-Next峰会上,姚顺雨谈及C端竞争时指出:模型不仅要回答问题,更要掌握额外Context。
他举了一个日常例子:“比如问‘今天吃什么’,今年问和去年问,答案理应不同。”模型需实时感知用户状态、地理位置、偏好倾向与历史行为,才能输出真正贴合个体情境的回答。
这句话落在腾讯身上,意义尤为凸显。微信、元宝及各类游戏场景,天然拥有海量Context供给能力;但在过去几年中,尚未孵化出能在C端引发广泛声量的标杆级AI应用。
而这个问题的答案,姚顺雨与混元团队只能提供部分解法。AI产业从来不是单一模型一号位工程,而是企业技术纵深、资本耐力与产品组织力的综合较量。
本文来自微信公众号 “字母榜”(ID:wujicaijing),作者:李炤锋,36氪经授权发布。











