superclue发布了腾讯hy3语言模型的编程专项测评数据,将其与deepseek-v4-pro等主流模型进行代码能力横向对比。hy3采用moe架构,总参数量达295b,但激活参数仅21b,支持256k超长上下文,被官方称为“混元系列最强语言模型”。值得注意的是,这款参数规模显著低于竞品的模型,在编程任务中展现出超出预期的实战表现。
四大维度深度对标,Hy3实现性能与成本双赢
本次测评聚焦国内开发者真实编码场景,每道题目均需经历数十轮交互——涵盖代码理解、逻辑分析、多轮修改与结果校验,高度还原日常开发中的调试闭环流程。评测从使用成本、响应速度、对话轮次、Token消耗四个关键维度展开量化对比,为开发者按需选型提供直观参考。
在代码能力综合得分上,Hy3高分版本斩获47.37分,与DeepSeek-V4-Pro并列第一。需强调的是,部分对标模型参数量高达Hy3的4–5倍,却未能形成明显优势,侧面印证其在模型结构设计与训练范式上的深度优化。成本控制尤为突出:单题平均调用成本仅0.43元,高频使用下仍保持极佳经济性,显著缓解商业化部署的预算压力。
单题耗时<400秒,40轮内闭环交付
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
运行效率方面,Hy3单题平均耗时不足400秒,稳居榜单前列,可充分满足实时编码、在线调试等对低延迟敏感的开发需求。交互效率同样优异——整套编程任务平均仅需40余轮对话即可完成,指令稳定性强,无需频繁重试或反复提示修正,收敛更迅速。此外,单任务Token消耗约116万,大幅降低云端算力占用,提升平台整体吞吐能力。
对依赖AI辅助编程的工程师而言,Hy3在能力上限与资源开销之间构建了罕见的平衡支点。当参数规模不再等同于实际效能,“小而精”的模型正以扎实数据表明:架构创新与训练策略升级,足以支撑其在编程赛道与顶级大模型正面交锋。随着Hy3正式以Apache 2.0协议全面开源,这场关于效率、成本与实用性的技术博弈,才真正拉开序幕。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜











