国产算力首次成功承载起万亿参数级别的大模型。海光信息正式宣布,kimi k3已在dcu平台上完成全栈适配与性能验证——这标志着,驱动此类超大规模模型的硬件选择,不再局限于少数几款国际高端芯片。
海光DCU从底层算子出发,逐层优化至推理引擎,模型代码无需任何修改即可直接运行,迁移成本近乎为零;开发者获得算力后可立即部署上线,兼容性表现极为稳健。针对KDA注意力机制与由896个专家构成的MoE架构,海光开展了深度定制化的算子级优化;即便在百万级上下文的高负载场景下,896个专家并行推理依然保持高效与稳定,全程无卡顿。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

从零搭建飞书机器人。支持 MiniMax/MiMo 等模型、工具调用(搜索/天气/百科/记忆)、Skill 架构。一站式交付可上线运行的飞书群聊 bot。基础版本,后续可自行升级能力
具体落地层面,K3在海光DCU上已能支撑长程智能体开发、视觉闭环内容生成,甚至自主芯片设计等前沿应用。国产算力用户如今也能真正本地化运行万亿级开源模型。值得一提的是,在K3正式发布前,月之暗面已联合海光与中科曙光完成了全面的兼容性协同调优:中科曙光基于海光DCU硬件体系,打通了Kimi MoE架构的分布式训练及多卡并行推理全流程;而海光DCU则依托硬件与软件栈的深度协同,在曙光8000集群中实现了长文本推理的平稳运行。
官方实测结果释放出明确信号:国产GPU相较国际旗舰芯片的性能损耗控制在12%以内,完全满足商业化部署要求。当万亿参数模型与国产GPU之间的那堵墙被悄然推开一道缝隙,智能时代的算力格局,正发生静默却深刻的位移。










