7月29日,amd正式发布全新开源混合专家(moe)语言模型——instella-moe。该模型总参数量达160亿,每处理一个token仅激活28亿参数,在保持高性能的同时显著降低计算开销。
Instella-MoE全程依托AMD Instinct™ MI300X与MI325X GPU,结合ROCm™软件平台完成从零开始的端到端训练。模型创新融合Gated MLA(门控多头注意力)与FarSkip-Collective等前沿架构设计,大幅优化了训练吞吐与推理延迟。
AMD承诺全面开源Instella-MoE的完整训练成果,涵盖各阶段模型权重、超参配置、数据配比策略及训练代码,旨在赋能全球开源AI开发者生态。在多项权威基准评测中,其最终版本Instella-MoE-16B-A3B-Think展现出卓越综合性能,成为当前所有完全开源模型中平均得分最高的代表,尤其在复杂指令理解与精准执行能力方面实现突破性提升。
此次发布标志着AMD已构建起覆盖硬件加速、系统软件、模型训练与开源协作的全栈式AI模型开发体系,充分验证了其GPU与ROCm平台在超大规模MoE模型场景下的卓越扩展性与工程落地能力。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜












