在mlcommons
在与MLPerf v6.0保持完全一致的芯片型号与插槽配置前提下,英特尔®至强®6980P处理器在Llama3.1 8B Server测试中实现了高达2.4倍的吞吐量增长,在Offline模式下亦达成56%¹的性能跃升。尤为关键的是,所有性能增益均源自纯软件优化,无需更换现有硬件设备。这有力印证了:通过持续投入软件创新,客户可在不改变已部署基础设施的前提下,获得可观的性能升级。这一趋势同样体现在英特尔生态伙伴的积极实践中。
英特尔数据中心事业部数据中心软件副总裁Bill Pearson指出:“MLPerf Inference v6.1的成绩充分表明,稳健的软件优化能力,能够帮助客户从既有硬件中进一步挖掘性能潜力。我们正加速构建覆盖至强与锐炫Pro平台的全栈式AI软件体系,并不断扩大对主流模型、多样化工作负载以及各类系统形态的支持范围。”
随着AI推理迈入规模化落地阶段,用户对计算平台的需求已不再局限于单一性能指标,而是要求其具备支撑更大规模、更复杂模型的能力,同时支持长期演进与持续优化,从而提供更高的灵活性与投资回报率。英特尔在MLPerf Inference v6.1中所展现的成果,正是对这一诉求的有力回应:软件优化正成为释放存量算力价值的关键路径,助力客户实现CPU与GPU资源的横向协同扩展。
客户与合作伙伴在英特尔平台上的参与广度与深度同步提升——提交结果数量由v6.0的29项增至v6.1的39项,且第三方独立验证占比明显提高²。其中,甲骨文(Oracle)首次基于英特尔平台提交测试结果;红帽(Red Hat)首次以至强CPU完成推理性能提交;广达云科技(Quanta Cloud Technology)与超微(Supermicro)则率先提供了搭载英特尔锐炫 Pro B70 GPU的合作伙伴实测数据。
英特尔至强6测试成果:在MLPerf v6.1中,至强处理器的测试覆盖进一步拓展。参与测试的至强6 SKU数量由v6.0的2款增加至5款,CPU推理类测试条目也从24项提升至35项。与此同时,至强平台仍是MLPerf Inference测试中唯一以独立服务器级CPU身份完成全部提交的平台。
一款AI工具,主要用于在主代理响应前,并行运行Kimi K2.5和GPT 5.3 Codex,注入双方观点以增强认知多样性,适合需要提升相关任务效率的用户。
英特尔锐炫 Pro B70测试成果:锐炫系列的表现再次凸显软件优化对AI模型性能提升的重要作用。一套配备四块英特尔锐炫 Pro B70 GPU的单节点系统,拥有总计128GB显存容量,成功完成了包括Llama3.1 8B、Llama2 70B、gpt-oss-120B、Whisper,以及端到端检索增强生成(E2E-RAG)在内的多类模型与典型应用场景的测试提交。在与MLPerf Inference v6.0完全相同的四卡配置下,gpt-oss-120B在Server模式下性能提升36%,Offline模式下提升27%,充分体现了英特尔软件栈持续迭代所带来的切实收益³。
全新E2E-RAG基准测试:英特尔深度参与了MLPerf Inference v6.1新增的端到端检索增强生成(E2E-RAG)基准测试的设计与开发,并提交了完整测试结果。作为本轮测试中最具挑战性的工作负载之一,该测试系统采用一台英特尔至强6787P处理器搭配四块英特尔锐炫 Pro B70 GPU构成,将整体AI流水线任务智能拆分并分配至不同硬件单元:至强处理器承担嵌入(Embedding)、重排序(Re-ranking)、向量检索(Vector Search)及轻量语言模型推理;而锐炫 Pro B70 GPU则专注于大语言模型的文本生成任务。该结果清晰表明,经过深度调优的CPU与GPU可在完整的AI推理链路中实现
英特尔的优化实践远不止于基准测试本身。至强处理器相关的多项优化成果,正陆续集成至PyTorch、TensorFlow等主流AI框架中,使客户无需调整现有IT架构,即可无缝受益于软件层面的持续改进。针对锐炫 Pro B70的优化工作,也将为未来英特尔GPU在底层内核、上层框架适配及推理服务栈等方面的演进奠定坚实基础。











