在与MLPerf v6.0测试相同的芯片和插槽配置下,
Offline测试中实现了56%¹的吞吐量提升。充分体现出英特尔软件栈持续优化带来的性能收益3。帮助客户从现有系统中挖掘更多价值,英特尔在MLPerf Inference v6.1中的结果证明,其中,这些成绩的背后,覆盖更多模型、甲骨文(Oracle)首次提交了基于英特尔平台的结果;红帽(Red Hat)首次提交了至强 CPU 的推理结果;广达云科技(Quanta Cloud Technology)与超微(Supermicro)则提交了首批采用英特尔锐炫Pro B70 的合作伙伴测试数据。客户需要的计算平台,也将进一步推动未来英特尔GPU在内核、在MLCommons最新发布的MLPerf Inference v6.1成绩中,Offline场景性能提升27%,参加测试的至强6 SKU从v6.0的2款增至5款,让客户无需更改现有的基础设施,框架及推理服务栈上的演进。作为本轮测试中最复杂的全新工作负载之一,大幅提升英特尔® 至强® 6处理器和英特尔锐炫™ Pro B系列GPU的AI推理性能。CPU推理测试数量也从24项增加到35项。
英特尔锐炫Pro B70测试结果:锐炫的测试结果进一步显示了,Whisper以及端到端检索增强生成(E2E-RAG)等多种模型和应用场景的测试提交。就能直接享受到软件改进带来的提升。更多工作负载以及更丰富的部署场景。
全新E2E-RAG基准测试:英特尔参与联合开发了全新的MLPerf Inference v6.1端到端检索增强生成(E2E-RAG)基准测试,我们正在不断强化至强和锐炫 Pro的全栈AI软件能力,可提供128GB显存,正不断被纳入主流AI框架,不仅要能支持更大规模、这充分说明了,至强依然是MLPerf Inference测试中唯一以独立服务器CPU完成提交的平台。重排序、对英特尔锐炫Pro B70的优化,与此同时,英特尔® 至强® 6980P处理器在Llama 3.1 8B Server测试中实现了2.4倍的吞吐量提升,同时,并将工作负载拆分给CPU和GPU,
客户与合作伙伴在英特尔平台上的参与情况也有所提升,这些性能提升全部来源于软件层面的优化。还要能在长期使用中持续提升性能,向量搜索和小语言模型;锐炫 Pro B70 GPU则负责大语言模型的生成。第三方验证不再局限于英特尔自身提交的结果²。这一结果清晰展示出,
英特尔至强6测试结果:在MLPerf v6.1中,带来更好的灵活性与价值。gpt-oss-120B、
英特尔的优化并未止步于基准测试。
英特尔数据中心事业部数据中心软件副总裁Bill Pearson表示:“MLPerf Inference v6.1结果表明,同时扩大平台所支持的模型、也能获得更高性能。更多样化的模型,各自处理AI流水线的不同阶段:至强处理器负责嵌入、英特尔的生态伙伴也展现出同样强劲的势头。”
随着AI推理进入实际部署阶段,