显著提升万卡GPU训练性能，浪潮信息X400荣获"2024 DPU&AI Networking Awards"！

发布：来源：浪潮信息发布时间：2024-08-24 17:39
第一对焦：浪潮信息

2024 DPU & AI Networking创新大会日前在北京圆满落幕，大会表彰了在DPU与AI网络技术创新及实践应用中取得卓越成就的单位与项目。会上，浪潮信息「X400超级AI以太网解决方案」凭借领先的端网协同技术，显著提升了大模型训练效率，荣获"2024 DPU & AI Networking Awards 创新引擎奖"。

随着AIGC的发展，大模型的参数量越来越大，如何借助 AI 网络将上千台AI 服务器系统互联，充分释放算力资源的全部潜力，加速 AI 大模型训练，成为 AIGC 时代的新挑战。此次获得"2024 DPU & AI Networking Awards 创新引擎奖"的浪潮信息X400 AI Fabric专为AIGC场景打造，能够为用户构建可弹性扩展至524,288个GPU的超大规模AI系统，凭借AR自适应路由、端到端拥塞控制、亚毫秒级故障自愈等技术，性能提升至传统RoCE网络的1.6倍，实现了AI网络的超高吞吐量、高可扩展性和超高可靠性，极大提升大模型训练性能，大幅缩短训练时长并降低训练成本。

■ 端网协同，网络性能提升1.6倍：针对生成式AI场景下GPU之间会突发超高吞吐的通信特点，浪潮信息采用X400 + BF-3 SuperNICs的协同调度方式，通过自适应路由、报文保序、可编程CC等技术，实现交换机和网卡更紧密的配合，为AI大模型提供零丢包、无阻塞的全链路交换网络，机间互联性能高达400G，有效带宽从传统的60%提升到95%，性能提升1.6倍。同时，AI大模型训练的网络优化离不开NCCL通信库支持，X400 AI Fabric和InfiniBand一样，天然地与NCCL无缝衔接，能够为大模型提供顶尖的性能。

■ 灵活拓展、极致稳定，全力加速大模型训练：X400 超级 AI 以太网交换机凭借超高的端口密度以及弹性可拓展的能力，提供高性能、灵活可拓展的网络服务，支持大规模 AI服务器系统。其中，X400 AI Fabric在二层组网下，GPU服务器数量可达1024台，支持8,192张GPU卡，并可灵活拓展到三层组网，GPU服务器规模可达65,536台，最大支持GPU卡的数量可以达到524,288张。随着AI算力系统的规模不断攀升，对可靠性的要求越来越高，浪潮信息X400集成系统级的高可用技术，在硬件上独创IGE智能防护单元，对核心部件器件进行冗余备份，对关键硬件信号进行全面的监控和故障隔离，具有芯片级、系统级以及链路完整的监控，实时掌握AI节点间通信状态，实现对潜在的故障链路进行自动隔离，在上层应用无感的情况下实现故障自愈，全方位保障AI网络的极致稳定，降低大模型训练成本和周期。

■ 敏捷易用，部署周期从数周缩短到天：传统RoCE方案的网络建设中，交换机涉及一系列的拥塞控制配置，不仅配置繁琐，拉长部署周期，而且容易配置错误，导致训练性能下降。为此，X400超级AI以太网解决方案提供RTTCC拥塞控制算法，无需交换机的参与，避免在交换机上进行复杂的参数调优，即插即用，部署周期从数周缩短到天，加速业务上线，彻底解决调参复杂、配置困难等问题。

目前，X400超级AI以太网解决方案已经在互联网等行业实现测试应用。在大规模AI算力系统网络调度过程中，相比传统RoCE网络方案，性能提升1.6倍，带宽利用率超过95%，通信时延降低30%，并且在多租户AI Cloud场景中，NCCL通信性能提升1.5倍，同时，该方案通过其卓越的成本效益，助力客户大幅提高投资回报，实现成本与效益的完美平衡，为智算中心客户带来更快、更好、更省的网络业务体验。

自动对焦：人工智能 AIStation

咨询详情：如需咨询文中涉及的相关产品或解决方案详情，请加微信：ZiDongHuaX 。

微信联盟：人工智能微信群、AIStation微信群，各细分行业微信群：点击这里进入。

鸿达安视：水文水利在线监测仪器、智慧农业在线监测仪器　　　　　　金叶仪器：气体/颗粒物/烟尘在线监测解决方案

西凯昂：SMC气动元件、力士乐液压元件、倍加福光电产品等　　　　　山东诺方：颗粒物传感器、粉尘浓度传感器

深圳金瑞铭：RFID射频识别、智能传感器等物联网解决方案　　　　　　北京英诺艾智：容错服务器、边缘计算解决方案

显著提升万卡GPU训练性能，浪潮信息X400荣获"2024 DPU&AI Networking Awards"！

罗克韦尔自动化发布年度《智能制造现状报告：生命科学版》

国际可再生能源署在宁德发布其全球首份储能产业研究报告

DEKRA德凯昆山检测中心盛大启用，为中国市场注入新动能

延伸产业链，融合"文旅+"，新场景、新需求、新市场，上海国际游艇展预登记通道现已全面开启

汉高大中华区总裁到访西门子中国总部，共话可持续发展

鞍山钢铁总经理张红军一行来访中控技术

京津冀信创小镇正式启动，北京信创整机品牌软通华方重磅发布

IBM：用生成式AI解数据安全之急|人工智能和自动化技术有助于强化企业防御能力

中国信通院罗松：深度解读《工业互联网标识解析体系“贯通”行动计划（2024—2026年）》

阿里集团吴泳铭最新演讲：生成式AI终将接管整个数字世界

吴奇锋：探索智慧水务共创数智未来

2024WRC 傅盛：机器人的形态不一定要像人

华为运动健康发布玄玑感知系统，重新定义智能穿戴

探索低速无人驾驶的未来趋势

伊顿公司任命Paulo Ruiz为伊顿首席执行官，自2025年6月1日起生效

能抓取25公斤物体！估值最高人形机器人公司发布第二代产品

智能家居：TÜV莱茵扩充Matter授权测试实验室网络

5G RedCap"展翅高飞"，广和通助低空经济抢占先机

Omdia：到2027年，全球人型机器人出货量将超过10,000台，2030年将达到38,000台

关于征集人工智能国家标准起草单位的通知

显著提升万卡GPU训练性能，浪潮信息X400荣获"2024 DPU&AI Networking Awards"！

罗克韦尔自动化发布年度《智能制造现状报告：生命科学版》

国际可再生能源署在宁德发布其全球首份储能产业研究报告

DEKRA德凯昆山检测中心盛大启用，为中国市场注入新动能

延伸产业链，融合"文旅+"，新场景、新需求、新市场，上海国际游艇展预登记通道现已全面开启

汉高大中华区总裁到访西门子中国总部，共话可持续发展

鞍山钢铁总经理张红军一行来访中控技术

京津冀信创小镇正式启动，北京信创整机品牌软通华方重磅发布

IBM：用生成式AI解数据安全之急|人工智能和自动化技术有助于强化企业防御能力

中国信通院罗松：深度解读《工业互联网标识解析体系“贯通”行动计划（2024—2026年）》

阿里集团吴泳铭最新演讲：生成式AI终将接管整个数字世界

吴奇锋：探索智慧水务 共创数智未来

2024WRC 傅盛：机器人的形态不一定要像人

华为运动健康发布玄玑感知系统，重新定义智能穿戴

探索低速无人驾驶的未来趋势

伊顿公司任命Paulo Ruiz为伊顿首席执行官，自2025年6月1日起生效

能抓取25公斤物体！估值最高人形机器人公司发布第二代产品

智能家居：TÜV莱茵扩充Matter授权测试实验室网络

5G RedCap"展翅高飞"，广和通助低空经济抢占先机

Omdia：到2027年，全球人型机器人出货量将超过10,000台，2030年将达到38,000台

关于征集人工智能国家标准起草单位的通知

吴奇锋：探索智慧水务共创数智未来