从推理到训练:如何构建支撑大规模AI集群的高性能AIDC网络?
随着生成式AI、大模型和AI/ML应用快速发展,GPU集群正在从千卡级向万卡级甚至更大规模演进。GPU算力不断提升的同时,计算节点之间的数据交换也呈指数级增长。
在这一演进过程中,网络 正逐渐从**“连接算力的基础设施”,成为影响AI集群整体效率的关键环节** 。
对于大模型训练而言,GPU之间需要频繁进行梯度同步、参数同步以及All-Reduce、All-to-All等集合通信;而在大模型推理中,MoE架构带来的Expert Parallel会产生大量All-to-All流量,Prefill/Decode分离又会增加KV Cache跨节点传输。
因此,无论训练还是推理,AI计算都对网络提出了高带宽、低时延、高并发、零丢包和高可靠性的要求。
一、训练与推理双场景,对网络提出差异化挑战
大模型训练:网络影响集群效率上限
1、训练的本质
人工智能模型训练是教导神经网络识别数据模式的过程。模型会被输入大量带标签的数据集,通过反向传播反向调整内部参数,直到预测准确为止。
在分布式训练中,每个GPU处理自己的一批数据并计算局部梯度。然而,这些梯度是“局部”的,必须在所有GPU之间进行聚合和平均,以生成一个全球一致的梯度以更新模型参数。这一过程称为All Reduce。
AllReduce 过程包括两个步骤:首先,GPU在节点间交换并聚合梯度(Reduce)。聚合完成后,结果会广播回所有GPU,确保所有节点参数相同,然后进入下一次迭代。
这意味着在每次迭代中,所有GPU都必须完成全局同步,系统才能继续前进。如果一块显卡慢,整个集群就得等待。
实际上,随着模型规模扩大和GPU数量增加,每次AllReduce操作传输的数据量增加,等待成本也随之增加。这也是为什么AI训练集群对带宽、低尾延迟和无损传输提出了极高要求。
2、训练网络需求:带宽和规模优先
由于训练工作负载是同步且all-to-all的,主要的网络指标包括:
最大带宽:减少AllReduce通信时间
低尾延迟:一块慢的GPU会让整个集群停滞——瓶颈是尾延迟,而非平均延迟
无损传输:丢包迫使重传并破坏集体通信协调
扩展能力:训练集群规模从数百到数万块不等
大模型推理:从低延迟走向高弹性网络
1、推理的本质
人工智能模型推理是利用已经训练完成的模型,对新的输入数据进行分析、计算并生成结果的过程。与训练不同,推理阶段不再调整模型参数,而是直接调用已经学习好的知识,根据输入内容完成文本生成、图像识别、语音理解或预测决策等任务。
整个推理过程中需要持续执行大量张量计算和Attention计算,尤其是大语言模型生成内容时,每生成一个新的 Token 都需要经过模型进行计算。
在大模型推理过程中,用户输入首先被送入模型进行计算,随后模型根据当前结果不断生成新的 Token。由于生成过程通常是逐 Token 进行的,下一个 Token 的生成依赖于前一个 Token 的结果。当模型被拆分部署到多个 GPU 或多个服务器节点时,推理过程中的中间数据需要在 GPU 之间快速传输。如果网络延迟过高,或者发生拥塞,就会延长每个 Token 的生成时间,最终表现为首 Token 响应变慢、Token 生成速度下降以及并发处理能力降低。因此低延迟和高并发是驱动 AI 推理网络需求的关键因素。
2、推理网络需求:低延迟和高并发优先
人工智能推理是将训练好的模型部署到生产环境中,为用户提供实时服务。与训练不同,推理更加关注实时响应和业务连续性:
● 持续运行:只要用户活跃,24小时运行
● 延迟敏感:用户能感知每一毫秒的延迟
● 高度弹性的流量:请求量可能不可预测地激增
● 部署贴近用户:推理服务正从集中式数据中心向区域和边缘位置迁移
● 独立任务:请求独立,不需要全局同步
这也意味着推理需要稳定的低延迟、高可用性、高灵活性的网络 ,同时随着模型规模和推理集群规模不断扩大,推理网络同样开始对高速互联、智能负载均衡和网络拥塞控制提出越来越高的要求。
二、如何构建面向AI时代的高性能AIDC网络
AI数据中心网络建设并不是简单提升交换容量,而是一项围绕计算、存储、业务和管理体系的系统工程。
AIDC网络构建可以分为四大部分:
● 计算网络:也称为后端网络,为参数传递和同步提供高速通信服务
● 存储网络:为GPU服务器访问数据集和Checkpoint提供快速通道
● 业务网络:用于系统业务调度与管理
● 管理网络:为管理GPU服务器和存储服务器提供连接
其中,计算网络是影响AI集群算力释放的重要因素。

超擎数智AI 网络一体化解决方案
针对大规模GPU集群的高带宽、高并发通信需求,超擎数智围绕AI训练与推理场景,提供从网络架构设计、设备选型到高速互联与无损网络配置的一体化组网解决方案。
基于标准化的二层Leaf-Spine架构,结合高性能交换机、RoCEv2、PFC、ECN及智能路由等关键技术,构建高带宽、低时延、高可靠、可扩展的AI Ethernet Fabric,满足从千卡级到万卡级GPU集群的规模化部署需求。
三、典型计算网络组网方案
256台 CX8网卡服务器(8GPU)节点组网

采用超擎数智N9570-64OC 64×800G 51.2T以太网交换机搭建标准二层Leaf-Spine架构 ,单平面组网,交换机上下行带宽严格遵循1:1无损收敛比,使用轨道优化网络并划分为8个SU,搭配超擎数智800G OSFP光模块可支持256个8GPU服务器节点,适合快速部署上线,满足主流大模型训练需求。
1024台 CX8网卡服务器(8GPU)节点双平面组网

在二层Leaf-Spine架构基础上,通过CX8网卡以太模式 跑通双端口400G(每平面400G),在网卡与Leaf交换机间采用双平面组网 ,1块网卡接入两个平面的2台Leaf交换机,并采用多轨接入方式,每平面包含16个SU,搭配超擎数智800G OSFP光模块可支持1024个8GPU服务器节点。
四、核心网络设备:支撑AI集群高速互联
N9570-64OC:面向AI集群的51.2T高速以太网交换平台
作为AI Ethernet Fabric的核心网络节点,超擎数智N9570-64OC基于NVIDIA Spectrum-4交换芯片打造,提供64×800GE全线速转发能力,交换容量高达51.2 Tbps。
面向大模型训练、分布式推理、大规模AI计算场景,该产品支持RoCE无损网络、低延迟转发以及灵活端口拆分,可充分满足AI集群对高吞吐、高可靠通信的需求。
设备搭载冗余可插拔电源与风扇模块,支持热插拔与智能温控,具备工业级可靠性与长期稳定运行能力。通过与NVIDIA生态深度适配,N9570-64OC能够有效支撑AI训练集群、智算中心以及科学计算中心的高速互联需求。

核心特性:
● 64个800GE端口,采用4RU形态,交换容量高达51.2 Tbps,每个端口可支持2×400GE或4×200GE拆分。
● 基于NVIDIA Spectrum-4高性能芯片 ,提供多项关键技术,在转发性能、延迟、拥塞控制灵活性以及与NCCL协作优化等具备性能优势,更加适配NVIDIA生态。
● 支持无损数据中心RoCE和完整的 L2/L3 转发,支持端到端、无损、低延迟的RDMA。
● 支持AR+packet spray,支持AR+Flowlet流量调度方法。
● 支持硬件层级冗余保护,确保业务连续性和网络不中断运行。
● 支持丰富的链路可靠性技术,以最大限度减少网络故障影响并确保稳定运行。
高速光互联:释放AI网络带宽潜力
AI集群规模不断扩大,交换设备之间的高速连接成为网络性能的重要基础。
超擎数智提供覆盖交换机侧与网卡侧 的800G OSFP系列光模块方案:

五、结语:构建面向AI时代的网络基础设施底座AI时代的竞争,正在从单纯的算力竞争走向系统能力竞争。
一座高性能AI数据中心,不仅需要强大的GPU资源,更需要稳定、高效、可扩展的网络体系,将分散的计算节点连接成一个高效协同的智能计算平台。
从千卡训练集群到实时推理应用,从高速交换设备到800G光互联方案,网络正在成为释放AI算力价值的重要基础。作为AI原生基础设施产品和全栈方案提供商,超擎数智持续深耕AI算力、AI网络、AI互联、AI加速软件及集群设计交付与优化运营领域,为客户提供覆盖架构设计、设备选型、网络部署、性能优化与运营服务的一体化解决方案。
从一张网络,到一座AI工厂。
超擎数智持续推动存算网协同创新,让AI算力更加高效连接,让智能应用更加快速落地。


