从AI集群到Token工厂:超擎数智企业级Token Factory全栈交付实践
随着大模型应用从技术探索逐步迈向企业生产阶段,企业关注的重点不再只是 GPU 数量和计算规模,而是如何将底层计算资源、高性能网络及软件平台能力融合,形成稳定、高效、可持续运营的 Token 生产能力。
这意味着,AI基础设施建设的核心目标正在发生深刻变化。企业需要建设的不再是一套GPU集群,而是一套面向AI生产的新型基础设施体系——AI Factory,或者更具体的说,Token Factory。
在这一背景下,某企业启动Token Factory建设项目,希望打造一套面向大模型训练、推理及智能应用场景的AI基础设施平台,实现从底层算力资源到模型服务、再到Token输出的完整生产链路。
1. 项目背景:构建面向 Token 经济的生产体系
本项目围绕21台计算服务器建设高性能AI计算集群,每台服务器配置8路400G InfiniBand高速连接,网络采用二层Spine-Leaf架构,由4台Spine、6台Leaf,共10台NVIDIA Quantum-2 NDR InfiniBand交换机组成,并配置双UFM管理节点,构建面向大规模AI工作负载的高带宽、低时延计算网络。
超擎数智基于自研CQIS AI集群全生命周期交付体系,为客户提供从架构设计、基础设施建设、网络调试到平台上线的一站式服务能力 。区别于传统硬件部署项目,本次建设目标并非简单完成设备安装,而是通过端到端工程交付能力,将服务器、网络、软件平台进行统一规划,实现从设备资源到AI算力、再到模型服务、最终实现Token生产能力的价值转化。这不是一次简单的采购和部署,而是一次面向AI生产的系统性工程建设。
2. 需求分析:Token Factory 建设的三大核心挑战
Token Factory建设本质是一项涵盖计算、网络、软件及工程实施的系统性工程,客户面临的核心挑战集中体现在三个维度。
构建高性能 GPU Scale-out 计算网络
大模型训练及推理业务具有明显的分布式计算特征,多节点GPU之间需要进行大量数据交换和集合通信,网络性能直接影响整体计算效率。
因此,客户需要建设一套具备高带宽、低时延、多路径通信能力的高性能InfiniBand Fabric ,同时这套网络还需要具备高可靠性、横向扩展能力以及统一管理能力,为大规模AI工作负载提供稳定的数据通信基础。
实现 AI 集群标准化工程交付
AI集群不同于传统IT环境,服务器数量多、高速链路密集、网络拓扑复杂。项目不仅需要完成服务器上架、设备安装和线缆连接,更需要建立完整的:设备编号、端口Mapping、光模块、光纤链路到网络拓扑的管理体系 ,保证物理环境与逻辑架构一致。通过标准化实施流程,降低复杂AI基础设施建设过程中的交付风险,避免“建得起来、用不起来”的情况。
建立算力资源管理与 Token 服务能力
单纯建设GPU集群并不能直接产生业务价值。客户需要进一步将底层服务器、GPU资源、模型资产和推理服务进行统一管理,实现从基础算力到AI服务能力的转换。
这需要通过软件平台打通从GPU资源池到模型、再到推理服务、最终到Token服务的完整链路 ,让算力真正服务于业务应用,让Token能够持续、稳定、高效地生产出来。
3. 解决方案与设计:双轮驱动的交付模式
针对客户Token Factory建设目标,超擎数智采用CQIS标准化交付体系 + AI Driver管理平台的双重能力模式 ,构建从基础设施到AI应用的完整交付闭环。在这套架构中,GPU服务器作为计算引擎,InfiniBand Fabric作为高速数据平面,UFM作为网络管理平面,AI Driver人工智能推理平台作为资源与模型服务控制平面,最终形成企业级Token Factory。这是一套完整的生产体系,而不是孤立的设备堆砌。
前期方案设计:建立整体架构基线
项目启动阶段,CQIS服务团队围绕客户业务目标和基础设施规模开展架构设计。设计内容涵盖GPU计算节点规划、Spine-Leaf网络拓扑设计、IB高速链路规划、光模块及线缆配置、软件平台部署规划以及端口Mapping和实施方案设计。通过前置架构规划,将计算、网络和软件能力统一设计,避免传统项目中设备建设与业务应用割裂的问题,为后续整个项目的交付质量和系统可用性奠定基础。
基础设施部署:完成计算环境建设
项目现场按照设计方案完成服务器及网络设备部署,实施内容包括:服务器上架安装、设备上电检查、硬件状态确认、管理网络配置以及设备资产信息整理。同时,通过标准化机柜布局和设备管理方式,建立后续网络实施和平台部署所需的基础环境。
高性能 IB Fabric 建设:打造 AI 数据高速通道
针对大模型计算场景对于节点间通信的高要求,项目采用NDR InfiniBand网络架构,通过Spine-Leaf网络设计,实现计算节点之间高速互联。项目按照既定网络拓扑完成Spine-Leaf、Leaf-Server高速链路部署,以及OSFP光模块、MPO光纤和端口Mapping的标准化实施,并在物理链路完成后开展IB Fabric联调与验证。最终形成面向GPU Scale-out的高性能计算网络,为模型训练和推理业务提供稳定的数据交换能力。在大模型时代,网络不再只是"连接",而是决定算力能否充分释放的关键因素。
UFM 部署:实现网络可观测与运维管理
为提升InfiniBand网络长期运营能力,项目部署双UFM管理节点,对整个Fabric网络进行统一管理。通过UFM,运维人员能够更加直观掌握网络拓扑、设备状态及链路运行情况,为后续故障定位、性能分析和集群扩展提供支撑。网络能力由此实现质的飞跃,从Link Connected(链路连通)升级为:Fabric Managed + Operational Ready(可管理、可运营) 。这意味着,网络不再是“能用就行”的黑盒,而成为可观测、可分析、可持续优化的生产要素。
AI Driver 人工智能推理平台:实现算力服务化
-完成基础设施建设后,项目进一步部署AI Driver人工智能推理平台,将底层计算资源转化为可管理、可调用的AI服务能力。平台支持:计算资源统一管理、模型资产管理、推理服务发布、用户权限管理、智能任务编排等核心功能。
通过AI Driver人工智能推理平台,客户可以完成模型导入、推理实例创建以及服务调用,实现从物理GPU到资源池、模型服务,再到Token输出的完整业务闭环。这一步完成了关键转变,将传统以“设备为中心”的资源管理模式,升级为“以模型服务和业务负载为中心”的AI生产管理模式。
CQIS 全生命周期交付:保障系统稳定运行
针对企业AI集群建设过程中的复杂工程问题,超擎数智通过CQIS服务体系提供覆盖全生命周期的交付能力。服务范围包括:前期方案设计、硬件适配与部署、高速网络建设、集群调试验证、平台环境实施、性能审计优化以及持续运行保障。通过标准化交付流程和专业化实施能力,降低AI基础设施建设复杂度,帮助客户快速完成从基础设施建设到AI业务上线的转变。
4.项目成果
通过项目实施,客户完成了Token Factory基础设施从架构规划、物理部署、高性能网络建设到软件平台上线的整体交付,取得了五个层面的关键成果。
完成Token Factory基础设施整体交付
完成21台计算服务器高速互联建设,形成基于NDR InfiniBand Fabric的AI计算基础环境。通过Spine-Leaf架构,实现计算节点间高效通信,为后续模型训练、推理及智能应用提供底层支撑。



建立标准化高速网络工程基线
项目基于前期端口规划完成服务器、Leaf、Spine及UFM之间高速链路建设,并通过端口Mapping和链路矩阵保证物理网络与逻辑设计一致。由此形成可追踪、可核验的网络连接基线,为后续系统维护、链路故障定位及扩容提供工程基础。

构建可管理、可运营的NDR Fabric
通过网络调试和UFM部署,客户获得的不再只是高速链路连接,而是一套具备集中管理基础的 IB Fabric。从物理网络、网络拓扑到管理平台形成完整链路,使GPU计算网络具备长期运营和持续扩展的基础能力。

完成从硬件资源到AI服务能力的转化
通过AI Driver人工智能推理平台建设,客户实现了计算资源、模型资产和推理服务统一管理。基础设施不再只是服务器和GPU,而成为能够持续输出AI能力的生产平台。

打通端到端Token生产链路
通过底层基础设施与AI Driver软件平台集成,项目形成:GPU Compute → NDR Fabric → Resource Pool → Model → Inference Service → Token的完整技术链路。
客户不仅具备GPU计算基础设施,同时具备模型准备、服务发布、任务执行和结果管理能力。Token Factory 由此具备生产条件。

5.Token经济学视角下的客户价值
当前,企业竞争力不仅取决于模型能力,更取决于如何以更低成本、更高效率持续生产Token。超擎数智围绕Token生产效率进行整体优化,通过"AI Driver 智能管理 + CQIS 标准化交付能力 + 高性能计算基础设施"三位一体协同,实现算力资源与模型服务的高效匹配。
一方面,通过AI Driver人工智能推理平台,对模型服务和硬件资源进行统一调度,提高资源利用效率;另一方面,通过CQIS在集群部署、网络架构优化和性能调优方面的能力,减少大规模推理场景中的通信瓶颈和资源损耗。
最终帮助企业实现更高的算力利用率,让每一块GPU发挥最大价值;实现更稳定的模型服务能力,保障业务持续运行;实现更低的Token生产成本,提升AI应用的经济性;实现更持续的AI业务运营能力,构建长期竞争力。
大模型时代,企业需要的不只是一个模型,而是一套能够持续运行、不断优化、自我演进的AI生产体系。这套体系不是简单购买设备就能建成的,也不是单纯部署软件平台就能实现的,而需要对AI计算场景的深刻理解、对高性能网络的专业能力、对复杂工程项目的交付经验,以及对软硬件协同的系统性设计。
超擎数智作为AI原生的基础设施产品和全栈方案提供商,帮助企业打通大模型落地过程中的关键环节,加速建设高效稳定的AI Token Factory。从GPU集群到Token工厂,从设备堆砌到生产体系,这不仅是技术能力的提升,更是企业AI战略的升级。超擎数智将持续为企业构建可持续运营、可持续优化的AI生产体系基础支撑。


