ODCC AI存储实验室 | 超擎数智高性能算网环境赋能,星辰天合MeshFusion深度评测

技术文章

随着大模型推理需求爆发式增长,KV Cache存储已成为AI基础设施的核心瓶颈之一。为系统评估KV Cache专用存储方案的技术成熟度与场景适配能力,ODCC AI存储实验室持续深耕前沿验证工作。

ODCC AI存储实验室联合超擎数智、XSKY星辰天合、大普微完成MeshFusion KV Cache存储系统全面测评

随着大模型推理需求爆发式增长,KV Cache存储已成为AI基础设施的核心瓶颈之一。为系统评估KV Cache专用存储方案的技术成熟度与场景适配能力,ODCC AI存储实验室持续深耕前沿验证工作。

近期,实验室基于超擎数智提供的高性能算网环境与全栈技术服务能力,联合XSKY星辰天合、大普微,完成了面向多形态部署、多模型架构、多存储策略的KV Cache存储系统全面测评。

本次测试以XSKY星飞推理存储系统MeshFusion为评测对象,验证其在推理场景下的性能表现与规模化落地能力。

1 测试方案:多种部署形态,覆盖多元场景

XSKY星飞推理存储系统MeshFusion是专为推理场景设计的存储扩展系统,围绕KV Cache的数据特征进行深度自研,兼顾G3本地盘共享能力与G4高速访问性能,并兼容主流算力生态。系统采用极简基础架构设计,融合智能网络引擎,原生支持KV Cache接口,具备良好的可扩展性与适配性。

在部署方式上,MeshFusion支持多种灵活形态:

  • 直接嵌入现有GPU/NPU服务器:系统可复用服务器自带的闲置NVMe盘,通过高速RDMA组建集群级共享KV Cache存储池,打破本地SSD的孤岛限制。该方式无需额外采购独立存储服务器,改造投入低,适用于已有算力集群的轻量化升级。
  • 部署于DPU速卡:在此模式下,KV Cache数据流绕过主机CPU与内存,经由DPU直达GPU显存,实现CMX近存计算架构。配合JBOF全闪硬件构建大容量高速共享存储池,并依托Spectrum-X高速网络,可满足推理任务对高带宽、低延迟的严苛要求,尤其适合中大型规模化推理Token工厂的部署需求。
  • 独立集群部署:基于该系统可独立构建专用的存储集群,能够高效承载海量训练数据集与推理过程中的KV Cache,为企业AI基础设施提供高性能、可扩展的统一存储底座。

图片:MeshFusion架构图

2 测试环境:一套环境,验证多种方案

总体概述

本次测试聚焦于验证推理过程中Prefill阶段及Prefill-Decode混合阶段的性能表现,覆盖DeepSeek-R1、Qwen3-235B、DeepSeek V4与GLM-5.1等主流大模型。在推理架构层面,测试同时纳入了PD一体与PD分离两种主流方案,以评估不同调度策略下的效率差异。

硬件配置上,选用高端HBM GPU服务器与中端GDDR GPU服务器两类算力节点,以兼顾高吞吐与高性价比的部署需求; 存储系统除采用传统X86存储服务器外,还引入了基于NVIDIA BlueField-3 DPU的JBOF全闪硬件,着力探索类似NVIDIA CMX的前沿近存计算架构。

上述多维度的组合设计,有效覆盖了业界当前主流以及未来演进中的各类硬件部署形态,为推理存储系统的实际选型提供了坚实的数据支撑。

图片:测试环境网络拓扑架构图

方案介绍

本次测试具有四种方案组合,具体如下表所示。

图片 备注:Prefill-Only测试是output_len=1,Prefill-Decode测试是output_len=200

  • A:高端HBM GPU服务器+X86存储服务器 验证MeshFusion在“独立集群部署”下的KV Cache卸载性能。

    图片:方案A拓扑架构图

  • B1:高端HBM GPU服务器+JBOF节点 验证MeshFusion在“BlueField-3 DPU+JBOF 部署(NVIDIA CMX 架构)”下的KV Cache卸载性能。

    图片:方案B1拓扑架构图

  • B2:中端GDDR GPU服务器+JBOF节点 验证MeshFusion在使用“NVIDIA GDR(GPU Direct RDMA)”下的KV Cache卸载性能。

    图片:方案B2拓扑架构图

  • C:高端HBM GPU 服务器+中端GDDR GPU服务器+X86存储服务器 验证MeshFusion在“PD分离场景”下的KV Cache卸载性能。其中P节点和D节点之间的KV Cache传输使用NixlConnector,KV Cache卸载使用MeshFusion SDK。

    图片:方案C拓扑架构图

3 核心成果:创新架构,国内领先

国内首个实现类似NVIDIA CMX架构的KV Cache存储方案

基于XSKY MeshFusion的轻量化架构,将其部署于BlueField 3 DPU中,实现了KV Cache数据与GPU显存的直通,架构如图所示。

图片:DPU+JBOF部署架构图

在此架构上,本次测试以方案B1为基础,针对JBOF存储后端开展了Prefill-Only场景的测试,重点对比KV Cache命中(Warm)与重算(Cold)的性能差异。结果表明,卸载KV Cache带来的收益极为显著:TTFT从数十秒锐降至命中后的百毫秒甚至数秒,尤其在长序列场景中降幅最大;而吞吐量(TPS)则整体提升了一个数量级(达10至28倍),在Cache命中时普遍稳定在7万至10万Tokens/s。上述数据充分证明,基于DPU+JBOF构建的、形态类似NVIDIA CMX的存储架构,能够高效承载KV Cache卸载,为企业AI推理提供坚实的性能支撑,测试数据详见下图。

图片:JBOF后端·Prefill-Only: Cold vs Warm性能对比(DeepSeek-R1,EC 4+2:1,1.6T)

为验证基于DPU的JBOF后端能否等效替代X86存储后端,AI存储实验室在相同条件下对方案A(X86)与方案B1(JBOF)进行了Prefill-Only以及Prefill-Decode一体对比测试,结果分别如图9和图10所示。

在Prefill-Only测试中,两者的TTFT加速比与TPS加速比高度接近,在KV Cache卸载负载下性能表现基本持平,由此充分证明基于DPU的JBOF后端完全可作为X86存储的可靠替代方案,为实际部署提供了更具灵活性的硬件选择。

图片:X86 vs JBOF后端·Prefill-Only: 加速比对比(DeepSeek-R1,EC 4+2:1,1.6T)

在Prefill-Decode一体测试中,以每秒完成请求数(req/s)衡量端到端吞吐,X86存储后端与JBOF后端的加速比依然相似。这进一步说明JBOF后端在真实推理负载(含Decode阶段)下同样可用,“基于DPU的JBOF后端”方案具备生产部署条件。

图片:X86 vs JBOF后端·Prefill-Decode: req/s加速比对比(DeepSeek-R1,EC 4+2:1,1.6T)

在方案B2的基础上,本次进一步开展了GPUDirect RDMA(GDR)技术的KV Cache卸载测试(Prefill‑Only场景)。通过在GPU服务器部署Qwen3‑235B模型进行推理,并在4块BlueField‑3 DPU上安装MeshFusion SDK,构建GDR直通链路。本次测试着重对比了KV Cache命中(Warm/Run2)与重算(Cold/Run1)的性能。

结果表明,吞吐量(TPS)从重算时的约800 tokens/s跃升至命中后的4万 tokens/s以上,如图11和图12所示。这一结果充分验证了GDR读写路径打通后,KV Cache卸载在GPUDirect方案下能够带来数量级的性能收益,证明该技术路线在高效推理场景中的巨大潜力。

图片:GDR方案·Prefill Only: Cold vs Warm性能对比(Qwen3-235B,RTX6000 DPU+JBOF,4GPU+4DPU) 图片:GDR方案·Prefill Only:KV Cache卸载加速比(Qwen3-235B,长序列峰值58×)

基于BlueField-3 DPU的JBOF的成功,可以证明XSKY MeshFusion具备平滑移植到 NVIDIA CMX平台的能力,发挥出分布式KV Cache存储软件更大性能潜力。

基于 NVIDIA Spectrum-X 网络,存储与网络栈无明显软件瓶颈,扩展性可预测

本次测试基于NVIDIA Spectrum-X网络环境,结果表明,集群EC顺序读性能达272.1 GiB/s,占三台存储节点网络物理极限的97.4%;单客户端EC顺序读在1.6T条件下亦达到167.0 GiB/s,为单机网络极限的89.7%。两者均逼近各自的物理上限,充分证明存储软件栈能够高效压满RDMA网络,不存在明显的软件层瓶颈。此外,带宽容量可按网口数量线性规划,这一特性为大规模部署场景下的硬件选型与成本测算提供了可靠的量化依据。

图片:EC 1M顺序读达成率:集群vs单客户端

在此展示3台存储节点的6个RDMA网口(400G)的带宽监控,可以看到网口带宽达到46 GiB/s,接近打满网卡物理带宽。

图片:带宽监控图(截选)

国内领先的支持混合注意力大模型的KV Cache 存储方案

随着DeepSeek-V4 、GLM-5.1等采用混合注意力架构的模型兴起,其KV Cache结构与传统 MHA/GQA 显著不同。 本次测试结果表明,KV Cache卸载后命中吞吐均远高于重算:V4-Flash 的命中吞吐稳定在4万–6万Tokens/s,吞吐加速比是6.6倍,GLM-5.1更高、峰值超过15万tokens/s,吞吐加速比是57.4倍。这证明存储侧能正确处理混合注意力模型的异构KV布局并保持高卸载收益。

图片:混合注意力模型·Prefill Only: Cold vs Warm性能对比(X86,EC,1.6T)

EC纠删码和单副本在KV Cache卸载场景无性能差距

在方案A的Prefill‑Only与Prefill‑Decode两类测试场景中,本次测试对比了“EC 4+2:1纠删码”与“单副本”存储策略下的性能表现。结果表明,两者的TTFT加速比与TPS加速比均无明显差异,因此生产部署可直接采用EC纠删码策略,在不牺牲推理性能的前提下同时获得更高的存储容量利用效率与数据可靠性。

进一步地,在EC策略下,KV Cache卸载带来的收益依然显著:命中(Warm)相比重算(Cold),TTFT从数十秒降至百毫秒或数秒,长序列场景下降幅最大;吞吐(TPS)提升一个数量级(10倍~32倍),命中时普遍达到7万至11万Tokens/s。该结果充分证明,即便在纠删码带来的额外计算与存储开销下,KV Cache卸载的收益仍能得到完整保留,为实际生产环境中兼顾性能与可靠性的存储选型提供了有力支撑。

图片:X86后端·EC 4+2:1·Prefill Only:Cold vs Warm性能对比(DeepSeek-R1,1.6T)

在Prefill-Only场景下,“单副本”与 “EC 纠删码”的TTFT 加速比和吞吐(TPS)加速比逐场景互有高低、整体持平。这两种存储策略在卸载场景下性能无可辨别差距。

图片:X86后端·单副本vs EC·Prefill Only:加速比对比

在Prefill-Decode测试中,以每秒完成请求数(req/s)衡量端到端吞吐,“单副本”与 “EC 纠删码” 的req/s加速比同样接近,逐场景方向随机。

图片:X86后端·单副本vs EC·Prefill-Decode:req/s加速比对比

NVIDIA Spectrum-X网络高级特性对于KV Cache卸载性能的影响

本次测试基于Spectrum-X网络的高级特性,重点评估了Adaptive Routing与Spectrum-X Congestion Control功能对推理性能的影响。在Qwen3‑235B模型、2K输入长度及256高并发的Prefill‑only场景下,以关闭ARCC为基线,对比了开启ARCC后KV Cache命中(Warm)路径的性能。结果表明,开启ARCC后,吞吐量与请求吞吐均提升约22.7%,首Token延迟(TTFT)改善约18.7%,充分验证了Spectrum-X网络高级特性在提升推理效率方面的积极作用。

图片:Spectrum-X ARCC vs noARCC: Warm (命中)路KV Cache卸载性能

网络带宽对于推理性能的影响

本次测试验证GPU服务器使用1.6T/800G/400G存储网络下KV Cache卸载性能(Prefill-Only测试)。测试结果表明,1.6T与800G两档存储网络性能基本贴合且维持高位,而400G始终垫底。400G相对1.6T的吞吐比值随Input增长从79%单调下滑至55%。说明请求上下文越长、单请求KV Cache越大,400G单口带宽越成为瓶颈。而800G已能满足当前负载、受限于当前GPU规格算力制约4×400G的边际收益有限。

图片:存储网络带宽影响:Input越长,400G越受限(R1,EC,Prefill-only,Warm)

本次测试也验证了2台GPU服务器使用800G/400G计算网络下的PD分离测试的性能。在PD分离架构下,P节点和D节点间传输KV Cache的计算网络从400G升级到800G后,TTFT加速比与吞吐加速比逐场景显著提升,800G普遍约为400G的1.7倍(TTFT)和1.5倍(TPS)。说明对依赖PD间KV Cache传输的场景,提升计算网络带宽可带来明显的端到端性能收益。

图片:计算网络带宽影响:PD间KV Cache传输800G vs 400G(DeepSeek-V4-Flash, Prefill-only)

4 超擎数智携手生态,持续推进AI存储技术标准化与产业落地

本次深度测评,系统验证了X86存储服务器与基于BlueField-3 DPU的JBOF等多形态部署方案,充分测试了“单副本”与“EC纠删码”两种存储策略,并覆盖DeepSeek-R1、Qwen3-235B、DeepSeek-V4(混合注意力)、GLM-5.1(混合注意力)等多款主流大模型,全面评估了方案在不同硬件形态与模型架构下的适配能力与性能表现。

作为ODCC AI存储实验室的依托方,超擎数智在本次实验中充分发挥了在AI算力、AI网络与AI应用全栈方案领域的技术底蕴,为测试提供了高性能、高可靠的系统级验证基座。本次测试不仅验证了星辰天合MeshFusion在推理场景下的技术可行性,也为AI基础设施的标准化建设与产业化落地提供了可复用的测试方法论与参考基准。

推理时代,"存算分离"与"以存强算"已成为突破算力瓶颈的关键路径。未来,ODCC AI存储实验室将继续发挥连接产业链上下游的枢纽作用,携手更多生态伙伴,持续推进"算力-网络-存储"全链路协同验证,加速前沿技术成果转化,共同为千行百业的数智化演进筑牢高效、稳定、可靠的AI基础设施底座。