ODCC AI存储实验室 | 大普微R6101双端口SSD,超擎数智算网环境下验证AI推理十倍加速

技术文章

大模型推理场景对KV Cache存储需求持续攀升,存储硬件的性能表现与架构创新正成为制约AI基础设施效能的关键因素之一。为系统评估新一代PCIe Gen5 SSD在KV Cache卸载场景下的技术成熟度与多形态部署能力,ODCC AI存储实验室持续深化AI存储关键部件的专项验证工作。

ODCC AI存储实验室联合超擎数智、大普微完成嵘神6 R6101 PCIe Gen5 SSD KV Cache场景专项评测

大模型推理场景对KV Cache存储需求持续攀升,存储硬件的性能表现与架构创新正成为制约AI基础设施效能的关键因素之一。为系统评估新一代PCIe Gen5 SSD在KV Cache卸载场景下的技术成熟度与多形态部署能力,ODCC AI存储实验室持续深化AI存储关键部件的专项验证工作。

近期,实验室依托超擎数智提供的高性能算网环境与全栈技术服务能力,联合生态伙伴大普微,完成了面向多形态部署、多模型架构、多存储策略的KV Cache存储系统全面评测。

本次测试聚焦大普微嵘神6系列R6101 PCIe Gen5 SSD,在传统x86存储集群与基于BlueField-3 DPU的JBOF两类硬件平台上,全面评估其在KV Cache卸载场景下的性能表现、双端口高可用能力,以及IO行为可观测性等关键特性。以下为本次评测的详细成果。

1 测试环境:单双端口盘齐上阵,双形态部署全面覆盖

在此次KV Cache测试中,大普微嵘神6系列硬盘R6101承担了存储集群的构建任务。作为大普微面向 AI 场景打造的企业级 SSD 产品,R6101支持PCIe Gen5.0×4接口,NVMe2.0协议,为KV Cache的高吞吐、低延迟存取提供了坚实的硬件基础。

本次测试的存储集群涵盖两种硬件平台:传统x86存储服务器与全闪存存储服务器(JBOF)。

  • 三台x86存储服务器,每台使用16块大普微R6101 SSD,组成本次测试的方案A(HBM GPU服务器+传统x86存储服务器),服务于GPU节点的KV Cache卸载。
  • 一台基于BlueField-3 DPU的JBOF,搭载24块大普微R6101双端口SSD,组成本次测试的方案B(HBM/GDDR GPU服务器+JBOF)

方案A、B详情请参见星辰天合测试结果公布。 图片:测试架构图

在B方案的JBOF硬件平台中,双端口R6101 SSD采用分离模式部署:SSD的4条PCIe通道一分为二,两个DPU各自获得2条通道并访问独立namespace。每个DPU使用独立的存储空间,无需处理访问冲突,在保证数据隔离的同时实现高可用。

图片:双端口SSD架构图

2 测试表现:R6101在KV Cache场景下的硬核实力

本次KV Cache测试中,大普微R6101在多个维度展现出显著优势,以下是硬盘侧的核心测试发现:

传统x86方案:KV Cache卸载性能实现数量级提升

在方案A中,R6101部署在3节点的传统x86存储集群中。可以看到,在短上下文低并发的Prefill-Only测试中,即2K个输入token,16个并发数,1个输出token的测试中,时延和吞吐量都有10倍以上的提升。随着上下文长度以及并发用户数增加,收益也逐渐提升。最高时延和吞吐量收益达到32倍。

在Prefill-Decode测试中,虽然Decode阶段推理系统需要承担输出token的计算工作量,导致总性能下降。但是在部署R6101的外部存储系统的情况下,推理系统的时延最高能提升22倍,吞吐量一半场景提升5倍以上。

这一结果充分证明,大普微R6101 SSD作为KV Cache卸载的存储底座,能够将GPU显存从KV Cache的容量束缚中解放出来,让推理系统在长上下文、高并发场景下依然保持高效的响应能力。

双端口JBOF方案:性能媲美x86集群,密度与时延优势显著

作为创新的硬件平台,JBOF在测试中的结果接近于标准x86传统3节点存储服务器。基于BlueField-3 DPU的JBOF存储方案,单节点部署的网络和存储容量密度显著大于普通服务器,配合GPU直通技术可以降低端到端时延,这些潜在优势使JBOF搭配双端口SSD成为未来可选的另一种硬件平台。

在JBOF架构中,双端口设计允许两个DPU通过独立的PCIe链路同时访问同一块SSD,消除了单点故障风险。测试结果表明,这一架构在保证高性能的同时,为AI推理系统提供了更高的可用性和部署灵活性。

系统优化:SSD内部实时记录IO Pattern

本次测试启用了大普微SSD的IO Pattern实时抓取功能,在测试过程中记录了SSD端的IO行为特征。能够看到数据分为小块元数据和大块用户数据2种典型类别,4K随机写和128K块大小的读写操作占主要比例。

该功能让存储系统的性能优化从“黑盒”走向“白盒”。通过实时抓取SSD内部的IO Pattern,可以精准识别KV Cache卸载场景下的IO访问规律,即小块元数据频繁随机写入、大块用户数据读写交替进行,从而为存储系统的参数调优、缓存策略设计提供数据支撑。

3 从部件到系统:超擎数智助力AI存储技术体系化验证

本次深度评测,系统验证了大普微R6101 PCIe Gen5 SSD作为KV Cache存储底座的三大核心能力:

  • 性能可量化:在多种输入长度、并发数组合下,时延和吞吐量提升10-32倍,为硬件选型提供清晰的性能基准。
  • 架构可扩展:传统x86集群与创新JBOF平台均验证通过,双端口特性为高可用部署提供新选择。
  • 行为可观测:IO Pattern实时抓取打开存储优化的"黑盒",让系统调优从经验驱动走向数据驱动。

作为ODCC AI存储实验室的依托方,超擎数智在本次评测中不仅提供了高性能计算集群与Spectrum-X网络环境,更通过体系化的测试服务能力,将存储硬件的性能数据转化为产业选型的量化依据。从基础部件到系统集成,从单一指标到多维验证,实验室正在构建一套面向AI场景的存储技术评估标准体系。

当前,AI推理的规模化落地正在倒逼存储技术从"通用"走向"专用",从"单点优化"走向"全栈协同"。未来,超擎数智将继续依托ODCC AI存储实验室平台,联合更多生态伙伴,持续深化关键部件在真实AI负载下的适配验证,推动AI存储从性能指标走向场景化选型标准,为智算中心建设提供更加精准、可靠的技术选型依据与部署参考,助力千行百业在AI时代的高质量发展。