NVIDIA CMX:跨越显存边界,重构智能体时代的“上下文记忆”

技术文章

大模型的上下文窗口,正在从几十万Token迈向百万级甚至更长尺度。与之同步发生的,是AI应用范式的转变,从问答交互的聊天机器人,走向能够理解复杂目标、调用多种工具、拆解长期任务,并与其他智能体协同工作的Agentic AI。

过去,行业关心GPU够不够快。如今,一个新的问题也在浮出水面:AI算得出来以后,如何记得住、找得到、调得动,还能在不同节点之间高效共享?

面向这一趋势,NVIDIA 推出CMX(Context Memory Storage)平台,尝试在GPU与传统存储之间,构建一个专门服务于AI推理上下文的新型存储层。它解决的,不止是”存储空间不够“的问题,更是智能体时代AI工厂如何管理工作记忆的问题。

一、从“存得下”到“调得动”:CMX重构AI上下文存储层

CMX(Context Memory Storage,上下文内存存储) 是 NVIDIA 面向智能体 AI(Agentic AI)时代打造的全新存储平台,也是BlueField-4 STX参考架构的首个机架级(rack-scale)落地实现。

CMX做的事,是用BlueField-4、DOCA与Spectrum-X以太网,在pod(机柜/集群)级新增一个上下文内存层,把KV cache当作一等资源来管理。黄仁勋在发布中直言:“智能体AI正在重新定义软件的能力边界,其背后的计算基础设施必须被重新发明——STX重新发明了存储栈。”在 NVIDIA 的定义里,KV cache是一种区别于传统企业数据的“AI 原生数据类(AI-native data class)”——这正是CMX另起炉灶而非沿用通用存储的根本理由。

简言之:传统存储为数据持久化而生,CMX则专为KV Cache(键值缓存)管理设计。作为新型存储层,它在GPU与企业存储之间构筑高速低延迟、可跨节点共享的上下文高速通道,彻底打破显存容量带来的推理瓶颈。

二、长上下文持续扩张,AI推理正在撞上“记忆墙”

KV Cache快速膨胀,有限显存难承长程记忆

KV cache是现代Transformer推理栈的核心数据结构:模型读取prompt时为每token计算并保存一对key/value,后续生成不必重算历史。它让AI能记住上下文,跨轮次、跨会话持续保留状态。

GPU HBM容量有限,模型权重和运行时数据已经占用相当一部分空间,留给KV Cache的容量十分紧张。百万token的单个上下文可能产生数十到数百GiB的KV Cache,多智能体和高并发场景更可能达到TiB级。显存不足后,系统不得不排队、重算或将KV Cache换出到CPU/NVMe,造成TTFT和尾延迟显著上升;若进一步截断或压缩上下文,还会影响模型的上下文完整性和回答质量。

上下文越长,开销二次方暴涨

NVIDIA 高级研究科学家Vikram Sharma Mailthody点明了数学本质:推理模型不变时,计算cache的成本随上下文长度呈二次方(quadratic)增长。这源自注意力机制的本质:每生成一个新token,都要与历史中每一个token计算注意力,上下文翻倍,计算量与KV cache存储量呈平方级膨胀。对需要记住大量中间步骤、工具调用结果与子任务状态的智能体工作流而言,这不是线性扩容能解决的问题,而是要求存储架构本身的范式转变。

存储层级距离越远,推理成本越高

今天的AI基础设施,存储分为四级,每一级都有先天短板:

  • G1(GPU HBM):纳秒级访问,承载token生成的活跃KV cache,效率最高但容量严重受限;
  • G2(系统 RAM):KV cache从HBM溢出的暂存/缓冲层,延迟高于G1,容量中等;
  • G3(本地 SSD):暖KV存储,用于较短时间尺度的复用,但节点本地架构导致管理复杂、难以扩展,pod内其他GPU根本访问不到;
  • G4(共享企业存储):面向耐久性、数据保护与大容量优化,但毫秒级延迟让它根本不适合承载活跃推理上下文。

HBM满了溢到系统内存,系统内存满了再溢到本地盘——Mailthody的结论一针见血:“推理上下文离GPU越远,推理就越贵、越低效。”

重算与等待并存,GPU利用率低下

KV cache被驱逐出HBM后,系统只剩两条差路——要么重算被驱逐的KV cache,白白消耗算力与能耗(TPS崩塌、后续轮次TTFT飙升);要么GPU空闲等待慢速存储路径。两者都无法规模化,最终表现为GPU stall(停顿),算力被存储拖后腿。

临时数据进入持久化系统,传统存储出现架构错配

KV cache本质是临时性、可重算的数据(写入后不再修改、丢失可由GPU重算),传统企业存储那些复制、一致性校验、元数据管理等为耐久性设计的特性,对它而言全是无用开销。用错的工具装对的数据,效率自然上不去。结论很清楚:现有存储层级不是为即将到来的AI 设计的,面向推理上下文管理的存储,必须重新构想。

三、CMX如何破解“记忆墙”:构建上下文高速层

新增G3.5层,为AI推理打造共享上下文空间

CMX的解法并非修修补补,而是新增一个专为推理上下文设计的存储层G3.5,精确嵌在本地节点存储(G3)与共享企业存储(G4)之间。它建立在RoCE连接的闪存之上,以pod为单位运行,充当“AI基础设施pod的智能体长期记忆”,让pod内所有节点共享访问KV cache。

这一层的本质,是把“慢速、I/O 密集”的传统存储路径,变成“高吞吐、网络受限”的新路径——正如VAST AI架构总监Anat Heilper所说:“我们把缓慢的I/O密集过程,变成了高吞吐、网络受限的过程,存储可以随网络一起扩展。”

计算、DPU与网络协同,打通KV Cache高速通道

  • Vera Rubin平台:承担推理主力,是CMX服务的算力核心;
  • BlueField-4 DPU:存储优化的数据处理单元,融合Vera CPU与Connect X-9 SuperNIC,具备超高速连接、多核CPU与高带宽内存。它管理NVMe SSD、运行存储服务、以硬件加速引擎执行线速加密与基于CRC的数据保护,高能效卸载KV cache的数据完整性与加密;关键作用是管理元数据、削减数据搬移、把GPU从数据管理负担中隔离出来;
  • Spectrum-X以太网:AI优化的网络fabric,提供基于RDMA的高性能连接。自适应路由、高级拥塞控制与优化的无损RoCE(RDMA over Converged Ethernet),在重负载下最小化抖动与尾延迟,在大型多租户环境场景下交付一致、可重复的性能。

软件栈协同调度,让上下文高效流转与复用

CMX的"灵魂"在软件,四个组件各司其职:

  • NVIDIA DOCA Memos:专为BlueField-4与CMX优化的 SDK,引入KV通信与存储层,把上下文缓存当作一等资源,跨AI计算节点与CMX数据节点管理和共享KV cache;对外暴露简单的key-value API,把“RoCE连接的闪存”变成pod级缓存层。它以硬件加速的完整性与加密提供安全低延迟访问,让应用保持无状态,由CMX在规模化下处理KV cache路由与复用,并为存储伙伴提供开放接口接入G3.5 层;
  • NVIDIA Dynamo:分布式推理服务框架,让CMX与底层上下文存储层在pod内“无缝呈现”,把请求路由到KV cache已经所在的地方(KV-aware 放置与复用),与NIXL协同管理prefill、decode与KV cache的跨层流动。它提升tokens/second、降低TTFT,支持多轮、多智能体工作流的pod级上下文复用;
  • NIXL(NVIDIA Inference Transfer Library):开源库,负责KV块在各级内存/存储层之间的传输;
  • Grove:拓扑感知编排层,提供带KV局部性感知(KV locality awareness)的工作负载放置,即使负载在节点、机架间迁移,也能继续复用上下文,避免重新物化,作为NVIDIA Dynamo的一部分,Grove也可以独立部署或集成到其他高性能推理框架中。

四大核心能力,提升上下文管理效率

  • PB 级共享容量:每GPU pod提供数PB级共享容量,让长上下文工作负载在被HBM/DRAM驱逐后仍能保留历史;
  • Prestaging(预置):KV块可在decode(解码)阶段之前从CMX预先搬入G2或G1内存,减少decoder stall与GPU空闲时间——把“取数”提前到“用数”之前;
  • 共享访问:上下文升级为全局高带宽共享资源,调度器支持跨智能体、跨服务协同调度,为多智能体系统的共享工作记忆能力提供核心支撑;
  • 硬件加速安全:BlueField-4集成专用硬件加密、完整性校验加速器,在KV缓存数据传输与持久化通路中完成AES加密与数据完整性校验;安全处理逻辑硬件线速卸载,数据路径无需主机CPU参与。

直连闪存,缩短KV数据访问路径

CMX闪存池中的NVMe SSD由BlueField‑4存储处理器统一管理,并以CMX target节点的形式通过Spectrum‑X Ethernet对外提供服务,从而构成面向KV Cache的Pod级G3.5闪存层。DOCA Memos利用标准NVMe和NVMe‑oF传输机制(包括 NVMe KV Extensions)提供KV通信与存储接口。GPU计算节点可通过RDMA网络对远端CMX闪存层发起高并发KV Cache访问,并由Dynamo KVBM与NIXL协调KV block的位置管理和跨层迁移,从而减少主机CPU参与、数据序列化开销和主机内存拷贝。

实测性能:从65秒到3秒,存储放大算力价值

首届VAST Forward大会上,NVIDIA 与 VAST Data 拿出一组实测(Llama 3模型、8×H100 GPU、200 GbE 网络),成绩单相当硬核:

  • TTFT(首token延迟)提升20倍:从VAST系统取回 KV cache,相较让GPU重算,从65秒压缩到3秒;
  • GPU时间节省90%,利用率大幅改善;
  • 存储功耗降低70%;
  • 在保守的40%–60%缓存命中率假设下,真实场景可带来60%–130%的利润提升;agentic与认知类任务命中率更高、收益可能更大。

Heilper的总结堪称点睛:“我们没有让GPU变快——那是 NVIDIA 的事;但我们让它更常处于可用状态,把存储变成了算力的乘数。”

规模测算:48 PB 承载“智能体记忆”

再算一笔容量账(1万用户、人均32GB KV cache/对话):

image

48 PB的量级,正是CMX这类新型存储要承接的“记忆规模”——传统企业存储无论从延迟还是能效,都无法经济地支撑。

四、从单点创新到产业协同:CMX加速走向生态化落地

CMX不是孤立的硬件,而是一套生态级参考架构—STX一经发布,便拿到全产业链的背书:

  • 云与AI采用者:CoreWeave、Crusoe、IREN、Lambda、Mistral AI、Nebius、OCI(Oracle Cloud Infrastructure)、Vultr;
  • 存储厂商:Cloudian、DDN、Dell Technologies、Everpure、Hitachi Vantara、HPE、IBM、MinIO、NetApp、Nutanix、VAST Data、WEKA,共同开发基于STX的下一代基础设施;
  • 整机/制造伙伴:AIC、Supermicro、QCT(广达云达);
  • SSD供应商:Solidigm、FADU等,提供为大块、持续、多租户流量调优的闪存介质。

VAST在VAST Forward 2026上发布的CNode-X(NVIDIA 认证系统,预计2026年内上市),更把 NVIDIA GPU、BlueField-4 DPU与Spectrum-X 扩展交换机直接集成进 VAST 存储集群,黄仁勋评价其"在每一层都是CUDA加速的,为AI智能体提供持久记忆"—CMX的落地形态,已经看得见、摸得着。

五、AI工厂的下一站:计算、网络、存储与软件深度协同

CMX带来的思考,并不只是“AI存储需要升级”。更深层的变化在于,随着AI从模型训练走向规模化推理,基础设施构建逻辑正在被重新定义。

训练时代更关注如何以更短时间完成一次大规模计算;智能体推理时代则需要同时兼顾上下文、高并发、低延迟、状态复用和持续运行。

这意味着,AI工厂不能只是GPU的集合。它需要高性能算力承担推理,需要无损网络保障数据流动,需要上下文存储承载智能体记忆,也需要软件平台统一管理模型、KV Cache、Agent与集群资源。

最终决定AI工厂生产效率的,不再是某一个部件的峰值性能,而是整个系统能否围绕Token生产进行协同。

作为AI原生的基础设施产品和全栈方案提供商,超擎数智长期关注AI算力、AI网络、AI互联、AI存储、AI加速软件,以及AI集群设计、交付、优化与运营之间的系统协同。

面对长上下文和Agentic AI带来的基础设施变化,超擎数智认为,未来AI工厂的建设需要进一步打破计算、网络与存储之间的边界,以全栈视角优化数据流、通信流和任务流,让算力资源始终处于高效生产状态。

当智能体开始拥有更长的思考链条和更复杂的任务周期,“记忆”将不再只是模型能力的一部分,而会成为AI基础设施的一部分。

从GPU算力,到高速网络,再到上下文内存,AI工厂正在补齐智能生产体系的新关键环节。

而CMX所代表的,正是这一轮基础设施变革中值得关注的新方向:让上下文可以流动,让记忆可以共享,让存储从算力的配套设施,转变为Token生产效率的放大器。