从模型训练到智能体推理:NVIDIA Vera CPU为何成为下一代AI基础设施关键一环

技术文章

当人工智能从生成式问答逐渐迈向自主规划、调用工具、编写代码、与环境交互的“智能体”时代。算力消耗的底层逻辑发生了根本性变化。大规模预训练虽然仍是AI能力的基石,但AI工作流的重心正在向推理侧的复杂循环倾斜。在这个新范式下,CPU正在从传统AI架构中的辅助角色,重新成为影响AI系统整体效率的重要组成部分。

当人工智能从生成式问答逐渐迈向自主规划、调用工具、编写代码、与环境交互的“智能体”时代,算力消耗的底层逻辑发生了根本性变化。大规模预训练虽然仍是AI能力的基石,但AI工作流的重心正在向推理侧的复杂循环倾斜。在这个新范式下,CPU正在从传统AI架构中的辅助角色,重新成为影响AI系统整体效率的重要组成部分。

2026年,NVIDIA Vera CPU的正式登场,为面向智能体时代的新一代AI基础设施提供了新的计算选择。作为NVIDIA Compute(计算)与 Networking(网络)双Elite精英级合作伙伴,超擎数智持续关注AI基础设施演进趋势,并致力于帮助企业将先进计算能力转化为可落地的AI生产力。 image

1 AI工厂新挑战:为什么传统CPU架构正在面临重新设计?

从“训练”到“推理”,AI算力需求正在发生变化

过去几年,AI大模型产业发展的核心目标是提升模型规模与训练能力。在预训练阶段,大量计算任务可以通过数据并行、模型并行等方式进行扩展,GPU凭借高度并行化计算能力成为AI训练基础设施的核心。

然而,随着大模型逐渐进入企业应用阶段,AI产业竞争重点正在从“训练更大的模型”转向“如何让模型更高效地服务业务”。企业正在探索智能客服、AI Agent、知识管理、代码生成、自动化办公、工业智能等应用场景。这些应用并非一次性的模型计算,而是包含:任务理解、多步骤推理、工具调用、状态管理、数据检索、环境交互等。

这类工作流具有明显的控制流和实时交互特点,对CPU提出了更高要求。这意味着,算力配比正在被重写。在某些智能体场景下,CPU与GPU的配比正从传统的1:8逼近1:1甚至更高。“GPU为核心、CPU辅助” 的模式,需要向更加均衡的计算架构演进。

2 智能体时代,传统CPU架构面临哪些挑战?

控制流任务增加,单核性能重新成为关键指标

智能体的核心工作逻辑是“思考-行动-观察”循环。每一步都涉及工具调用、代码执行、条件判断、状态管理——这些都是典型的控制流密集型任务,极度依赖CPU的单线程性能和分支预测准确性。

然而,过去十年间,CPU的竞争主旋律都是“堆核心数”。从8核到128核,核心数量增长了16倍,但对于大量无法完全并行化的AI工作流而言,核心数量并不意味着全部性能释放。因此,面向智能体时代,CPU架构需要重新平衡核心性能、数据访问效率以及系统响应能力。

高并发沙箱环境,对系统隔离与调度提出新要求

随着智能体(AI Agent)逐渐具备自主规划、代码执行和工具调用能力,其运行过程中不可避免地需要访问文件系统、数据库、计算资源等敏感环境。为保障主机安全与业务数据可靠性,企业通常需要通过沙箱(Sandbox)技术,为每个智能体任务提供隔离的执行空间,实现资源隔离、权限控制以及风险防护。

在AI代码验证、自动化测试等场景中,系统需要同时运行成千上万个隔离的、轻量级的沙箱环境。这些沙箱对计算资源的需求并不完全相同,但都要求系统具备快速调度能力、高效上下文切换能力以及稳定的数据访问能力。

传统CPU架构在不同核心之间、不同Die之间访问缓存和内存时,延迟差异极大(本地内存访问仅需70-90ns,而跨Die访问可能高达300-400ns)。这种 “性能不可预测性”对于大规模沙盒环境而言,是灾难性的——这种性能波动会进一步影响服务稳定性和用户体验。

因此,面向智能体时代,AI基础设施不仅需要提供更强的计算能力,还需要具备更加高效、稳定、可预测的计算架构,以支撑大规模智能体安全运行。

内存带宽成为AI推理效率的重要限制因素

随着模型上下文长度不断增加,以及知识库、向量数据库等应用规模持续扩大,AI推理过程中的数据访问需求快速增长。在实际运行过程中,KV Cache和嵌入向量表需要频繁读写,内存访问效率逐渐成为影响整体性能的重要因素。

传统DDR5内存架构虽然容量大、成本低,但面对AI推理场景下高频数据交换需求,内存带宽增长速度难以完全匹配计算能力提升。因此,AI基础设施正在从单纯关注CPU核心数量,转向更加关注计算、内存和互联之间的整体协同能力。这也是为什么面向智能体时代,需要重新设计CPU与系统架构。

工具调用成为智能体运行的关键环节

随着AI Agent逐渐从信息生成走向任务执行,工具调用正在成为智能体系统的重要组成部分。智能体不仅需要理解用户需求,还需要根据任务目标自主选择并调用外部工具,例如调用企业数据库、检索系统、业务API、代码执行环境等,完成复杂任务闭环。

与传统模型推理不同,工具调用过程并非单一的计算任务,而是包含任务规划、参数解析、接口调度、结果处理以及下一步决策等多个连续环节。这些流程具有明显的控制流特征,需要CPU承担大量任务编排和系统协调工作。

在复杂企业应用场景中,一个智能体任务可能需要多次调用不同工具,并根据返回结果动态调整执行路径。此时,系统性能不仅取决于模型推理速度,也取决于CPU对于高频任务切换、低延迟调度以及多服务协同的处理能力。

因此,面向智能体时代,CPU不再只是GPU计算任务的辅助组件,而是支撑Agent工作流高效运行的重要基础设施。

3 NVIDIA Vera CPU:面向智能体时代的新型计算架构

NVIDIA Vera CPU并非简单地在Arm架构上堆料,而是从微架构、互联、内存到系统拓扑进行了系统性重构。其目标并非替代GPU,而是与GPU、网络以及软件生态形成更加高效的协同体系,共同支撑下一代AI基础设施。 image

微架构优化:提升复杂AI任务处理效率

Vera的心脏是NVIDIA自研的Olympus CPU核心,它完全兼容Armv9.2指令集,但绝非公版方案。

  • 超强的指令级并行:Olympus拥有10宽(10-wide)指令解码器,每周期指令获取能力最高达到AMD Zen 5核心的2.4倍。配合神经网络分支预测器,分支预测性能平均提升约2倍,大幅减少了因预测错误导致的流水线清空,确保复杂AI代码的执行效率。
  • 极致的单核性能:在Phoronix的测试中,Vera的单核性能在多项负载下领先所有x86处理器,其Linux内核编译速度(按单核计算)是128核竞品的两倍。这意味着在处理智能体逻辑这种难以完美并行的任务时,Vera具有碾压性优势。

简化互联架构,提高系统性能一致性

随着服务器规模不断扩大,多芯片、多节点架构成为提升计算能力的重要方式,但与此同时,复杂互联结构也带来了新的挑战。Vera采用统一互联设计,通过优化核心之间的数据访问路径,降低跨节点通信开销,提高系统整体一致性。

  • 解决跨Die延迟痛点:在Chiplet架构中,一个核心访问另一个核心的缓存或内存,数据需要“核心→CCD→I/O Die→另一CCD→目标核心”的漫长路径。而Vera将所有88个核心通过第二代NVIDIA可扩展一致性互连架构(SCF) 直接连接,核心间通信延迟降低约50%,且所有核心的访问延迟表现完全一致。
  • 极简的NUMA拓扑:一台双路x86服务器最多可产生32个NUMA节点,软件调度稍有不慎就会导致性能雪崩。而一台双路Vera服务器仅2个NUMA节点。这对AI工厂意义深远:性能可预测、调度难度指数级下降、系统长尾延迟大幅缩减。

高带宽内存设计,加速数据密集型AI任务

AI推理并不仅依赖计算能力,也高度依赖数据访问效率。针对大模型推理、知识检索以及实时分析等场景,Vera采用高带宽内存设计,提高CPU与数据之间的交互效率。相比传统服务器架构,Vera通过优化内存系统,提高单位核心的数据供给能力,使CPU能够更充分发挥计算能力。

  • 带宽与功耗的完美平衡:Vera提供高达1.2 TB/s的聚合内存带宽,是传统DDR5服务器的两倍以上。更惊人的是,其内存子系统满载功耗仅30-40瓦,而传统方案常超100瓦。在STREAM TRIAD测试中,Vera能持续保持峰值带宽的90%,创下Phoronix测试CPU的最高纪录。
  • 单核带宽的绝对领先:得益于总带宽优势,Vera每核心平均可分配约12.7GB/s的内存带宽,是AMD EPYC Turin(约3.1GB/s/核)的4倍。在内存压力测试中,当带宽需求增加,EPYC的访问延迟从120ns飙升至350ns,而Vera在90%内存利用率下的峰值访问延迟仅为前者的约1/40。这对于处理大规模、不规则的数据集至关重要。

4 从技术到应用:Vera如何赋能真实AI业务场景?

技术架构最终需要服务实际业务。以下是Vera在多个关键AI与数据密集型负载中的实测表现:

智能体工作流:提升AI应用响应效率

智能体的核心逻辑——无论是调用API、处理返回数据、还是执行动态生成的代码——绝大多数由Python编写。Python作为解释型动态语言,其运行效率极度依赖CPU的单线程性能和分支预测准确性。

官方测试显示,在CPU满载的Python性能测试中,Vera相比AMD EPYC Turin(128核)实现了 1.8倍的性能提升。这意味着同样一段智能体调度代码,在Vera上每秒能够完成的决策循环次数接近翻倍。

知识检索与图计算:释放数据智能价值

检索增强生成(RAG)和知识图谱是当前AI应用的核心组件,其背后是大量图遍历和PageRank类算法。这些负载的特性是:内存访问模式高度不规则、依赖低延迟的核心间通信、无法被简单并行化。

在PageRank算法测试中,Vera展现出极强的扩展能力。在32核心配置下,其性能最高达到AMD EPYC平台的29.3倍。这并非线性的核心数优势,而是 “每核心效率 × 一致性延迟 × 内存带宽” 的综合优势爆发。

实时数据分析:支持实时智能决策

在列式数据库ClickHouse测试中,Vera相比AMD EPYC Turin实现了20%的查询性能提升。这表明Vera的优势并不局限于AI专用负载,在实时数据分析、OLAP、数据仓库等企业级应用中同样具有普适性优势。

5 超擎数智:让先进AI基础设施真正落地企业场景

AI基础设施的发展,最终目标并不是拥有单一先进硬件,而是构建一套能够持续支撑业务创新的AI生产体系。

作为NVIDIA Compute(计算)与Networking(网络)双Elite精英级合作伙伴,超擎数智持续关注AI基础设施演进趋势,并围绕企业实际需求提供从算力资源、网络互联到集群建设和持续运营的一体化解决方案。

超擎数智始终认为,未来企业竞争的关键,不只是拥有更大的模型,而是能否建立更加高效、稳定、可持续演进的AI基础设施。随着智能体应用不断深化,CPU、GPU、网络以及软件平台之间的协同将成为AI工厂效率提升的重要因素。

NVIDIA Vera CPU的出现,为AI基础设施演进提供了新的方向。而超擎数智将依托自身在AI基础设施领域的技术积累与交付能力,帮助企业更好地释放先进计算技术价值,加速智能化应用落地。