2026年的AI基础设施市场正在经历一场静默的范式转移。Gartner预测,全球AI支出将在2026年达到2.59万亿美元,同比增长47%,其中AI基础设施占比超过45%。更值得关注的是结构性变化:AI代理软件支出将从2025年的864亿美元跃升至2026年的2065亿美元,增幅高达139%。企业正在从“试用AI”转向“规模化运营AI”,基础设施的TCO效率将直接决定这场转型的成败。
在这一关键节点,NVIDIA给出的答案不是一颗更快的GPU,而是一套完整的“AI工厂”操作系统。从Grace Blackwell到Vera Rubin,NVIDIA正在从算力供应商转变为智能生产基础设施的定义者。
图1 黄仁勋宣布NVIDIA Vera Rubin正在加速进入全面量产阶段(来源:NVIDIA)
01 范式转移:为什么传统数据中心架构正在失效
要理解Vera Rubin的战略意义,首先要回答:代理式AI究竟对基础设施提出了什么前所未有的要求?
传统数据中心的设计理念是“存储—检索—处理”,但在代理式AI时代,这些设施已全面进化为“AI Token工厂”——核心产出是以Token形式制造的智能。这一转变背后绝非简单的算力需求增长,而是对整个系统架构的重新定义。
现代AI智能体能够规划任务、调用工具、执行代码、检索数据,并跨多个连续多步骤工作流进行协调。这类交互会产生海量推理Token、持续扩容KV缓存,同时还需要依托CPU沙盒环境完成结果测试与校验。这意味着,基础设施必须同时满足三个看似矛盾的要求:海量并行计算、极低延迟响应、以及复杂的CPU端协调。传统“GPU计算、CPU调度、网络连接”的分层架构,在这种混合负载下正面临严峻瓶颈。
图2 CPU 沙盒可加速基于 RL 的后训练和代理式调用(来源:NVIDIA技术博客,作者Praveen Menon;Ivan Goldwasser)
NVIDIA的洞察在于:问题的根源不是某一颗芯片不够快,而是整个系统没有为代理式AI的端到端工作流进行协同设计。这正是Vera Rubin的出发点——并非对原有架构的小幅升级,而是一次系统性重构。
02 Vera Rubin:七颗芯片、五个机架、一台超级计算机
NVIDIA在GTC 2026及台北GTC期间发布的Vera Rubin平台,是NVIDIA迄今为止规模最大的POD级平台。它将NVIDIA Vera Rubin NVL72系统、NVIDIA Vera CPU、NVIDIA Groq 3 LPX、NVIDIA Vera BlueField-4 STX存储以及NVIDIA Spectrum-6 SPX以太网这五种机架整合为一个高度集成的统一系统。
图3 NVIDIA Vera Rubin POD 包括5个机架级系统、1台AI超级计算机、1台NVIDIA MGX机架架构和生态系统(来源:NVIDIA技术博客,作者Rohil Bhargava;Taylor Allison;Harry Petty)
与上一代平台相比,Vera Rubin智能体处理吞吐量达到Grace Blackwell平台的10倍。这一架构的颠覆性在于,它打破了“围绕GPU组装系统”的传统思路,转向“为AI工厂设计整机”。七款芯片并非简单的功能叠加,而是围绕代理式AI的工作流特征进行了深度协同优化。
其中,Vera CPU的发布尤其值得细读。作为全球首款专为代理式AI与强化学习时代打造的处理器,它搭载了88颗NVIDIA定制的Olympus核心,拥有1.2TB/s的内存带宽以及高速片上互连架构。在Phoronix的STREAM TRIAD测试中,Vera能够持续保持其峰值内存带宽的90%。同时,与传统x86 CPU相比,Vera每核心的内存带宽提升超过4倍。这些数字背后是一个关键判断:传统x86 CPU并非为智能体工作负载设计,其在并发任务调度、上下文切换和内存带宽方面的瓶颈,正在成为AI工厂效率的隐性天花板。Vera CPU不是去替代x86,而是开创了一个全新的处理器类别。
图4 NVIDIA Vera CPU 正式发布(来源:NVIDIA)
Vera Rubin的架构价值,不仅在于性能数字的跃升,更在于其对AI工作负载全生命周期的覆盖——从大规模预训练、后训练、测试阶段扩展,到实时智能体式推理。平台通过机架级资源池化与任务调度,实现了计算、内存与I/O的动态匹配。企业不再需要为训练、推理、智能体协调分别搭建异构集群,一套Vera Rubin POD即可统一承载。
03 网络、存储与安全:被低估的“隐形战场”
如果说计算是AI工厂的生产线,那么网络就是它的物流系统,存储是它的仓库,安全则是它的门禁。在Vera Rubin的全栈设计中,这三个看似“配角”,实际决定着系统的上限。
在网络层面,NVIDIA Spectrum-X以太网硅光技术现已全面量产。新一代Spectrum-X交换机基于光电一体封装技术(CPO)构建,支持Vera Rubin平台在数据中心进行横向扩展和跨区域扩展部署AI工厂。对于代理式AI而言,这意味着多智能体协作、分布式推理与大规模模型并行将获得更高效的网络支撑,显著降低通信开销对整体吞吐量的侵蚀。凭借简化设计,为计算释放更多电力,NVIDIA 光电一体封装技术网络为百万 GPU AI 工厂提供了基础架构
在存储层面,NVIDIA BlueField-4 STX模块化参考架构直接回应了代理式AI对长上下文推理能力的存储需求。该架构可助力企业、云计算及AI服务商轻松部署加速存储基础设施,满足智能体在多步骤工作流中产生的大量上下文数据与KV缓存的存取需求。BlueField-4 DPU将存储与网络功能从主CPU卸载,释放更多计算资源用于核心AI任务。STX架构将存储从“被动仓库”升级为“主动处理节点”——它不再只是存放数据,而是直接参与智能体与上下文记忆之间的交互管理。
在安全层面,NVIDIA为Vera BlueField-4 STX推出了全新的DOCA安全创新技术,实现代理式AI工厂的新型内置安全存储。基于统一的NVIDIA DOCA安全套件,并在BlueField-4芯片内强制执行,STX平台能够在线检查和管理智能体、数据与上下文记忆之间的交互,帮助企业在AI数据路径中持续执行策略。这种芯片级安全能力,在大规模AI环境中为基础设施、工作负载、智能体和数据提供了运行时检测、数据访问控制以及加速网络执行的全栈保护。考虑到AI工厂带来的全新攻击面——涵盖基础设施、软件供应链、模型、数据以及执行权限日益扩展的自主智能体——传统安全架构已明显不足。DOCA的芯片级强制执行,本质上是在数据流动的每一个节点嵌入安全基因,而非在事后增加安全层。
04 每Token成本:AI基础设施竞争的终极标尺
Vera Rubin全栈设计的最终指向,是一个看似简单却极具分量的指标:每Token成本。
传统数据中心过去主要用于数据的存储、检索与处理。但在生成式AI与代理式AI时代,这些设施已演变为AI Token工厂。随着AI推理成为核心工作负载,它们的主要产出已转变为以Token形式制造的智能。这一转变要求对包括总体拥有成本(TCO)在内的AI基础设施经济效益评估方式进行全面调整。
每Token成本决定了企业能否实现AI的规模化盈利。它是唯一能够直接综合反映硬件性能、软件优化、生态系统支持以及实际利用率的TCO指标。NVIDIA在这一指标上实现了行业更低的每Token成本,这并非来自某一颗芯片的制程优势,而是来自Vera Rubin机架级协同设计的系统性效率——Vera CPU减少协调开销、Rubin GPU加速推理、Spectrum-X降低通信延迟、BlueField-4优化存储路径、DOCA减少安全损耗。当竞争对手还在优化单点性能时,NVIDIA已经在优化整个系统的“Token 产出率”。
表1 每Token成本比每美元FLOPS的差异性(来源:NVIDIA技术博客,作者Shruti Koparkar)
小结
AI基础设施的竞争,已悄然从单一芯片的制程竞赛,转向全栈系统的协同效率竞赛。NVIDIA通过Vera Rubin平台及其配套的网络、存储与安全创新,构建了一个面向代理式AI时代的完整生产系统。
Vera CPU对代理式工作负载的专门优化、Spectrum-X硅光技术对数据中心横向扩展的支撑、BlueField-4 STX对长上下文存储的加速,以及DOCA芯片级安全对AI数据路径的守护,共同构成了AI工厂的“新基建”标准。Gartner将2026年定义为企业AI支出的拐点——当企业从战术性试点走向规模化部署,基础设施的TCO效率将直接决定AI商业化的成败。
在这一背景下,NVIDIA以“每Token成本”为核心指标,通过Vera Rubin的全面投产与全栈技术的深度协同,正在为全球AI工厂注入强劲动力。从Grace Blackwell到Vera Rubin,变的不仅是命名规则,更是AI基础设施从“算力供应商”到“智能生产伙伴”的角色跃迁。未来,随着代理式AI在企业工作流中的渗透率持续提升,NVIDIA所定义的机架级协同架构,或将成为AI基础设施的事实标准。