Vera Rubin NVL72 首测解读:每兆瓦30倍吞吐是怎么测出来的

Vera Rubin NVL72 首测解读:每兆瓦 30 倍吞吐是怎么测出来的

英伟达在 Hot Chips 2026 前公布了下一代机柜级系统 Vera Rubin NVL72 的首批实测数据:运行 DeepSeek-V4-Pro 智能体编码任务时,每兆瓦吞吐量较 GB300 NVL72 最高提升 30 倍,每百万 Token 成本最高下降 35 倍。

这组数字的测试方法、口径限制和背后的架构改动,比结论本身更有信息量。本文基于英伟达官方技术博客和新闻稿做一次拆解。

Vera Rubin 机柜家族

测试方法:用真实智能体会话做基准

这次的性能数据来自 SemiAnalysis AgentX 工作负载。它与传统推理基准的根本差异在于输入素材:AgentX 使用真实录制的智能体编码会话,保留了实际的上下文增长、工具调用和子代理派生过程。

官方配图对两类基准的差异做了直观对照:

维度传统推理基准智能体基准(AgentX 类)
流程Input → Model → OutputTask → Agent(LLM) → Tools/Env → Result
输入序列长度1K / 8K / 32K32K / 100K / 400K
请求模式单次请求多轮交互、动态序列
工具调用
任务粒度单次推理端到端任务

背景是智能体工作负载的 token 消耗结构已经变了。OpenRouter 的统计显示,智能体任务的 token 消耗是普通聊天的 15 倍。一个研究公司基本面的智能体要查财务数据库、检索新闻和公告、派生子代理做同业比较和估值建模,每一步累积的 token 都会成为下一步的输入,上下文可以涨到数十万 token。固定输入输出的传统基准覆盖不了这种模式。

传统推理基准与智能体基准的差异

30 倍的口径:峰值数据,且尚待审核

30x 是一个区间上限。官方性能曲线显示,在交互性要求 100 TPS/User 的点位,Vera Rubin 相对 GB300 的每兆瓦吞吐提升约 2 倍;150 TPS/User 时约 10 倍;只有在交互性拉满的最优点位才达到 30 倍。

AgentX 性能曲线:每兆瓦吞吐 vs 交互性要求

换句话说,这代硬件的相对优势在高交互性场景最突出。如果业务是低延迟要求的长文本批处理,实际增益会显著低于标题数字。

还有两点口径限制需要标注:这组结果目前处于 SemiAnalysis 审核阶段,属于非正式结果;数据尚未计入 Vera CPU 对工具调用密集环节的加成,后续还有上修空间。此外这是英伟达自测数据,第三方复现还没出现。

代际增益可以串起来看:官方同时给出 GB300 NVL72 相对 Hopper 架构在 DeepSeek-V4-Pro 上最高 15 倍的每兆瓦吞吐提升。Hopper 到 GB300 一代 15 倍,GB300 到 Vera Rubin 又一代 30 倍,每兆瓦性能的代际跃迁在加速,动力来自架构协同设计而非单点工艺。

架构拆解:七项推理优化加七芯片平台

英伟达把这次的跃迁归因于「极致协同设计」(extreme codesign),具体落在七项推理技术上:

  1. 分离式服务(disaggregated serving):prefill(上下文处理)与 decode(响应生成)分离部署,各自独立扩容
  2. 速率匹配(rate matching):同步 prefill 与 decode GPU 的产 token 速度以最大化效率
  3. 大规模专家并行:将 MoE 模型的专家子网络分布到 scale-up GPU 域
  4. 分布式 KV 缓存:内存扩展至整个 scale-up 域,配合分层卸载把低活跃上下文转移到主机和存储
  5. KV 感知路由:把请求定向到已持有相关缓存上下文的 GPU,减少重复计算
  6. 融合 CUDA 内核:MegaMoE 将计算与 GPU 间通信合并为单次执行
  7. 量化与算力:第五代 Tensor Core 加第三代 Transformer Engine,配合 NVFP4 将权重压到 4 比特

互联层面,第六代 NVLink 和 NVLink Switch 的包速率比商用以太网方案高 10 倍、延迟低 3 倍。电源管理上,DSX MaxLPS 在 GPU、机柜和工作负载三个层级调度功率,可在相同兆瓦预算内多配置 40% 的 GPU。

完整的 Vera Rubin 是七芯片架构:Rubin GPU、Vera CPU、NVLink 6 Switch、BlueField-4 DPU、Spectrum-6 SPX、ConnectX-9 SuperNIC,加上本次同步宣布全量生产的 Groq 3 LPX。

Groq 3 LPX:给智能体补上低延迟解码

智能体推理有一个新瓶颈:decode 延迟。智能体逐步生成响应,每个 token 的微小延迟会在复杂工作链条中层层放大。Groq 3 LPX 的定位就是加速这段延迟敏感的解码工作,与负责大规模上下文处理的 Rubin GPU 分工。

实测数据来自 Artificial Analysis 基准:运行开源智能体模型 Gemma 4 31B,在 10 万 token 长上下文场景下输出 3400 token/秒,比最近的替代平台快 4 倍。机柜级部署可包含 256 颗 LP30 加速器,通过芯片间直连构成面向确定性推理的整体引擎。

顺带澄清一个容易误读的点:Groq 3 LPX 是英伟达产品线的一部分(官方名称为 NVIDIA Groq 3 LPX),与独立公司 Groq 的 LPU 产品是两回事。

生态动向:从地面到轨道

同一周期的生态新闻里,SpaceXAI 的动向最受关注。该公司宣布部署 Vera CPU,用于加速智能体工作负载中 CPU 密集的部分:编排、工具使用、代码执行、数据处理和仿真。其基础设施正基于 Vera Rubin 平台向吉瓦级算力扩展,用于驱动 Grok。

更远的一步在轨道上:SpaceXAI 第一代 Starmind AI 卫星将采用为太空优化的 Vera Rubin NVL72 系统,按马斯克的说法,两家联合设计的这个优化版机柜计划在 2028 年大规模部署。

云端侧,Nebius 成为首家采用 Groq 3 LPX 的 AI 云厂商,将其加入 Token Factory 与 Vera Rubin NVL72 组合;CoreWeave 已在生产环境部署 Spectrum-X Multiplane 网络,用多平面并行交换连接 Vera Rubin 机柜,八平面拓扑可扩展到 51.2 万 GPU,单平面故障时仍保留约 90% 带宽。

小结

Vera Rubin NVL72 的首测数据有两个值得盯住的锚点:每兆瓦 30 倍吞吐对应电力受限 AI 工厂的营收上限,每百万 token 成本下降 35 倍对应这条营收上的利润率。对正在把智能体负载推上生产规模的团队,硬件代际切换的经济账正在变得清晰。

同时保持两个校准点:数据是厂商自测且处于 SemiAnalysis 审核阶段,30 倍是最优点位而非平均值。等第三方复现和正式审核结果出来,这组数字的含金量才能最终确认。

参考: