
9月15日,在圣克拉拉举行的AI基础设施峰会上,英伟达联合半导体研究机构SemiAnalysis发布AgentX基准测试结果。数据显示,在代理式编码推理工作负载下,英伟达Vera Rubin NVL72系统的每兆瓦吞吐量较其现行旗舰GB300 NVL72系统高出多达30倍。需注意的是,该数据基于早期硅片测试,相关软件优化仍在进行中。
这一结果的发布标志着行业关键转折:电力供应而非原始算力,已成为AI工厂收入的主要瓶颈。对于受限于电网配额的数据中心运营商而言,每兆瓦吞吐量提升30倍,意味着在相同电力预算下可支持的并发AI代理会话数量增加30倍。
AgentX:方法论重构基准测试逻辑
传统AI推理基准测试(如MLPerf Inference)通常通过输入固定长度提示词并测量每秒输出令牌数来评估性能。这种方法适用于孤立问答场景,但无法反映代理式AI的真实工作状态。
代理式AI会话涉及查询数据库、调用子代理、综合信息等复杂流程,上下文迅速累积。OpenRouter数据显示,单个代理请求消耗的令牌量约为普通聊天交互的15倍。AgentX通过重放393个匿名化的真实世界编码代理轨迹来解决这一差距。这些轨迹源自SemiAnalysis内部Claude Code的实际使用,保留了生产环境中的提示词大小、工具调用时机及KV缓存结构。生成该语料库成本超过300万美元,并以Apache 2.0许可证在HuggingFace公开,确保可独立验证。
语料库中位数会话包含14.2万个输入令牌和444个输出令牌,输入输出比约为320:1,这与传统基准测试锚定的8K输入/1K输出场景截然不同。AgentX的核心指标是给定交互水平下的每兆瓦令牌数,旨在捕捉高并发长上下文会话中的性能表现。
能效跃升:从GB300到Vera Rubin
在DeepSeek V4 Pro模型(1.6万亿参数混合专家架构)测试中,Vera Rubin NVL72的每兆瓦吞吐量比GB300 NVL72高出30倍,每百万令牌成本降低45倍。作为参照,GB300 NVL72本身的每兆瓦吞吐量已是英伟达Hopper H200 NVL8的15倍,Vera Rubin在此基础上实现了翻倍优势。
这种优势在高并发场景下尤为显著。在每用户每秒11个输出令牌的低交互目标下,Vera Rubin相比GB300保持约2倍优势;但当并发提升至每用户每秒160个令牌时,差距扩大至30倍。这表明Vera Rubin架构专门针对代理式工作负载的高并发、长上下文模式进行了优化。
电力成为新瓶颈,DSXMaxLPS显效
随着新建电力基础设施周期长达数年,冷却能力限制迫使运营商更积极管理热负荷。英伟达高管Ian Buck指出,AI基础设施指标正从峰值性能转向经过验证的每兆瓦代理式令牌数。
峰会期间,AI云提供商Lambda发布的独立验证显示,英伟达软件级动态电源分配系统DSX MaxLPS能在原定16个节点的电力预算内运行19个节点,使集群令牌吞吐量提升24%,每瓦性能提高23%。英伟达表示,在Vera Rubin部署中,该技术可在相同兆瓦预算内实现40%更多的GPU容量。
架构解析:端到端优化驱动效率
Vera Rubin的效率提升源于为代理式工作负载端到端设计的系统架构:
- 分离式服务:通过英伟达Dynamo将上下文处理(预填充)与响应生成(解码)分开,分别路由至不同GPU池,独立扩展计算与内存带宽需求。
- KV感知路由:将请求引导至持有相关缓存上下文的GPU,避免冗余重新计算,这是长上下文会话吞吐量的关键驱动因素。
- 大规模专家并行:借助NVLink 6互连,在72-GPU规模下分布混合专家模型(MoE)的子网络,实现令牌并行路由。
- NVFP4量化:Rubin GPU第五代Tensor Cores原生执行4位浮点精度量化,减少内存占用并提升功耗包络内的吞吐量。
- NVLink 6互连:提供每GPU每秒3.6太比特双向带宽,低延迟和高带宽确保了在机架规模下分发KV缓存和路由MoE专家时的效率。
生态信号与待解问题
峰会吸引了超8,000名与会者,显示出生态系统的扩展。Emerald AI展示了利用DSX Flex进行自动负载降低以响应公用事业需求;亚马逊Annapurna Labs正合作开发自定义高带宽内存NVHBM;D-Matrix则集成NVLink Fusion以实现低延迟推理。
尽管Vera CPU在多家初创公司的基准测试中表现出显著的性能提升,但其对代理式工具调用的贡献尚未纳入AgentX当前结果,这意味着Vera Rubin平台的完整效率优势仍有待进一步表征。
未来行业关注点主要集中在三个方面:首先,AgentX目前仅基于编码工作负载,其在检索增强生成等其他代理场景中的泛化能力尚未经过测量;其次,随着软件优化持续进行,Vera Rubin与GB300的性能差距可能进一步变化;最后,AgentX的治理独立性面临考验,尽管其开源语料库和独立仪表板提供了透明度,但主要实施文档由英伟达托管,行业需观察AMD、Google等厂商提交结果后的接受度,以确定其能否成为真正的行业标准。