英伟达Vera Rubin实测:每兆瓦吞吐最高提升30倍
最新实测:同功耗下多完成30倍AI代理工作
8月24日,英伟达在Hot Chips 2026大会期间首次公布了Vera Rubin NVL72系统的片上实测数据。在搭配DeepSeek-V4-Pro运行AgentX编码基准测试时,该系统每兆瓦吞吐量较上一代GB300 NVL72最高提升30倍,每百万Token成本最高降低35倍。英伟达官方技术博客对这一数据进行了背书,测试目前待SemiAnalysis方最终审核确认。
同场发布中,英伟达确认Groq 3 LPX推理加速器已全面量产,在Artificial Analysis基准中运行Gemma 4 31B模型时输出速度达到3400 Token/s,处理10万Token长上下文任务时,5000 Token生成时间从50秒级降至约1.5秒。SpaceXAI宣布将采用Vera CPU构建下一代AI代理架构,并计划2028年将Vera Rubin部署于AI卫星。
核心商业判断:从训练向推理的价值迁移正在加速
这项技术变化最终改变了AI推理服务的成本结构和订单分配。当每兆瓦吞吐提升30倍、每百万Token成本降低35倍时,AI推理不再是一个"能用就行"的辅助环节,而变成了具有明确经济模型的规模化业务。
对云计算厂商而言,功耗是数据中心扩容的第一硬约束。英伟达DSX MaxLPS电源管理技术可在同兆瓦预算内多配置40%的GPU,意味着在不扩建电力基础设施的前提下,算力密度可以直接转化为收入密度。对AI应用开发商而言,Token成本的断崖式下降使得"持续运行AI代理"从概念验证走向商业可行。据OpenRouter数据,代理式AI工作负载消耗的Token量是简单聊天请求的15倍,这种需求爆发使得能效成为决定AI工厂盈利能力的核心指标。
能效优势如何传导至产品与订单
Vera Rubin NVL72的能效提升并非来自单一组件升级,而是从芯片到机架的系统级协同设计。
在GPU层面,Rubin架构搭载第五代Tensor Core和第三代Transformer Engine,支持NVFP4 4-bit量化推理,在压缩模型体积的同时保持输出质量。在CPU层面,Vera CPU采用88核自研Olympus核心,LPDDR5X内存带宽达1.2TB/s,专为AI代理的工具调用、代码执行和数据预处理等CPU密集型任务优化。
网络层面,第六代NVLink互联技术支持72颗GPU在scale-up域内高效实现大规模专家并行和分布式KV缓存。加上Spectrum-X Multiplane网络可扁平化扩展至51.2万颗GPU而不增加第三层网络,AI工厂的规模天花板被大幅抬高。
这套架构直接指向一个商业结果:谁能以更低Token成本提供更高吞吐的推理服务,谁就能承接更多AI代理工作负载。Nebius已成为首家采用Groq 3 LPX的AI云厂商,CoreWeave则在生产环境部署Spectrum-X Multiplane连接Vera Rubin机架。
谁受益,谁承压
Vera Rubin的能效优势若得到第三方验证,最直接受益的是已经深度绑定英伟达生态的超大规模云厂商——AWS、Azure、GCP以及CoreWeave、Nebius等AI原生云。他们可以在不增加功耗预算的前提下显著提升推理收入,同时将节省的电力成本转化为价格竞争力。
承压方则包括两类:一是专注于推理加速的独立芯片公司。Groq(已被英伟达收购并整合为Groq 3 LPX产品线)、Cerebras、SambaNova等企业在单一推理性能指标上可能有亮点,但在"GPU+LPU+网络+软件"的全栈协同面前,独立方案的经济性面临挑战。二是仍在使用Hopper甚至更早架构的中小型推理服务提供商,在30倍能效差距面前,继续运营旧硬件的单位经济模型将被逐步击穿。
不过,这一判断需要加上关键约束:30倍吞吐和35倍成本降低是"最高"值,实际表现取决于模型类型、上下文长度、批量大小和软件优化程度。英伟达官方博客明确指出,这些数据目前"尚未反映Vera CPU在工具调用侧的性能",且测试仍在等待SemiAnalysis方的独立审核。
能否持续:从首测到规模部署的时间窗口
Vera Rubin目前已进入全面量产阶段,纬创得州沃斯堡工厂已为下一代产品预留产线。但历史经验表明,英伟达实验室数据与第三方大规模部署之间通常存在6至12个月的优化周期。
GB300 NVL72在今年3月GTC大会发布时同样宣称了显著的性能提升,但其实际交付和第三方验证到年中才逐步完成。Vera Rubin能否缩短这一周期,取决于DSX MaxLPS电源管理、TensorRT-LLM推理运行时和分布式KV缓存等软件栈的成熟速度。
另一个值得关注的变量是英伟达收购Groq的交易状态。英伟达已将Groq 3 LPX作为Vera Rubin平台的推理加速器纳入产品矩阵并宣布全面量产,但截至发稿,这笔据称200亿美元的交易尚未在SEC EDGAR数据库中找到正式备案文件。交易细节的透明度将影响市场对其整合节奏和产能分配的判断。
风险边界
需要明确的风险和待确认事项:第一,30倍吞吐和35倍成本降低是"最高值"(up to),并非所有场景都能达到;第二,SemiAnalysis AgentX基准测试的完整方法论和原始数据尚未公开,独立审核仍在进行中;第三,英伟达收购Groq的200亿美元交易尚未找到SEC filing确认;第四,SpaceXAI 2028年AI卫星部署计划来自发布会PPT,非正式财务文件;第五,AI推理市场的实际需求增长能否消化Vera Rubin的产能,取决于AI代理应用的商业化进度,而非单纯的技术指标。
参考数据来源
- NVIDIA官方博客:《Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Standard for AI Agents》,2026年8月24日,https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents/
- NVIDIA官方博客:《With Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference for Agents》,2026年8月24日,https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/
- NVIDIA新闻稿:《NVIDIA Groq 3 LPX Now in Full Production with World-Class Speed for Agentic AI》,2026年8月24日,https://nvidianews.nvidia.com/news/nvidia-groq-3-lpx-now-in-full-production-with-world-class-speed-for-agentic-ai
- Hot Chips 2026会议,https://www.hotchips.org/
- SemiAnalysis AgentX基准介绍,https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat


