BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年08月26日

注册 / 登录

推理成本直降35倍:英伟达Vera Rubin平台量产

2026年8月24日,英伟达宣布新一代AI推理平台Vera Rubin NVL72全面量产,同时推出专用推理加速扩展组件Groq 3 LPX机架。在搭载DeepSeek V4 Pro模型的SemiAnalysis AgentX基准测试中,该平台每兆瓦吞吐量较上一代GB300 NVL72提升30倍,Token成本最高降低35倍。对于正在探索AI智能体商业化的企业而言,这笔算力账本可能被重新书写。

最新产品动作:从"卖芯片"到"卖效率"

英伟达此次发布并非简单的芯片迭代,而是一套完整的机架级超级计算平台。Vera Rubin平台由五个组件构成:Vera Rubin NVL72 GPU主机架、Vera CPU、Groq 3 LPX推理加速器、Vera BlueField-4 STX以及Spectrum-6 SPX以太网交换机。其中Groq 3 LPX是专为Vera Rubin设计的推理加速扩展组件,必须与NVL72主机架搭配部署。

英伟达高级总监Dion Harris在发布会上明确,该平台定位为"专为智能体AI与科学计算时代设计的机架级超级计算平台"。首批部署将落地云服务商Nebius的数据中心,预计2026年晚些时候上线。

这意味着英伟达的商业模式正在发生微妙变化:不再只强调算力规模,而是把"推理效率"和"Token经济性"摆在台面上。30倍和35倍这两个数字,本质上是在回答同一个问题——运行一个AI智能体,到底要花多少钱?

35倍降本的账本怎么算

要理解这个数字,需要先厘清三个测试口径。

首先是吞吐效率。在SemiAnalysis AgentX基准测试中,Vera Rubin NVL72运行DeepSeek V4 Pro模型,每兆瓦吞吐量达到GB300 NVL72的30倍。这个测试覆盖了Kimi K3、MiniMax M3、GLM5.3、Qwen3.5、DeepSeek V4 Pro等多个头部模型的智能体工作负载。

其次是单位推理成本。在同一测试框架下,Token成本最高降低35倍。这里的"成本"是指单位算力产出下的Token生成成本,而非硬件采购价格。成本下降主要来自两个维度:一是Rubin架构本身的能效提升,二是Groq 3 LPX在推理阶段的专项加速。

第三是响应速度。在Artificial Analysis的独立测试中,Groq 3 LPX以Gemma 4 31B模型、100K上下文条件运行,输出速度达到3400 Token/秒,在智能体编程低延迟工作负载下响应速度最高为竞争平台的4倍。

这三组数据共同指向一个事实:Vera Rubin平台在智能体场景下的单位推理经济性,相比上一代产品有数量级的改善。

为什么智能体场景需要这笔降本

降本的意义,取决于使用场景的变化。OpenRouter的数据显示,一个AI智能体工作负载的Token消耗量是简单聊天请求的15倍。当智能体从单次问答转向多步骤任务规划、工具调用和长期记忆维护时,Token消耗呈指数级增长。

在GB300时代,一次复杂智能体交互的推理成本可能高达数美元。如果35倍的降本幅度能够在实际部署中复现,单次交互成本可降至几美分区间——这将直接改变AI智能体的商业可行性方程。

但需要注意,35倍是最高降幅,实际效果取决于并发量、批处理规模、模型稀疏度和具体工作负载类型。英伟达并未披露完整的测试条件(如Batch Size和并发配置),这意味着企业客户在评估时需预留一定的折减空间。

谁受益,谁承压

受益方首先是云服务商和AI基础设施运营商。 英伟达选择将首批部署放在Nebius数据中心,暗示云厂商将成为新平台的核心分销渠道。对于阿里云、腾讯云、百度智能云等国内云厂商而言,接入Vera Rubin平台意味着能够在同等能耗预算下提供更高的推理服务容量。但具体接入时间表目前尚未公布。

其次是AI智能体应用开发者。 推理成本下降直接降低了智能体产品的运营边际成本,使高频、复杂的智能体交互场景在财务上更可持续。

承压方则是推理算力市场的竞争对手。 35倍的效率优势意味着,如果Vera Rubin能够按时交付并形成规模供应,其他GPU和推理加速器厂商需要在极短时间内拿出同等水平的能效提升,否则将面临客户流失。

能否持续:三个待观察变量

这笔降本账要真正落地,至少取决于三个变量。

第一是交付节奏。"全面量产"不等于"充足供应"。从宣布量产到云厂商大规模上线,中间还涉及良率爬坡、供应链配合和数据中心改造。Nebius的部署预计在"今年晚些时候",这一时间窗口需要持续跟踪。

第二是测试条件的透明度。30倍和35倍的数据来自英伟达官方发布的基准测试结果,目前尚未看到第三方独立验证。SemiAnalysis虽然是业内受认可的分析机构,但其AgentX基准的具体配置(并发量、批大小、量化精度等)仍需更详细的披露。

第三是国内市场的可及性。Vera Rubin作为英伟达最高规格的AI推理平台,是否能够以合规形式进入中国市场,仍存在不确定性。这可能影响国内云厂商和AI企业的部署节奏。

核心商业判断

英伟达正从"卖算力"转向"卖算力效率"。Vera Rubin平台把Token成本和推理能效直接摆在商业谈判桌上,本质上是在降低AI智能体大规模部署的门槛。如果35倍的降本幅度能够在实际生产环境中复现,AI智能体的商业化将从"技术可行性"迈入"经济可行性"阶段。但这笔账的最终答案,取决于交付节奏、测试透明度和区域市场的合规路径。

参考数据来源

  • 英伟达官方:《NVIDIA Vera Rubin NVL72 全面量产公告》,2026年8月24日,https://nvidianews.nvidia.com/news
  • 英伟达官方产品页:《Vera Rubin NVL72 数据中心平台》,2026年8月,https://www.nvidia.com/en-us/data-center/vera-rubin-nvl72/
  • 财联社(科创板日报):《英伟达新一代算力平台补齐拼图 结合DeepSeek模型Token成本可降35倍》,2026年8月25日,https://www.cls.cn/detail/2463176
  • Artificial Analysis 测试数据,2026年,https://artificialanalysis.ai/
  • OpenRouter 智能体Token消耗数据,2026年,https://openrouter.ai/


版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。