BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年08月26日

注册 / 登录

英伟达Groq 3 LPX量产:AI推理进入双架构时代

2026年8月24日,英伟达宣布NVIDIA Groq 3 LPX推理加速器全面量产。在Artificial Analysis基准测试中,该架构在智能体编程与低延迟工作负载下,响应速度达到最接近替代平台的4倍。新云厂商Nebius成为首个采用该产品的AI云服务商,计划于年内正式上线服务。这标志着英伟达在2025年底以约200亿美元获取Groq LPU技术许可后,交出了首份商业化答卷——AI推理芯片市场,正式进入GPU与LPU双架构并行时代。

第一幕:变化发生

过去两年,AI行业围绕推理成本展开了一场静默战争。大模型训练完成后的推理部署,正在消耗比训练阶段更多的算力。当用户向AI应用发送一条消息,背后需要GPU集群实时生成回复。响应速度,决定了用户体验;延迟,决定了应用场景的边界。

Groq 3 LPX的出现,直接切中了这个痛点。该LPX机架搭载256个LPU加速器,配备128GB SRAM和40PB/s的SRAM带宽。与GPU依赖HBM显存不同,LPU以SRAM为核心架构,牺牲了部分吞吐能力,换来的是极致的延迟表现。

这不是实验室里的参数竞赛。英伟达高级总监Dion Harris明确表示,云厂商将可以针对高质量Token输出收取更高费用,为对延迟极度敏感且有SLA约束的企业用户提供高溢价套餐。换句话说,低延迟本身,正在成为一项可以定价的服务。

第二幕:旧规则

在LPU入局之前,AI推理市场几乎是GPU的独角戏。

从英伟达的A100到H100,再到AMD的MI300系列,GPU之所以成为推理主力,核心逻辑在于其强大的并行计算能力和成熟的软件生态。大语言模型的推理过程包含两个阶段:预填充阶段处理输入prompt,解码阶段逐Token生成输出。GPU擅长前者,但在解码阶段,每次只生成一个Token的特性使得并行优势大打折扣。

更关键的是,GPU的HBM显存带宽虽然高达TB级,但在逐Token生成的场景下,数据搬运的延迟成为了瓶颈。这就是为什么同样一块H100,在训练时可以跑满算力,在推理时却往往只能利用到30%到50%。

行业一直在寻找答案。专用推理芯片、量化压缩、模型蒸馏,各种方案都在试图降低推理成本。但直到Groq的LPU架构出现,才有人从硬件底层重新设计了整条数据通路——用SRAM替代显存,把计算和存储拉到同一物理层面,用空间换时间。

第三幕:新变量

2025年12月24日,英伟达与Groq签署了一项非排他性推理技术许可协议。市场广泛报道的交易金额约为200亿美元,若属实,这将成为英伟达史上规模最大的技术交易。需要澄清的是,这并非传统意义上的公司收购。Groq官方确认,公司将继续独立运营,交易实质是技术资产许可和核心团队聘用——Groq创始人兼CEO Jonathan Ross及总裁Sunny Madra等核心高管加入英伟达,而Groq本体在2026年完成新一轮融资后转型新云服务商。

英伟达看中的是LPU的解码阶段统治力。2026年3月GTC大会上,英伟达正式推出NVIDIA Groq 3 LPX,将Groq的LPU技术与自家Rubin GPU架构融合,形成GPU处理预填充、LPU处理解码的双引擎方案。

一个看似矛盾的逻辑正在成立:英伟达花200亿美元买来的技术,不是为了替代GPU,而是为了让GPU更值钱。

LPX的设计取舍非常清晰:响应速度领先4倍,但吞吐量低于GPU。这意味着它不会也不适合处理大规模批量推理任务,而是精准锁定实时对话、智能体编排、金融高频交易等对延迟极度敏感的场景。

第四幕:产业和商业结果

双架构并行的格局正在重塑整条推理产业链。

对云厂商而言,Groq 3 LPX意味着产品分层的可能。高延迟容忍度的批量任务继续用GPU,低延迟刚需的任务迁移到LPU,后者可以收取显著溢价。Nebius作为首个落地客户,其定价模型和上线后的实际表现,将成为行业的风向标。

对芯片竞争格局而言,这一变化让推理市场从GPU一家独大走向场景分化。AMD、Intel、谷歌TPU等传统GPU/ASIC玩家,以及各类推理芯片创业公司,都需要重新回答一个问题:我的芯片在哪个延迟-吞吐量象限里最有竞争力?

供应链端也在发生变化。英伟达已通知最大几家客户,搭载AI芯片的服务器价格将上涨超过15%,新价格将于2027年初出货的系统生效,涵盖Vera Rubin和Grace Blackwell芯片服务器。这一涨幅背后,既有芯片本身成本上升的因素,也包含LPU产线初期的良率爬坡和产能稀缺溢价。

但需要警惕的是,LPU的低延迟优势建立在SRAM的极高成本之上。128GB SRAM的物料成本远超同等容量的HBM,这决定了LPU短期内难以在成本敏感的大规模推理场景中与GPU正面竞争。低延迟不是免费的,它需要有人为SRAM的溢价买单。

第五幕:谁的机会,谁的挑战

这场变化对不同参与者的影响并不相同。

对AI应用开发者而言,推理延迟从不可控变量变成了可选项。智能体、实时翻译、交互式AI产品的用户体验将迎来实质性提升,这可能催生一批此前因延迟瓶颈而无法落地的应用场景。

对云厂商而言,LPU开辟了新的收入曲线,但也带来了架构复杂度。如何动态调度GPU和LPU资源、如何在SLA承诺和成本控制之间取得平衡,将成为新的运营考题。

对投资者而言,核心观察指标不是LPU能否取代GPU,而是双架构模式下的整体推理毛利率是否在提升。如果英伟达通过GPU加LPU组合拳扩大了推理市场的总利润池,那么这200亿美元就是成功的战略投资。反之,如果LPU只是一个高成本的小众方案,那这笔交易的价值就需要重新评估。

AI推理的战争从未停止,只是战场从谁的算力更强变成了谁的延迟更优、成本更低。英伟达用双架构给出了自己的答案,而答案是否正确,将由未来几个季度的云厂商采购决策和终端应用反馈来验证。

参考数据来源

  • 英伟达官方新闻声明(2026年8月24日),来源:https://nvidianews.nvidia.com/
  • Groq官方新闻稿(2025年12月24日),关于技术许可协议及公司独立运营确认,来源:https://www.groq.com/newsroom
  • NVIDIA Groq 3 LPX产品技术规格页,来源:https://www.nvidia.com/en-us/data-center/lpx/
  • TechCrunch报道,2026年6月22日,来源:https://techcrunch.com
  • 21经济网/澎湃新闻转载报道,2026年8月25日,来源:https://m.21jingji.com/article/20260825/herald/be8984e6192da16edd0ebd91e535fe85.html


版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。