BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年08月27日

注册 / 登录

62万亿Token跑在国产芯片上:一次被绕开的算力封锁

2026年8月26日,智谱正式开源GLM-5.3-Flash。这个模型此前以匿名代号“牛来”在OpenRouter和OpenCode两个海外平台测试,5天内累积62万亿Token调用量,刷新双平台历史纪录。一个关键细节被多数报道忽略:全部线上流量由超过10万张国产芯片集群承载。这是国产算力芯片首次在全球真实业务负载下完成大规模验证——不是实验室跑分,不是政策示范项目,而是全球开发者用脚投票的真实选择。

一条走不通的老路

过去三年,国产AI芯片面临同一个困局:有产品,缺客户。

华为昇腾、海光DCU、摩尔线程MTT——这些芯片在纸面参数上不断缩小与英伟达的差距,但始终缺少一个在全球真实业务场景中大规模运行的证明。海外客户不敢用,因为没人证明过稳定性;国内需求不够饱和,因为AI推理的大规模商业化才刚刚起步。更棘手的是,美国出口管制持续收紧,国产芯片即便想走正常的硬件出口渠道,也几乎没有可能。

芯片造出来了,但谁来买?买了之后跑什么?跑完之后谁给反馈?这三个问题形成闭环,国产芯片一直在里面打转。

不卖芯片,卖模型

智谱选择了一条迂回路径。

它没有试图把国产芯片直接卖给海外客户,而是把自研大模型作为载体——全球开发者在OpenRouter和OpenCode上调用GLM-5.3-Flash时,底层跑的就是国产芯片的算力。芯片不出海,算力出海。硬件被封锁,软件绕过去。

这条路径能走通,核心在于推理成本的控制。GLM-5.3-Flash做了几件关键的事:架构层面,层数从上一代的92层减至45层,首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,注意力计算量降低3.01倍,KV缓存降低4.44倍;工程层面,基于SGLang构建专用推理引擎,采用W8A8量化和EPD分离式架构,端到端服务性能较初始基线提升3倍。

智谱技术文档称,“硬件效率及单token成本已达到与主流英伟达GPU相当水平”。这句话的含金量需要拆解:它没有明确对标英伟达哪款GPU——是H100还是B200?也没有经过第三方独立验证。但定价本身说明了问题:GLM-5.3-Flash输入0.8元/百万token,输出2.8元/百万token,是Claude Opus 4.8的1/40,是上代旗舰GLM-5.3的1/10(限时折扣内为1/20)。

全球开发者用脚投票

低价模型在全球平台引发了巨大流量。5天内,OpenRouter和OpenCode累计消耗超50万亿token,使用量超过DeepSeek两倍以上。半导体研究机构SemiAnalysis在X平台评价:“所有流量均由国产芯片承载……CUDA护城河再度受到考验。”

这里需要厘清一个概念:OpenRouter是AI模型路由聚合平台,提供统一API接入多家模型;OpenCode是开源AI编码代理工具,拥有195K GitHub Stars和1600万月活开发者。它们不是传统的模型排行榜,而是全球开发者日常调用模型的工作台。一个中国模型在这两个平台上登顶,意味着它进入了全球开发者的真实工作流。

谁在受益,谁在承压

这条路径一旦跑通,受益最大的不是智谱本身,而是它背后的国产芯片供应商。

据《晚点LatePost》报道,这批芯片的供应商或来自华为、摩尔线程与海光,但智谱官方对此未予置评,具体品牌构成比例尚未披露。如果这一信息属实,意味着华为昇腾、海光DCU、摩尔线程首次获得了来自海外市场的规模化推理订单。

这比一次性的政府采购或国内数据中心部署更有价值。原因有二:第一,海外平台的流量是持续性的,只要模型保持竞争力,芯片就有持续的收入来源;第二,全球开发者的真实使用反馈——哪些算子在极端负载下不稳定、哪些推理场景延迟偏高——可以反向驱动芯片迭代,形成“软件反馈→硬件优化”的正向循环。这正是英伟达CUDA生态多年积累的核心壁垒:不是芯片本身有多强,而是整个生态在持续提供反馈和迭代。

对国内AI企业而言,这条路径也意味着算力成本可能进一步下降。当国产芯片通过大模型出海获得规模化订单后,产能利用率提升,单位成本下降,国内客户也将受益。

但承压的一方同样清晰:如果国产芯片在推理场景中的性价比持续逼近英伟达,那么后者在中国市场的定价权将受到侵蚀。SemiAnalysis所说的“CUDA护城河再度受到考验”,指向的正是这个趋势。

这条路的边界在哪里

需要冷静看待的是,一次测试验证不等于长期竞争力确立。

首先,10万张芯片的品牌构成比例尚未披露,华为、海光、摩尔线程各占多少,直接影响对各家芯片厂商实际受益程度的判断。其次,“单token成本与主流英伟达GPU相当”是智谱自述,对标基准和测试条件需要第三方验证。第三,大模型赛道迭代极快,GLM-5.3-Flash的AA智能指数57分与Claude Opus 4.8持平,但模型竞争是动态的,DeepSeek V4 Flash在提价后调用量即下滑一半,说明价格优势窗口可能很短。

对关注国产芯片产业链的投资者而言,这更多是一个中长期的产业信号,而非短期业绩兑现的催化剂。路径被验证了,但从验证到规模化收入,中间还有产能爬坡、客户留存、模型持续迭代等多重关卡。

真正值得关注的不是某一家公司的短期股价波动,而是一个结构性变化:国产芯片正在尝试通过“大模型+算力”的打包模式,绕开硬件封锁,进入全球AI推理市场。如果这条路走通了,整个国产半导体产业链的估值逻辑都将被重写。

参考数据来源

  • 智谱AI:《GLM-5.3-Flash开源发布》,2026年8月26日,https://bigmodel.cn/blog/glm-5.3-flash-open-source
  • 华尔街见闻(网易号转载):《智谱新模型“牛来”跑在10万国产卡上,SemiAnalysis评价“英伟达护城河再受考验”》,2026年8月27日,https://www.163.com/dy/article/L5AU2GOR05198NMR.html
  • 每日经济新闻(网易号转载):《智谱正式开源GLM-5.3-Flash》,2026年8月27日,https://www.163.com/dy/article/L5B8LHR20512B07B.html


版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。