62万亿Token跑在国产芯片上:一次被绕开的算力封锁
2026年8月26日,智谱正式开源GLM-5.3-Flash。这个模型此前以匿名代号“牛来”在OpenRouter和OpenCode两个海外平台测试,5天内累积62万亿Token调用量,刷新双平台历史纪录。一个关键细节被多数报道忽略:全部线上流量由超过10万张国产芯片集群承载。这是国产算力芯片首次在全球真实业务负载下完成大规模验证——不是实验室跑分,不是政策示范项目,而是全球开发者用脚投票的真实选择。
一条走不通的老路
过去三年,国产AI芯片面临同一个困局:有产品,缺客户。
华为昇腾、海光DCU、摩尔线程MTT——这些芯片在纸面参数上不断缩小与英伟达的差距,但始终缺少一个在全球真实业务场景中大规模运行的证明。海外客户不敢用,因为没人证明过稳定性;国内需求不够饱和,因为AI推理的大规模商业化才刚刚起步。更棘手的是,美国出口管制持续收紧,国产芯片即便想走正常的硬件出口渠道,也几乎没有可能。
芯片造出来了,但谁来买?买了之后跑什么?跑完之后谁给反馈?这三个问题形成闭环,国产芯片一直在里面打转。
不卖芯片,卖模型
智谱选择了一条迂回路径。
它没有试图把国产芯片直接卖给海外客户,而是把自研大模型作为载体——全球开发者在OpenRouter和OpenCode上调用GLM-5.3-Flash时,底层跑的就是国产芯片的算力。芯片不出海,算力出海。硬件被封锁,软件绕过去。
这条路径能走通,核心在于推理成本的控制。GLM-5.3-Flash做了几件关键的事:架构层面,层数从上一代的92层减至45层,首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,注意力计算量降低3.01倍,KV缓存降低4.44倍;工程层面,基于SGLang构建专用推理引擎,采用W8A8量化和EPD分离式架构,端到端服务性能较初始基线提升3倍。
智谱技术文档称,“硬件效率及单token成本已达到与主流英伟达GPU相当水平”。这句话的含金量需要拆解:它没有明确对标英伟达哪款GPU——是H100还是B200?也没有经过第三方独立验证。但定价本身说明了问题:GLM-5.3-Flash输入0.8元/百万token,输出2.8元/百万token,是Claude Opus 4.8的1/40,是上代旗舰GLM-5.3的1/10(限时折扣内为1/20)。
全球开发者用脚投票
低价模型在全球平台引发了巨大流量。5天内,OpenRouter和OpenCode累计消耗超50万亿token,使用量超过DeepSeek两倍以上。半导体研究机构SemiAnalysis在X平台评价:“所有流量均由国产芯片承载……CUDA护城河再度受到考验。”
这里需要厘清一个概念:OpenRouter是AI模型路由聚合平台,提供统一API接入多家模型;OpenCode是开源AI编码代理工具,拥有195K GitHub Stars和1600万月活开发者。它们不是传统的模型排行榜,而是全球开发者日常调用模型的工作台。一个中国模型在这两个平台上登顶,意味着它进入了全球开发者的真实工作流。
谁在受益,谁在承压
这条路径一旦跑通,受益最大的不是智谱本身,而是它背后的国产芯片供应商。
据《晚点LatePost》报道,这批芯片的供应商或来自华为、摩尔线程与海光,但智谱官方对此未予置评,具体品牌构成比例尚未披露。如果这一信息属实,意味着华为昇腾、海光DCU、摩尔线程首次获得了来自海外市场的规模化推理订单。
这比一次性的政府采购或国内数据中心部署更有价值。原因有二:第一,海外平台的流量是持续性的,只要模型保持竞争力,芯片就有持续的收入来源;第二,全球开发者的真实使用反馈——哪些算子在极端负载下不稳定、哪些推理场景延迟偏高——可以反向驱动芯片迭代,形成“软件反馈→硬件优化”的正向循环。这正是英伟达CUDA生态多年积累的核心壁垒:不是芯片本身有多强,而是整个生态在持续提供反馈和迭代。
对国内AI企业而言,这条路径也意味着算力成本可能进一步下降。当国产芯片通过大模型出海获得规模化订单后,产能利用率提升,单位成本下降,国内客户也将受益。
但承压的一方同样清晰:如果国产芯片在推理场景中的性价比持续逼近英伟达,那么后者在中国市场的定价权将受到侵蚀。SemiAnalysis所说的“CUDA护城河再度受到考验”,指向的正是这个趋势。
这条路的边界在哪里
需要冷静看待的是,一次测试验证不等于长期竞争力确立。
首先,10万张芯片的品牌构成比例尚未披露,华为、海光、摩尔线程各占多少,直接影响对各家芯片厂商实际受益程度的判断。其次,“单token成本与主流英伟达GPU相当”是智谱自述,对标基准和测试条件需要第三方验证。第三,大模型赛道迭代极快,GLM-5.3-Flash的AA智能指数57分与Claude Opus 4.8持平,但模型竞争是动态的,DeepSeek V4 Flash在提价后调用量即下滑一半,说明价格优势窗口可能很短。
对关注国产芯片产业链的投资者而言,这更多是一个中长期的产业信号,而非短期业绩兑现的催化剂。路径被验证了,但从验证到规模化收入,中间还有产能爬坡、客户留存、模型持续迭代等多重关卡。
真正值得关注的不是某一家公司的短期股价波动,而是一个结构性变化:国产芯片正在尝试通过“大模型+算力”的打包模式,绕开硬件封锁,进入全球AI推理市场。如果这条路走通了,整个国产半导体产业链的估值逻辑都将被重写。
参考数据来源
- 智谱AI:《GLM-5.3-Flash开源发布》,2026年8月26日,https://bigmodel.cn/blog/glm-5.3-flash-open-source
- 华尔街见闻(网易号转载):《智谱新模型“牛来”跑在10万国产卡上,SemiAnalysis评价“英伟达护城河再受考验”》,2026年8月27日,https://www.163.com/dy/article/L5AU2GOR05198NMR.html
- 每日经济新闻(网易号转载):《智谱正式开源GLM-5.3-Flash》,2026年8月27日,https://www.163.com/dy/article/L5B8LHR20512B07B.html


