多模态输入价降72%,阿里云把价格战打到了AI检索这一环
阿里云正在五天之内第二次改价。
大模型服务平台百炼的公告显示,北京时间2026年8月31日10:13:53起,北京地域Qwen3-VL-Rerank模型计费单价下调:文本输入从0.7元/百万tokens降至0.5元,多模态输入从1.8元/百万tokens降至0.5元,降幅约72%。而8月27日12:00起,Qwen3.8-Flash已经先行调整,输入价从1元/百万tokens降到0.8元,输出价从3元降到2.7元。
有意思的地方在于,这次降价幅度最大的不是聊天和写代码的主力模型,而是重排序(Rerank)——一个普通用户几乎从没听过、却决定企业AI搜索准不准的环节。而且新价0.5元/百万tokens,已经低于Qwen3.8-Flash降价后的0.8元输入价,更远低于Qwen3.8-max的12元输入、36元输出。看图看视频的输入价,压过了读字的模型价。阿里云在公告里没有解释这轮调价的原因。
为什么先砍重排序:输入量在这里最容易失控
重排序干的事很具体。典型的企业AI搜索流程是:先用向量模型(Embedding)从知识库里粗捞出50到100条可能相关的资料,再用重排序模型逐条精读、重新打分,挑出最相关的5到10条交给大模型生成答案。这一步用的是交叉注意力机制,准确率明显高于粗检索,代价是每一次都要把候选资料整段喂进模型。
阿里云官方文档给出的参数上限,正好说明了钱花在哪里:Qwen3-VL-Rerank单条内容最大8000 tokens,单次请求最高可达12万tokens,一次请求最多可放100篇文本、40张图片或4个视频。也就是说,一个图文检索请求轻松就是几万tokens的输入,而输出只是一串排序分数。输入价就是这类应用的成本大头——这解释了为什么72%的降幅落在多模态输入上,公告里也没有出现输出价的调整。
换句话说,对做电商图库检索、企业知识库、内容审核、监控回溯的团队来说,这次降价打在了他们账单上最厚的那一层。
牌价之外,真正的成交价早就不是表上那个数
如果把这次调整理解成"阿里云毛利让出72%",可能低估了云计算定价游戏的复杂度。
百炼的计费文档里同时挂着几套折扣机制:支持Batch调用的模型,输入输出单价都按实时推理价格的50%计算;支持上下文缓存的模型,缓存命中的输入token只按标准输入价的10%计费,创建显式缓存则按125%计费;部分模型还按单次请求的输入token量实行阶梯计价。此外,华北2(北京)地域多数模型带100万tokens免费额度,有效期为开通或模型发布起90天。
这意味着大客户的有效价格从来不是牌价,而是牌价乘上一串折扣组合。在这层结构下,把多模态输入的名义价从1.8元压到0.5元,更现实的作用是三件事:把折扣从谈判桌搬到明面上、把中小开发者的心理门槛拆掉、以及给整个检索环节定一个新的价格锚点。真正被冲击最直接的,是以API单价为生的专业向量与重排序厂商——阿里云文档里已经放着一张"从闭源模型迁移到百炼"的对位表,把OpenAI的text-embedding-3-large、Cohere的embed-v4、Voyage的3-large直接列为被替代对象。
全球同向:从卖溢价到卖规模
阿里云不是唯一在改价格的。
21世纪经济报道旗下e公司的梳理称,OpenAI日前宣布其旗下一款大模型价格下调20%以上,输出价格降到20美元/百万tokens;谷歌本月中旬发布Gemini 3.7 Flash,首发价定为前代模型的一半;Anthropic本月早些时候取消了原定的涨价计划,把首发优惠价确定为永久执行价格。这些说法未给出全部模型名称与原价,具体口径仍需以厂商方价目表为准。
央视财经援引一家名为"企业DNA"的咨询机构报告称,美国企业AI模型降价速度之快"颇不寻常",可能推动前沿高端模型市场格局变化;该报告的一个比喻更直白:半年前前沿模型还在大搞高端溢价,如今更像一场围绕普通大宗商品的基建竞赛。也有分析认为,这轮降价的直接压力来自开源模型对闭源模型的挑战。这些都属于外部机构的判断,而非已经验证的事实。
云厂商为什么愿意接受单价下滑,国泰君安期货在8月27日那轮降价时的分析说得很直接:降价有利于扩大智能体和推理调用,但单位token收入会下降,云厂商需要依靠调用量增长和推理效率提升来维持算力回报。
阿里的账本提供了这套逻辑的参照。阿里巴巴在2025年11月发布的季度财报中披露,当季云收入同比增长34%至398.24亿元,AI相关产品收入连续九个季度实现三位数同比增长,并占外部客户收入比重超过20%;管理层当时还提到,AI服务器上架节奏跟不上客户订单增长。单价下行与调用量、AI收入占比上行同时发生,才是这场价格战真正的底色。而另一侧,DRAM、存储等产业链环节的涨价说明,推理成本并不必然跟着下降——降价空间更多来自战略取舍与效率,而不是成本红利。
接下来值得盯的四个信号
第一,看输出价和旗舰档是否跟降。这轮只动了输入侧,尤其是多模态输入,如果Qwen3.8-max这一档的12元/36元开始松动,才说明降价从边缘环节回到了主战场。第二,看Batch半价、缓存10%这些机制是否被并入牌价,也就是有效价格是否显性化。第三,看云厂商财报里AI收入占比与token调用量的增速差——单价换量的模式能不能跑通,最终要由这两个数字的比值来判。第四,看海外厂商的"首发优惠价"能否守住永久价,这是判断降价是短期获客还是结构性变化的最直观指标。
对正在算AI账的中小企业和独立开发者来说,结论其实很简单:模型单价这一项,短期内大概率不会再涨回去;真正会持续上涨的,是你调用它的次数。
参考数据来源
- 财联社 ·《阿里云宣布Qwen3-VL-Rerank模型降价》(转引阿里云百炼公告)· 2026年9月1日 · https://www.cls.cn/detail/2470344
- 阿里云帮助中心 · 百炼模型调用计费规则与价目表、重排序模型说明 · 截至2026年9月1日现行页面 · https://help.aliyun.com/zh/model-studio/model-pricing
- 21世纪经济报道(e公司)·《阿里云大模型宣布降价》· 2026年9月1日 · https://m.21jingji.com/article/20260901/herald/9adf784beb37465ae00f2699f79c7d37.html


