阿里云多模态输入价降72%,AI大模型为何集体降价
阿里云在8月的最后一周,把两档模型的价格往下砍了一截。
8月27日12点起,Qwen3.8-Flash输入单价从每百万tokens 1元降至0.8元,输出从3元降至2.7元;8月31日10点13分53秒起,北京地域的Qwen3-VL-Rerank文本输入从0.7元/百万tokens降至0.5元,多模态输入从1.8元降至0.5元,降幅约72%。两则调价公告都没有说明原因。
市场自己给出了读法。9月1日港股收盘,恒生指数跌0.93%,恒生科技指数跌1.49%,阿里巴巴收跌3.33%,京东集团跌3.21%,百度集团跌2.60%。财联社在收盘报道中把科网股走弱归因于AI大模型服务价格竞争日趋白热化,认为激进降价虽有利于应用普及,却加剧了投资者对利润空间被压缩的担忧。
把全球最贵的一门生意卖成批发价,为什么偏偏发生在这个时间点?
降的是最不起眼的那一环
Rerank(重排序)是检索增强流程里的中间步骤:系统先从企业知识库里粗筛出几十上百条可能相关的材料,再由这个模型判断哪几条真正回答了用户的问题,把它们排到前面交给大模型生成答案。它单次处理的文字量不大,但AI搜索、智能客服、知识库问答每一次问答都要走一遍,是典型的高频低值环节。
在这个环节,同一平台内部的价格差被拉到极致。阿里云百炼公示的价目表显示,旗舰模型qwen3.8-max在华北2(北京)地域的输入单价为12元/百万tokens、输出36元,而此次调价后的重排序模型输入只要0.5元,输入价相差24倍。
对开发者来说,0.5元和1.8元的差距不是账单上的小数点,而是一个AI客服、AI搜索产品敢不敢全量上线的门槛。真正被降价撬动的,是这类“每问必调、量越大越贵”的中间环节。
标价之外,价目表本身在往下走
单次调价只是看得见的部分。同一份官方价目表里还藏着另一条曲线:qwen3-max当前版本在32K token以内的输入价为2.5元/百万tokens,而被它替代的2025年9月版本同档标价是6元。一次版本迭代,把同一条产品线的入门档价格砍掉约六成,公告里连“降价”两个字都没出现。
平台同时铺开了多层折扣工具。官方规则显示,支持Batch(批量)调用的模型,输入和输出单价均按实时推理价格的50%计费;支持上下文缓存的模型,命中的输入token按标准单价的10%结算,代价是创建显式缓存时按125%计费。
两层机制合起来说明一件事:名义标价只是报价的表层,真实成交价越来越取决于调用方式。一边下调标价,一边用批处理和缓存压低高频重复调用的成本,对拼调用量的客户,实际降幅远比公告上的数字更大。
价格战不是从阿里云开始的
这轮降价的起点在硅谷。财联社8月14日报道,OpenAI于当地时间7月30日宣布把GPT-5.6 Luna的输入价从每百万tokens 1美元下调80%至0.20美元,输出价从6美元降至1.20美元;Anthropic在7月下旬上线Opus5,定价为每百万输入5美元、输出25美元,仅为自家上一代Fable5的一半,并在8月中旬取消了原定于9月生效的Sonnet5涨价计划。
AI数据研究机构Silicon Data的token价格指数显示,受实验室主动下调报价影响,自7月中旬以来的近一个月内,客户采购美国头部实验室模型的实际支出已下降近四分之一。
咨询机构“企业DNA”上周发布的研究报告,被央视财经转述为更直白的判断:仅仅在半年以前,前沿模型还大搞高端溢价,如今更像是普通大宗商品的基建竞赛。该机构与分析人士普遍认为,中国模型凭借高性价比不断获取新客户,是闭源厂商被迫把价格纳入核心竞争维度的直接压力来源。另有媒体报道称,谷歌8月中旬发布Gemini 3.7 Flash时,以前代模型一半的价格作为首发价。
链条因此闭合:美国实验室先为中端模型降价对冲中国竞品,中国云厂商再用更低单价巩固调用量,价格从“性能溢价的体现”变成“抢用量的工具”。
便宜不等于省钱,账要按任务算
降价能走多快,取决于需求端到底在比较什么。业内指出,仅凭公开的token报价无法直接横向对比真实使用成本:高性能模型完成同一项任务消耗的token更少、重试次数更低,标价偏高但总花费未必更高;同时绝大多数模型提供可调节的“算力档位”,档位越高算力越多,输出效果和最终开销一起变。
AI评测机构ArtificialAnalysis的基准测试给出了具体反差:Anthropic的Opus5在中等算力档位下,任务性能与单任务成本与月之暗面Kimi K3的最高算力档位水平相当;OpenAI的GPT-5.6 Luna开启最高算力档位后,性能与深度求索V4 Flash最高档接近,但单任务成本约为后者的两倍。
需求端的行为已经在变。财联社报道,DoorDash、爱彼迎等美国企业已开始使用中国模型来控制AI开支;Anthropic、OpenAI还把部分企业客户从固定订阅切换为按使用量计费,账单上涨压力下,一些企业给AI调用设置上限,或转而测试更便宜的替代方案。
这解释了降价的真实动机:不是让利,而是守住那些开始逐条核账的客户。当企业把AI预算从“创新经费”改按“单位任务成本”考核,token单价就从财务附注变成了销售一线的核心参数。
降价的底气在效率,不在补贴
如果只把降价理解为烧钱抢客户,会漏掉同步发生的另一半:单次任务消耗的量也在下降。阿里云发布Qwen3.8-Flash时给出的口径是,该模型在千问办公场景下平均token消耗减少75%、生成速度提升100%。单价下调与单位任务算力消耗下降是同时出现的。
国泰君安期货的分析给出了同一枚硬币的反面:降价有利于扩大智能体和推理调用,但单位token收入下降,云厂商需要依靠调用量增长和推理效率提升维持算力回报。
这也解释了为什么降价与增长并不矛盾。8月20日披露的业绩中,阿里巴巴CEO吴泳铭称本季度阿里云外部商业化收入加速增长至45%,AI相关产品收入已连续第十二个季度实现三位数同比增长。价格下调没有改变量的扩张,被压缩的是每一块钱收入背后的毛利。
短期谁吃亏,长期谁受益
承压的是卖算力的一侧。当API单价是唯一收入来源时,降价只能靠用量补回来;而资本开支、自研芯片与训练投入不会因为报价下调而减少。9月1日港股对“降价”两个字的第一反应是卖出而非买入,交易的是这个朴素算术。
受益的是买算力的一侧。一个基于大模型做产品的小公司,一次问答可能触发一次重排序、若干次检索和一次生成,中间环节单价降七成,意味着同样预算能服务的用户量被明显抬高。当竞争焦点从“能不能做出来”转向“敢不敢全量开放”,成本曲线比评测榜单更能决定项目生死。
真正的变量在于价格锚。一旦“每百万tokens 0.5元”成为采购合同里的默认预期,厂商的议价空间就很难回退——这是高端溢价时代结束时,最不可逆的那部分。
接下来盯什么
三条线索值得跟踪。一是国内云厂商在下一份财报中,是否被追问AI相关收入的毛利口径与单位token收入变化;二是海外实验室接下来是继续用“取消涨价”这种相对温和的手段稳住价格预期,还是直接下调报价;三是应用侧是否出现因调用成本下降而真正放量的品类,尤其是AI搜索、企业知识库和客服自动化。
降价潮从硅谷烧到中国云厂商,胜负手已经不在模型本身,而在于谁能把便宜的价格变成别人离不开的用量。
参考数据来源
- 财联社 · 《阿里云宣布Qwen3-VL-Rerank模型降价》(转引阿里云大模型服务平台百炼调价公告)· 2026年9月1日 · https://www.cls.cn/detail/2470344
- 财联社 · 《高性价比中国大模型兵临城下 美头部AI实验室大幅降价应对》· 2026年8月14日 · https://www.cls.cn/detail/2454432
- 阿里云 · 大模型服务平台百炼《模型调用默认按量计费》价格页 · 2026年9月1日访问 · https://help.aliyun.com/zh/model-studio/model-pricing


