DeepSeek给AI调用装上“峰谷电价”:价差31倍
围绕DeepSeek flash模型新定价的消息在9月9日集中传播,流传最广的版本写着“空闲时段输入缓存命中0.02元/次,高峰价格是空闲时段的2倍,9月10日12:00生效”。
把这行字与DeepSeek开放平台的官方价目表逐行对照,会发现三处对不上:计价单位不是“元”,而是美元;计费颗粒不是“次”,而是每100万个Token;分时计价也不是9月10日的新政策,它在2026年8月16日(UTC时间)就已经生效。
但报道抄对了一件事:高峰时段的划分,与官方表格完全吻合。真正值得算的账,藏在官方价目表那六个数字的倍数关系里。
一张被读错的价格表
DeepSeek官方文档“Models & Pricing”页面写明,所有价格为每100万Token的单价,扣费规则是“花费等于Token数乘以价格”。以deepseek-v4-flash为例,现行价目分三档、两个时段:输入缓存命中,空闲时段0.007美元、高峰时段0.014美元;输入缓存未命中,0.22美元与0.44美元;模型输出,0.66美元与1.32美元。deepseek-v4-pro同结构,数字为0.022/0.044、0.66/1.32、1.98/3.96美元。
官方对高峰时段的定义是周一至周五的UTC时间01:00—04:00与06:00—10:00,其余全部按空闲时段计价。换算成北京时间,正好是9:00—12:00与14:00—18:00——与传播版本里的时段描述一字不差,这也佐证了后者确实在转述这张官方表格,只是在单位和数值上走了样。
时间线上,官方更新日志记录的调价公告发布于2026年8月13日,随DeepSeek-V4系列正式商用一并推出,生效时间为8月16日16:00(UTC)。截至9月9日,该日志最新一条公开记录仍停留在8月21日发布的多模态实验模型,未出现新的定价公告。
一个“次”字,暴露的是整个行业的理解偏差:大模型API按Token计费,调用一次的成本取决于这一次吞进和吐出多少Token,而不是次数。
六个价格,而不是一个价格
把这张表读透,第一层结论是:DeepSeek的flash模型今天不再只有一个价格,而是六个。三档计价项乘以两个时段,构成一张矩阵。
第二层结论藏在倍数里。输入缓存命中与未命中之间,价格是31.4倍——空闲时段0.007美元对0.22美元,高峰时段0.014美元对0.44美元,两个时段算出来的倍数完全相同。输出与缓存命中输入之间,倍数拉到94.3倍(0.66美元对0.007美元)。
也就是说,同样一段输入内容,在DeepSeek这里可能值0.007美元,也可能值0.22美元,差别不来自模型能力,而来自它此前是否被算过一次。
第三层结论是时段本身。一周168小时里,高峰只覆盖工作日两个时段共35小时,占比不到两成;换言之,超过八成的时间,调用方享有一半价格。由于高峰锚定的是东亚工作时段,欧美白天的调用请求几乎全部落在空闲档位,这张表面平等的价目表,实际上给跨时区调度留出了空间。
至于flash与pro之间,pro各档价格约为flash的3倍,并发上限却是500对2500——能力档位更高,同时意味着更紧的资源约束。
0.007美元从哪来:把重复计算搬到磁盘
低价不是靠让利做出来的。DeepSeek在2024年8月2日上线“磁盘上下文缓存”(Context Caching on Disk)技术时,把缓存命中价定在每100万Token 0.014美元,并称之为“再降一个数量级”,官方当时的说法是用户成本最多可降90%,即便不做任何优化,历史数据显示平均也能省下五成以上。
如今,0.014美元这个当年的“唯一缓存价”变成了高峰档,空闲档再腰斩一半。需要说明的是,两个数字对应不同代际模型,不宜直接比较性能,但价格档位的演变方向是清楚的。
机制上,这项服务默认开启,调用方不需要修改任何代码。系统在收到请求时构建磁盘缓存,后续请求若与历史请求存在重叠前缀,重叠部分直接从缓存读取而非重新计算。
但命中门槛比想象中严格。官方文档列出的规则是:后续请求必须“完全匹配”一个已持久化的缓存前缀单元,输入中间的部分匹配不触发命中。多轮对话里第二轮带上第一轮完整历史可以命中;两轮使用同一份文档但提问不同,前两轮都不命中,系统在检测到公共前缀后才将其持久化,第三轮起才可能命中。
响应体的usage字段里,prompt_cache_hit_tokens与prompt_cache_miss_tokens会把命中情况如实返回。这三个词,才是账单的真实决定因素。
把GPU利用率写进价目表
DeepSeek官方给出的调价理由只有一句:为更合理地分配资源,采用峰谷定价,空闲价格为高峰的一半,鼓励用户根据自身使用情况安排任务。
这句话的实质,是把电力行业的负荷管理逻辑搬进了算力生意。推理集群的成本在采购到货那一刻就基本固定,白天忙不过来与夜里空转,边际成本差别巨大。用两倍价差把可延后的负载从高峰挪走,等于让调用方替平台做调度。
对开发者而言,这意味着优化方向变了。过去比对的是各家API的挂牌价,现在真正要盯的是自家请求结构:系统提示词、工具定义、长文档这类不变内容放在请求前部,可变内容放在尾部,因为命中规则要求的是前缀完全匹配;批量离线任务、代码库索引、数据清洗,可以整体往空闲时段迁移。
反过来说,对一次性长文摘要、每轮都改写上下文的问答这类业务,0.007美元是一个基本享受不到的价格。以flash模型支持100万Token上下文、单次最大输出384K计算,一个真实运行的智能体会反复携带整段历史,命中与不命中的账单差距会被长上下文放大到数十倍量级。
三个边界与四个观察点
价格战的说法目前还缺乏证据支撑。公开可查的材料里,看不到OpenAI、Anthropic、Google等厂商跟进分时计价的公告,各家当前API挂牌价在本次核验中未能从官方页面取得完整可读数据,因此本文不做横向比价,也不据此推断行业均价走势。
第二个边界是可持续性。DeepSeek官方在定价页明确写道,产品价格可能变动,公司保留调整价格的权利,并建议用户按实际用量充值、定期查看该页面。低价是当期报价,不是承诺。
第三个边界是财务口径。DeepSeek未公开API收入规模与调用量数据,此次分时定价对营收的实际影响无法测算,“降价利好所有开发者”属于方向判断,而非可验证结果。
接下来值得盯住的是:一,官方更新日志是否真的出现9月新一轮调价公告;二,flash与pro是否长期维持2倍峰谷差,还是会随利用率继续拉大;三,是否有第二家厂商把时段变量引入价目表;四,缓存命中率能否支撑起智能体类应用的长上下文复用,这是低价真正兑现的前提。
一个只有低价的市场会淘汰所有人,一个能把闲置算力变成价格杠杆的市场,才可能重新定义成本曲线。DeepSeek今天给出的,是后一种可能的起点。


