BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年09月11日

注册 / 登录

架构创新让旗舰退役,DeepSeek最高降价60%

9月10日中午,DeepSeek正式发布了全新模型V4.1 Flash。这并非一次常规的迭代升级——它宣布自己已经在性能上全面超越了自家上一代旗舰产品V4 Pro,且API定价最高可下降60%。更激进的是,从9月14日起,原本调用V4 Pro的用户请求将全部自动切换到V4.1 Flash,按更低的价格计费。

一个售价最高的旗舰模型,被一个定位为"Flash"的轻量版本直接替代。这在AI行业中并不常见。通常的做法是在旗舰之后推出功能裁剪的廉价版,而非反过来让低价版本接管高价版本的生态位。

这种"反向替代"的背后,是一套全新的模型架构设计。

非对称结构:只算需要的那部分

DeepSeek V4.1 Flash拥有5520亿参数的总规模,属于MoE(混合专家)架构的大模型。但这个数字具有误导性——模型的真正消耗不在于"总参数",而在于推理时实际激活的参数数量。

V4.1 Flash采用了Causal-Encoder-Decoder(因果编码器-解码器)的非对称结构。在传统模型中,输入和输出阶段通常需要等量的参数参与计算。而V4.1 Flash的输入侧仅需激活80亿参数进行理解和分析,输出侧则激活160亿参数进行生成——两者相加只有240亿活跃参数,不足总参数规模的5%。

"这是一种用空间换时间的设计思路。"DeepSeek官方博客如此描述。更少的活跃参数意味着单次推理所需的GPU显存占用更少、计算速度更快,同时降低了单位Token的边际成本。这也是为什么DeepSeek能够宣称在相同训练预算下实现更高吞吐和更低延迟的原因。

值得注意的是,这套非对称架构同样实现了原生多模态视觉理解能力,无需额外的Vision模块即可处理图像相关任务。这意味着用户不再需要单独调用视觉模型来完成图文联合推理。

437倍的压缩:为什么KV Cache成了关键战场

如果只看参数规模和活跃参数数,V4.1 Flash的技术亮点似乎还可以再往深处挖一挖。但真正让这轮发布具备"颠覆性"标签的,是DeepSeek在另一个维度的数据表现:KV Cache。

KV Cache(键值缓存)是大语言模型推理过程中的一个重要概念。当模型处理长对话或多轮Agent任务时,需要将之前生成的中间状态缓存起来以便后续Token调用。这个缓存占用的存储空间被称为KV Cache,它直接关系到GPU显存需求和API调用的实际成本。

V4.1 Flash将这个缓存体积压到了极致。对比自家初代模型,KV Cache大小缩小了437倍;对比上一代模型,对高带宽内存(HBM)的需求降至四分之一,对固态硬盘(SSD)存储需求降至八分之一。

"对Agent类任务来说,缓存命中的费用往往占比较高。"官方博客明确指出。换句话说,对于频繁调用多轮对话的工具型应用而言,KV Cache的压缩不仅仅是技术指标的变化,而是直接转化为API账单上的真金白银。

这也是为什么DeepSeek选择在博客中将KV Cache的历代演进趋势做成一张专门展示图表的原因——这是他们最想让用户看到的核心卖点之一。

V4 Pro即将退役:开发者的隐性迁移成本

DeepSeek明确表示,经过多方测试,V4.1 Flash在性能、费用、速度、总用时等各项指标上已全面超越V4 Pro。因此,公司计划有序下线V4 Pro,并在未来V4.1 Pro正式上线前,将所有V4 Pro的API请求自动路由至V4.1 Flash,同时按Flash的单价计费。

表面上看,这对用户是一个"福利升级"——同样的能力甚至更好的性能,却以更低的单价结算。但对使用V4 Pro的商业客户而言,迁移并非零成本。

首先是集成适配成本。虽然V4 Pro的请求会被自动重定向,但如果企业的AI应用是基于V4 Pro的能力上限进行设计的(例如某些需要超长推理链的深度任务),切换到Flash版本后可能需要重新调整prompt工程、温度设置、最大Token数等参数,以确保输出质量不下降。

其次是预期管理。V4.1 Flash虽然性能全面超越V4 Pro,但它仍是一款以成本和效率为核心定位的产品。对于那些原本依赖旗舰模型的高端复杂场景,用户可能需要在后续等待V4.1 Pro的发布——而目前这一时间点尚未公布。

DeepSeek的这一策略在行业内相当罕见。通常情况下,大厂会通过逐步淘汰旧版本来推动用户迁移,但如此强硬地用一个低成本版本直接接管旗舰的市场地位,既显示了他们对Flash架构的信心,也在向整个行业传递了一个明确的信号:算力效率和成本正在成为核心竞争力。

闲时半价:峰谷定价背后的资源算计

另一项值得关注的细节是,DeepSeek在降价的同时仍然保留了峰谷定价机制——闲时价格为高峰时段的一半。这一政策鼓励用户错峰调用API以享受更优惠费率。

从表面看,这是为了让"更合理的调配资源"。但从商业模式角度看,这也意味着DeepSeek并未完全转向"一口价"策略,而是在成本控制和产品差异化之间寻找平衡。对于企业用户来说,灵活安排调用时间的确可以进一步压缩成本,但这也会带来调度复杂度——尤其是那些需要实时响应的生产环境。

与此同时,腾讯的WorkBuddy(含CodeBuddy)以及OpenCode已作为官方合作伙伴全量接入了V4.1 Flash。这表明DeepSeek的生态扩展策略正在加速——通过头部合作伙伴的快速落地,争取在V4.1 Pro上线前的窗口期建立用户习惯和平台黏性。

留给行业的四个观察指标

这轮发布短期内不会立即引发全面的行业价格战,但它确实设定了一个新的成本基准线。对于关注AI基础设施的企业决策者和投资者来说,以下几个指标值得关注:

  1. 国内其他大模型API的定价反应:阿里云通义系列、腾讯云混元、百度文心一言是否会在近期跟进降价?降价幅度有多大?
  2. 开发者迁移率的实际数据:在V4 Pro自动路由至Flash后的首周,API调用量和营收变化能否反映用户的接受度?
  3. GPU芯片需求的边际变化:随着单模型推理效率提升,云服务商的GPU采购节奏是否会放缓?这对燧原科技、寒武纪等国产AI芯片厂商意味着什么?
  4. V4.1 Pro的发布时间表:Flash已经接管了旗舰位置,那真正面向高端市场的V4.1 Pro何时上线?它是否会搭载更大的激活参数集以保持技术领先?

DeepSeek的这次发布更像是一次"用新技术定义旧标准"的实验。无论最终效果如何,它至少在尝试证明一件事:在AI赛道狂奔的过程中,不是只有堆参数量才是唯一的进阶路径。



版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。