Anthropic改API封住蒸馏口子,成本跟着降25%
2026年9月1日,Anthropic发布Claude Fable 5.1与Claude Mythos 5.1。真正的变化不在跑分表上,而在API的行为规则里:新建账号从这一天起,无法在多轮对话中修改思考块之前的系统提示、工具定义或历史消息,同时保留原先的思考记录。校验一旦发现上下文对不上,接口直接返回错误。
Anthropic在支持文档中把这归为反蒸馏(anti-distillation)措施,并给出配套的商业结果:由于思考块与上下文保持一致,提示缓存能被更频繁地命中,典型负载的调用成本预计比Fable 5低约25%,高智能体化(agentic)负载最高可降约45%。封堵与让利来自同一次改动,这正是理解Anthropic意图的入口。
改的是校验规则,不是模型能力
先讲清机制。Claude在给出答案前会产生推理步骤,API以"思考块"的形式返回给调用方;多轮对话中,客户端要在每次请求里把这些块连同系统提示、工具和早期消息一起回传。Anthropic的说明是,思考块本身已加密,但在思考块之前编辑对话内容,可以让Claude把先前的推理以明文打印出来——这恰是外部研究者绕过防护的那道入口。
Fable 5.1的改动是把这条路径变成硬性校验:接口现在验证思考块是否与生成它的系统提示、工具和消息一致,不一致即报错。确有合法修改需求的开发者可以选择"非严格模式":请求照常通过,但受影响的思考块会从模型可见内容中被删除,响应会告知删除了哪些块。换言之,模型在看不见自己上一轮推理的状态下继续作答。
生效范围是这次发布中最容易被忽略的细节。该规则只适用于2026年8月31日UTC零点之后创建的新API账号,具体包括Anthropic平台的新组织,以及Amazon Bedrock新账户、Google Cloud Vertex AI新项目和Microsoft Azure Foundry新项目。已有账号在Fable 5.1上暂不受影响,Anthropic表示未来模型版本会推广到全部用户。Claude Code、Claude Cowork、Claude.ai网页端以及通过第三方产品使用Claude的用户均不受影响,其他模型也不受影响。
为什么是现在:论文先公开,产品再补锁
时间线解释了"此刻动手"的原因。今年8月10日提交至arXiv的论文《Stealing Reasoning Traces from Proprietary LLM APIs》(作者来自MATS Research、ELLIS Institute Tübingen、马克斯·普朗克研究所、Snyk等机构)指出,各家厂商返回的加密推理块在同一提供商生态内跨会话、跨用户、跨模型完全兼容;只要把强模型的加密块注入同厂防护更弱的模型,就能迫使后者逐字复述出明文推理,无需直接攻破强模型。论文明确写到,这条路径可以绕过反蒸馏机制,并在Anthropic、OpenAI与Google三家身上做了验证;研究团队还解码了从公开代码仓库抓取的31.5万余个推理块,回收367条个人身份信息制品与182条凭证。
Anthropic的支持文档直接引用了这篇论文,称其为"公开记录的技术",并说明这种蒸馏"通常在工业规模上进行,使用数千个虚假账户",属于安全风险。文档同时交代,新措施建立在既有手段之上:更强的蒸馏分类器,以及限制把会话或推理从更高能力模型转移到保障较弱的低能力模型。也就是说,这次改动是对已公开漏洞的一次产品化修补,而不是突发奇想。
商业含义由此展开。蒸馏对小模型厂商的价值,在于用API调用换取接近头部模型的推理数据,省下从头预训练的算力与时间。当这条采集路径的稳定性下降、报错与封号风险上升,"外部教师"的可得性就要打折扣。需要划清边界的是:Anthropic把蒸馏定义为违反使用政策的安全问题,但封堵措施究竟会压缩多少蒸馏行为,目前没有任何可核验的量化数据,行业影响属于推断而非既成事实。
降25%是缓存红利,也是定价信号
把降价拆开看,才能判断这是不是锁客。Fable 5.1的标准牌价并未改变:每百万token输入10美元、输出50美元;真正变动的是缓存读取价格,下调75%至每百万token 0.25美元。官方给出的25%与45%是"按token计费场景下"的估算综合成本降幅,不是牌价降幅。
逻辑于是闭环:强制思考块一致,等于强制客户端保持上下文稳定,前缀缓存命中率随之上升;命中率上升,Anthropic把节约的一部分以缓存价形式返还,同时鼓励开发者把长会话和多轮智能体任务留在自己体系内。对开发者而言,这构成了"合规即便宜"的价格结构。
能力供给的方式也在变。官方文档写明,Fable 5.1与Mythos 5.1是同一个模型,差别在于安全防护等级:Fable 5.1全面开放,Mythos 5.1仅通过受信访问计划提供,目前限于美国机构。顶尖推理能力不再只按模型代际出售,而是开始按访问资格出售。
在另一端,Anthropic同日披露的企业前沿防护架构(EFS)已吸引超过100家客户参与设计,官方称相关对话覆盖四分之一的财富100强企业、每一家美国全球系统重要性银行以及几乎所有受监管行业;数据存放于客户自有云,Anthropic不做人工复核、不额外收费,今年秋季起分阶段上线。
能力口径上,官方数据显示Fable 5.1在Terminal-Bench-Science 0.1上从Fable 5的24.7%升至52.6%(Opus 5为29.0%,GPT-5.6 Sol为22.4%),CursorBench 3.2.0得分73.4%。Anthropic同时注明该基准标准误约为±3.5至4.5分,且所有跑分包含生产防护、防护介入的任务记0分;新一代防护的误报拦截比上一代减少约60%。
接下来值得盯的三件事
第一,看存量账号何时被纳入。Anthropic只承诺"未来模型版本适用于所有用户",没有时间表,这条边界决定老代码的迁移压力何时真正落地。第二,看依赖上下文压缩、需要在对话中途重写早期轮次的Agent框架是否出现批量改码或跨云迁移。第三,看其他前沿厂商是否跟进同类校验——论文所述漏洞在OpenAI与Google生态同样被验证,但截至发稿,两家是否已推出对应机制没有可核验的公开材料。
对关注AI云计算与开发者工具的资金来说,真正的问题不是"蒸馏会不会消失",而是Anthropic能否把"保持一致即低成本"这套结构,转化为更长的会话留存与更高的缓存占比。
参考数据来源
- Anthropic Support Center · 通过Claude Fable 5.1,我们改变了Messages API处理思考块的方式以防止蒸馏 · 2026-09-01 · https://support.claude.com/zh-CN/articles/16761192
- Anthropic Newsroom · Introducing Claude Fable 5.1 and Claude Mythos 5.1 · 2026-09-01 · https://www.anthropic.com/claude-fable-and-mythos-5-1
- arXiv · Stealing Reasoning Traces from Proprietary LLM APIs(arXiv:2608.09867) · 2026-08-10 · https://arxiv.org/abs/2608.09867


