返回文章列表

Fable 5.1 的降本暗线:Anthropic 如何重新定义旗舰模型竞争

当地时间 9 月 1 日,Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1。除了 8 项基准测试全部第一,真正的信号藏在价格表里:缓存读取价格直降 75%,典型工作负载成本下降约 25%,高度 Agent 化任务最高降 45%。模型竞争正在从拼基准分数转向拼"可负担的智能"。

9 分钟阅读

一次"没涨价"的旗舰发布

当地时间 9 月 1 日,Anthropic 宣布推出 Claude Fable 5.1 与 Claude Mythos 5.1,官方定位是"全球最先进的编程与知识工作模型"。两款模型使用同一底层模型,区别只在安全防护等级:Fable 5.1 面向所有用户开放,Mythos 5.1 仅通过可信访问计划向经过审核的网络安全与生命科学机构提供(IT之家)。

从规格表看,这是一次克制的小版本升级:延续 100 万 Token 上下文窗口和 128K 最大输出,知识截止时间更新到 2026 年 6 月,输入、输出单价与 Fable 5 完全一致——每百万 Token 10 美元和 50 美元(aivy.com.au)。

真正值得注意的变化,藏在价格表的角落。

基准成绩:科研 Agent 是最大亮点

Anthropic 公布的数据显示,Fable 5.1 在 8 项公开基准测试中全部排名第一,超过 Fable 5、Opus 5 以及 OpenAI 的 GPT-5.6 Sol(凤凰网科技)。

其中提升最明显的是智能体科研场景:

基准Fable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1(科研 Agent)52.6%24.7%29.0%22.4%
Terminal-Bench 4.0(Agent 编程)55.8%42.0%52.3%37.3%

在科研基准上,Fable 5.1 的得分超过前代一倍以上,也明显拉开与 GPT-5.6 Sol 的差距(IT之家aivy.com.au)。知识工作基准 GDPval-AA v2 上,Fable 5.1 拿到 1853 分,高于 Opus 5 的 1824 分和 Fable 5 的 1723 分。

Anthropic 将能力跃升归结于多步骤任务的稳定性:在长链路任务中,早期的小错误会随步骤累积放大,而 Fable 5.1 被设计为能够全程维持稳定输出,遇到无法解决的问题时会主动告知已尝试的路径和卡点(华尔街见闻)。

降价逻辑:为什么只动"缓存读取"

Fable 5.1 最直接的商业变化不是降价,而是重新调整成本结构:

  • 输入、输出价格不变:每百万 Token 10 美元 / 50 美元
  • 缓存读取价格从每百万 Token 1 美元降至 0.25 美元,降幅 75%
  • 典型工作负载整体成本比 Fable 5 低约 25%,高度 Agent 化任务最高可降 45%(新浪财经

缓存读取(cache read)指的是模型重复使用已处理过的上下文。普通问答中占比有限,但一个连续运行数小时的 Agent,会反复读取系统提示词、代码库、工具定义和历史上下文——任务越长、工具调用越多,缓存读取占成本的比例就越高。Anthropic 产品管理负责人 Dianne Penn 解释,在代码审查等需要遍历整个代码库的任务中,缓存读取往往消耗超过一半的 Token 用量,是客户反馈最集中的痛点之一(华尔街见闻)。

换句话说,Anthropic 没有把模型本身卖得更便宜,而是专门把"让模型长时间工作"这件事做便宜了。Anthropic 用 2026 年 8 月四周的实际使用数据测算,相同任务从 Fable 5 换到 Fable 5.1,典型负载成本下降约 25%,复杂编码和高 Agent 化任务最高降 45%(腾讯新闻)。

冷静视角:降价不是全部

第三方机构给出了更审慎的观察。

Artificial Analysis 的数据显示,在最高推理强度下,Fable 5.1 完成单次 Intelligence Index 任务的平均成本为 3.76 美元,反而比 Fable 5 高 20%,根源在于 Fable 5.1 的输出 Token 消耗约为前代的 1.7 倍;缓存降价平均为每项任务节省约 1.40 美元,主要体现在反复读取上下文的 Agent 任务中。将推理强度调到 xhigh 后,单任务成本可降至 2.72 美元,但依然高于 Opus 5 最高推理强度下的 2.34 美元(腾讯新闻)。

价格绝对值方面,Fable 5.1 依然属于最贵的一档。按 100 万输入加 100 万输出计算,其价格约为 GPT-5.6 Sol 的 2.5 倍、GLM-5.3 的 10 倍以上。Anthropic 官方甚至建议,大多数任务优先从价格只有一半的 Opus 5 开始,只有面对高难度推理、长时间 Agent 任务时才上 Fable 5.1(腾讯新闻)。

这意味着降价的真实含义是:缓存费用下调让"长跑型" Agent 任务变得可负担,但旗舰模型的溢价区间依然存在

数据主权与安全:另一条产品线

此次更新还包含两条对企业客户重要的变化。

一是数据留存政策转向。Anthropic 推出企业级前沿防护措施(Enterprise Frontier Safeguards,EFS),允许企业把数据存放在自己控制的云基础设施中,由企业负责默认的人工审查,在保留安全监测能力的同时实现接近"零数据保留"的隐私效果,计划今年秋季分阶段上线(新浪财经)。

二是安全误报率显著下降。网络安全防护的误拦截次数比 Fable 5 减少约 60%,生物安全机制对基础问题的误拦截率降低 85%;Fable 5.1 现在允许用于发现软件漏洞,但仍禁止生成漏洞利用程序(新浪财经)。

行业信号:竞争从"最强"转向"最可负担"

把这次发布放在行业语境里看,信号很清晰。

Fable 5.1 发布后几个小时,OpenAI CEO 萨姆·奥尔特曼在社交平台发文,剧透 OpenAI 很快将推出下一款产品(智东西)。头部模型的能力差距正在缩小,竞争维度已经发生变化。

过去一年,大模型厂商的竞争焦点从"谁的基准分更高"逐步转向"谁能让智能真正跑起来"。缓存价格直降 75% 是一个典型标志:当 Agent 成为主要工作负载形态,单次调用的标价不再是核心,长期运行的总成本才是企业采购的决定性变量。谁先让"长时间、多步骤、高上下文复用"的 Agent 任务变得便宜,谁就更容易占据企业工作流的入口。

对企业技术决策者来说,这次发布提供了几个可操作的评估维度:

  • 评估成本时不能只看标价,要看自身工作负载的缓存命中率——只有真正复用上下文的 Agent 任务才能吃到 45% 的降幅。
  • 旗舰模型与次旗舰(Opus 5)之间仍有明显的性价比分层,按任务难度分流调用是更理性的用法。
  • 数据留存政策与安全误报率,正在成为企业选型中与基准分数同等重要的指标。

模型竞争的下一站,可能不再是"谁的模型更强",而是"谁能让最强的模型用得起"。

(内容由AI生成,仅供参考)