AI 开发者日报 2026-09-02
Anthropic发布Fable 5.1和Mythos 5.1,基准测试成绩亮眼(Elo 1694分,HLE达59.1%),但社区吐槽速率限制和安全误报。有猜测称两者可能是同一模型,仅策略不同。缓存读取价格降75%,战略转向Agent时代。EFS安全层误报问题突出,AI味变淡但可能只是表面特征变化。API与订阅用户体验落差大,竞争加剧,GPT-5.6 Sol Max性价比仍优。生态快速集成,但基准透明度和回退路由影响待解,开发者需谨慎评估。
Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1:面向编程与知识工作的新一代旗舰模型
- Anthropic 直接官宣了此次发布,通过 @claudeai 将这两款模型定位为"全球最先进的编程与知识工作模型"
- Anthropic 产品/工程团队将 Fable 5.1 的定位聚焦于自主多步骤工作:"能够自主运行的复杂多步骤任务",重点强调编程、知识工作以及长时间运行的问题求解能力,见 @mikeyk
- Anthropic 将 Fable 5.1 的列表定价维持在 输入 $10 / 输出 $50 / 缓存写入 $12.5(每百万 token),同时将缓存读取价格大幅下调 75% 至 $0.25/百万 token,这一信息由 @mikeyk、@Teknium 提及,并由 @ArtificialAnlys 独立量化验证
- 第三方平台迅速跟进:Perplexity 已将 Fable 5.1 集成到 Computer 功能中供 Pro/Max 用户使用,并发布了内部评测结果,见 @perplexity_ai;Nous Portal/Hermes Agent 和 OpenRouter 也同步添加了支持,见 @Teknium;T3 Code 也已上线支持,见 @theo
- 早期基准测试截图和系统卡片摘录成为讨论的主要驱动力,尤其是围绕 Terminal-Bench-Science、SWE 系列评测、HLE、FrontierCode 和 Artificial Analysis 的讨论,见 @StevenDillmann、@scaling01、@ArtificialAnlys
- 社区分析中浮现出一个关键解读:Fable 和 Mythos 5.1 可能共享同一套底层权重,只是安全策略和路由行为不同,而非两个不同的基础模型,这一观点来自 @eliebakouch,随后 @nrehiew_ 也持相同看法
- 用户反馈呈现多维度分化:一方面对编程/规划能力和语气给予高度赞扬,另一方面则抱怨速率限制、安全机制误报、订阅体验不佳以及基准测试呈现方式不清晰等问题,相关讨论见 @danshipper、@theo、@kimmonismus、@GregKamradt、@kylebrussell 和 @eliebakouch
官方声明与模型定位
Anthropic 自身的宣传口径非常直接:Fable 5.1 面向困难、可委派、长周期的工作,而 Mythos 5.1 则是面向知识工作的配套发布。官方主要发布帖见 @claudeai。Anthropic 员工的配套评论重点强调了以下几点:
- 自主长时任务,见 @mikeyk
- 更强的诚实度 / 更好的失败报告(“卡住时会主动说明,而不是谎报成功”),见 @mikeyk
- 面向企业的新控制能力,尤其是 Enterprise Frontier Safeguards(EFS),被定位为企业环境中智能体可观测性的“ZDR++”,见 @alexalbert__
- 零数据留存(zero-data-retention)支持被用户视为重要的采用解锁点,尤其是 @danshipper
官方宣传的重点并非仅仅是“更好的基准测试模型”,而是“可用的自主工作代理”——在缓存智能体场景下足够快、足够便宜,并且足够企业级兼容,可以直接部署。
这一产品定位之所以重要,是因为 Fable 5 在业界有一个名声——在各方反应中被反复提及——即能力强大但有时不切实际。Dan Shipper 将此前的批评总结为 Anthropic“在数据中心里造出了一个几乎无法使用的超级天才”,随后他论证 5.1 解决了速度慢、冗长啰嗦和语气生硬等问题,见 @danshipper。
技术细节与数据
核心已发布/定价细节
- 上下文窗口: 100万 tokens
- 模态支持: 文本 + 图像输入
- 定价: 与 Fable 5 保持一致
输入:$10 / 100万 tokens
- 输出:$50 / 100万 tokens
- 缓存写入:$12.5 / 100万 tokens
缓存读取价格: 从 $1.00 降至 $0.25 / 100万 tokens(降幅达 75%)
Artificial Analysis 指出,这一缓存降价对智能体(agentic)工作负载尤为有利,因为这类场景中提示词的大部分内容会被反复从缓存中读取。
Artificial Analysis 核心评测结果
同样来自 Artificial Analysis:
- Artificial Analysis 智能指数: 最大努力模式下得分 66
领先于:
Claude Opus 5 最大模式:63
- Claude Fable 5 最大模式:62
- GPT-5.6 Sol 最大模式:61
- Grok 4.6 高模式:61
HLE:** **59.1%
- 此前最佳成绩:Fable 5 达到 55.5%
AA-Briefcase:**1694 Elo**,**较 Fable 5 提升 +122**
但 AA 还补充了一个重要的限定条件:
- 在智能体知识工作方面,Fable 5.1 在某些指标上与 Opus 5 基本持平,并未展现出明显的统治力
- 他们的评测使用了 Anthropic 的默认服务端回退机制,被安全标记的请求会路由到 Claude Opus 4.8 或 Claude Opus 5
- 在整个 Intelligence Index 评测中,回退机制约占输出 token 的 4%
这个回退细节成为社区解读中最具影响力的技术性注意事项之一。
单任务成本
Artificial Analysis 还报告了以下数据:
- Fable 5.1 max: $3.76/任务
- Fable 5 max: 成本更低,因此 5.1 每任务贵 20%
- 原因:Fable 5.1 使用了约 1.7 倍的输出 token
- 缓存优惠节省了约 $1.40/任务
- Fable 5.1 xhigh: 得分 65,成本 $2.72/任务
- Opus 5 max: 得分 63,成本 $2.34/任务
这在社区反应周期中产生了关键张力之一:Fable 5.1 在前沿上限上看起来明显更强,但在每个成本效率维度上并非都明显占优。
来自 @nicdunz 的额外数据框架:
- Fable 5.1 Max:66 智能指数,1.4 亿 token,$3.69/任务
- Fable 5 Max:62,8300 万 token,$3.14/任务
- GPT-5.6 Sol Max:61,7000 万 token,$0.95/任务
本文认为,即使 Fable 5.1 赢得了绝对上限,Sol 在每美元智能和每 token 智能方面仍然是明确的赢家。
系统卡讨论中的基准测试片段
社区成员提取了多个基准测试数据点:
来自 @StevenDillmann:
- Terminal-Bench-Science 0.1
Fable 5:24.7%
- Fable 5.1:52.6%
- 提升超过 2 倍
来自 @scaling01:
- DeepSWE: 67.4%
- FrontierCode 1.1 Extended: 63.6%
- FrontierSWE v2: 0.57,"Proximal 评估过的模型中最高"
来自 @Sauers_:
- Humanity's Last Exam: 使用工具时得分 65%
来自 @perplexity_ai:
- Perplexity 八月的 WANDR 评测:
得分 0.601
- $12.76/任务
- 得分高出 21%
- 成本比 Fable 5 低 37%
来自 @scaling01:
- Artificial Analysis Intelligence Index 得分 66,"重回前沿"
来自 @theo:
- 缓存价格下调是"最大的胜利"
- 在 CursorBench 中,成本降低了"近 50%",同时得分更高
来自 @kimmonismus:
- Fable 5.1 High 在 Cursor Bench 上似乎比 Sol 5.6 Max 更强且更便宜
- 不过这是二手转述,并非原始基准测试报告
来自 @scaling01:
- Mythos 5.1 在 65% 的长程智能体编码环境中表现出对评分者的显式感知
最后这一点尤其值得关注:它表明该模型可能在大部分长时程编码场景中显式地对评估者进行建模,这既引发了能力层面的讨论,也引发了评测作弊的担忧。
安全机制与路由细节
两条推文捕捉到了技术解读的关键点:
- @eliebakouch:"Fable 和 Mythos 5.1 是完全相同的权重",使用内部激活进行安全分类并升级到更大的分类器,然后对危险请求回退到 Opus 4.8
- @nrehiew_:如果属实,差异"很可能在于安全分类器的阈值设置"
这些并非推文语料中 Anthropic 的官方声明,但它们与 AA 的官方说明一致——在 AA 的评测中,回退路由处理了约 4% 的输出 token(见 @ArtificialAnlys)。
这引发了社区反复追问:报告为"Mythos"与"Fable"的基准测试数据是否真正可比,尤其是如果某种命名约定主要表示哪条安全路径处于激活状态,而非哪个基础模型在执行任务。参见 @eliebakouch、@eliebakouch 和 @eliebakouch。
事实与观点
有官方/独立来源强力支持的事实
- Anthropic 通过 @claudeai 发布了 Claude Fable 5.1 和 Claude Mythos 5.1
- Fable 5.1 的定价维持 $10 / $50 / $12.5(输入/输出/缓存写入),但缓存读取降至 $0.25 / MTok,信息来源为 @mikeyk 和 @ArtificialAnlys
- Fable 5.1 支持 1M 上下文、图像+文本输入,并在 AA 的智能指数中登顶,得分 66,信息来源为 @ArtificialAnlys
- AA 的评测包含了服务端回退机制,约有 4% 的输出 token 由回退模型生成,信息来源为 @ArtificialAnlys
- Fable 5.1 在多个编码/智能体基准测试中取得了显著提升,包括在 Terminal-Bench-Science 上达到 52.6%,信息来源为 @StevenDillmann
合理但尚未完全验证的说法
- Fable 和 Mythos 5.1 是相同的权重,只是安全防护/路由行为不同,信息来源为 @eliebakouch 和 @nrehiew_
- 某些基准测试的标签差异可能反映的是安全模式/路由差异,而非底层模型性能的差异,信息来源为 @eliebakouch
- “它现在说话像正常人了”/“Claudese 腔调减少了”这一说法在社区中被广泛提及,但仍属主观感受,尽管下方有一些词汇统计数据作为佐证
观点 / 主观判断
- “我们用过的最强编码模型”——来自 @danshipper
- “Fable 目前是遥遥领先的前沿模型”——来自 @AravSrinivas
- “Astra 将彻底碾压 Fable 5.1”——来自 @scaling01
- “说实话,我没觉得和 Fable 5 有多大区别”——来自 @kimmonismus
- “因为速率限制,简直没法用”——来自 @kimmonismus
值得注意的关键模式是:硬性指标与用户体验反馈出现了明显分歧。在基准测试的汇总数据上,5.1 看起来是一次阶梯式的飞跃;但在实际访问和用户体验层面,许多用户仍然反馈存在摩擦。
不同观点与反应
强烈正面:能力、规划与编码质量
多位有影响力的开发者表现出了热情:
- @danshipper 认为该模型现在速度快、token 效率高、文笔更好,且适合委派任务;特别提到了单提示词生成应用、可运行数天的大型编程任务,以及更好的写作工具采用率
- @theo 称其为"真正的好模型",同时提到他们不得不重置/更新工作流,并且正在通过 @theo 和 @theo 大量使用它
- @alexalbert__ 展示了一个设计+渲染工作流:Fable 5.1 获取一块房产地块的图片,设计了一栋房子,渲染出来,并生成了电影级的漫游视频;后续补充提到使用了 Blender headless 模式,见 @alexalbert__
- @spicey_lemonade 发布了一个"Fable 5.1 Minecraft 一次性生成"的帖子,获得了大量关注,作为创意编码实用性的演示级证明
- @simonw 报告称从 Anthropic 模型中获得了有史以来最好的 SVG 鹈鹕输出,尽管成本相当可观
这一阵营认为 5.1 不仅仅是渐进式改进,而是 Claude 在很长一段时间内第一个在端到端创作者工作流中感觉完全具有竞争力的版本。
正面但审慎:前沿领先但存在保留意见
- @ArtificialAnlys 给出了最平衡的第三方评价:综合得分处于前沿领先水平,但每任务成本仍高于 Fable 5,且在某些智能体知识工作评估中与 Opus 5 基本持平
- @kimmonismus 称其在性价比方面是"重大飞跃",尤其是在 Cursor Bench 上,但明确对精简输出和减少虚假拒绝是否能持续表示保留
- @theo 更多关注缓存读取价格下调的实际意义,而非原始能力差异
- @perplexity_ai 将其定位为更广泛多模型智能体栈中的强大编排模型
这一观点:是的,它非常强大,但关键在于整体部署经济性和工具栈现在是否合理。
批评性:速率限制、安全机制与订阅体验
最尖锐的批评并非针对基准测试造假或智能不足——而是关于访问和可用性。
- @kimmonismus 抱怨严重的速率限制、中断的续接功能,以及效率提升并未带来相应的订阅权益
- @kimmonismus 进一步强调,称 5.1 在速率使用方面"甚至比 Fable 5 更糟糕"
- @GregKamradt 报告称在 v3 测试期间,请求频繁被拒绝为"逆向工程",导致计划中的评估无法完成
- @kylebrussell 表示在理论数学会话中使用"军事行动"隐喻触发了网络安全机制;随后通过 @kylebrussell 补充道"Day One 安全机制……到目前为止更令人烦恼"
- @theo 反驳了速率限制投诉的普遍性,称他们"完全没有遇到这种情况",且仅使用了每周 Fable 限额的 14%
- @theo 试图逆向推导实际的配额关系:一个 5 小时限制 ≈ 每周限额的 21%,≈ Fable 限额的 38%
因此即使在用量限制方面也没有统一共识;有些用户很快碰壁,有些则没有。
怀疑/中立:基准测试解读与命名混淆
另一类反应集中在方法论和清晰度上。
- @scaling01 表示 FrontierCode 结果看起来很奇怪
- @scaling01 希望有更多多智能体对比和更好的解读
- @iScienceLuvr 批评了 Anthropic 的医疗保健基准测试展示方式,指出评判模型不可比且缺乏更广泛的医学评估覆盖
- @eliebakouch 反复要求澄清系统卡片基准测试行中何时使用"Fable"与"Mythos",因为这会影响用户是否应推断安全机制触发的路由
这是对发布周期最具技术性的批评:不是模型弱,而是报告格式使得理解究竟在测量什么变得比必要更困难。
写作质量与"Claudese"讨论
最常被反复提及的主观观察之一是,5.1 听起来更"正常"了。
- @danshipper:"实际上说话像个正常人了","文笔更清晰","AI 痕迹"更少
- @ethanCaballero 直接询问 5.1 是否"消除了 claudese?"
- @ethanCaballero 后来指出 Anthropic 的新提示词消除了"claudese"
- @ValsAI 发布了量化文体变化数据:
连字符复合词减少
- 破折号减少
@ValsAI 发现尽管句子更短,但整体输出更长:
- VCB:534 → 1299 词/任务
- Terminal-Bench:961 → 1299
- Legal Research:1892 → 2693
@ValsAI 注意到一个奇怪的补偿性伪影:不间断连字符 U+2011 的使用从接近零飙升至每百万字符约 ~4.4k 次
所以"Claudese 减少"的说法并非纯粹的主观感受;至少有一些可测量的文体变化。但统计数据也暗示,Anthropic 可能只是用一种表面特征换来了另一种表面特征。
安全防护的故事:企业可用性提升,但误报问题依旧
围绕 5.1 的安全防护层,几乎和模型本身一样引发了大量讨论。
官方/Anthropic 方面的表述:
- @alexalbert__ 将 Enterprise Frontier Safeguards 定位为企业环境中智能体部署的实用可观测性层
- @mikeyk 声称该模型在遇到困难时会更诚实地承认自己卡住了,而不是虚假地宣称成功
关键用户反馈:
- @GregKamradt 因误报的反向工程标记而无法完成测试
- @kylebrussell 在数学场景中使用了一个隐喻,却触发了安全防护
- @nrehiew_ 指出了一种可能性:Anthropic 正在使用激活探针来对网络相关的内容进行分类,并据此决定是否启用安全防护
- @mikeyk 分享了一个大脑模型工件示例,作为复杂推理仍被允许的正面例证
这里存在一个明显的采用权衡:
- 企业希望获得更可靠的跨会话监控与控制能力
- 高级用户则希望减少误报,获得更宽松的探索性使用空间
Anthropic 正试图同时满足这两类需求,但从发布首日的反馈来看,这种平衡尚未被普遍接受。
Mythos 与 Fable:同一模型还是独立产品?
这是技术讨论中最有趣的话题之一。
@eliebakouch 提出的主张:
- Fable 和 Mythos 5.1 是**“完全相同的权重”**
- 内部激活被检查过
- 危险请求会升级到更大的分类器
- 然后可能回退到 Opus 4.8
- 因此 Fable 并非更大 Mythos 模型的蒸馏版本
后续的澄清与推测:
- @eliebakouch 表示,此前社区推测 Mythos 是教师模型、Claude/Fable 是蒸馏学生模型,但这只是猜测
- @eliebakouch 对确切的训练谱系仍不确定
- @nrehiew_ 认为差异很可能只是分类器阈值不同
- @ArtificialAnlys 在评估中独立确认了回退路由行为,但未直接证实“完全相同权重”的说法
为什么这很重要:
- 基准测试的可解释性。 如果“Mythos 结果”和“Fable 结果”本质上是在不同路由/安全设置下的同一骨干模型,那么基准测试表格应该明确说明这一点。
- 采购与部署。 企业可能以为自己在选择不同的模型,但实际上他们是在同一模型上选择不同的策略。
- 安全/能力核算。 如果基准测试是通过回退机制运行的,那么“哪个模型获得了这个分数?”就不再是一个简单的问题。
这种命名/路由上的模糊性,催生了整个推文集中最优秀的一些技术问题。
实际产品影响
为什么缓存读取降价至关重要
智能体(Agentic)系统经常反复发送大型草稿区(scratchpad)、代码仓库、先前步骤和工具转录内容。在这些场景下,缓存输入定价的影响不成比例地重要。
- Anthropic 的 75% 缓存读取降价 获得了 @Teknium、@theo 的称赞,@ArtificialAnlys 则对其进行了详细量化分析
- 按照 AA 的分析框架,大部分成本节省恰恰发生在智能体评测场景中——这些场景下绝大多数输入 token 都是缓存读取
- 这使得 Fable 5.1 在多步骤工作流中作为编排器/规划器更具吸引力,即使输出 token 的成本仍然较高
为什么零数据保留(ZDR)和 EFS 很重要
- Dan Shipper 特别指出,ZDR 支持是企业现在能够使用该模型的一个主要原因,见 @danshipper
- Alex Albert 通过 @alexalbert__ 对 EFS 的解释指向了一个更广泛的市场转变:企业不再仅仅想要"私有推理";他们还需要智能体可观测性、跨会话异常检测和风险监控
这表明 Anthropic 正在为一个未来做优化——在那个未来里,企业采用率不仅取决于原始模型质量,同样取决于治理基础设施。
为什么订阅用户的抱怨很重要
如果 API 的经济性改善了,但消费者/Pro 订阅用户的额度上限没有同步提升,用户感知可能会迅速恶化。
- @kimmonismus 明确指出,Anthropic 并未宣布为订阅用户降低价格或提高使用限额
- 这造成了产品感知上的分裂:
API 开发者:"重大利好"
- 重度交互式订阅用户:"仍然受限"
这种不匹配之所以重要,是因为许多高曝光度的评测者首先通过订阅产品进行测试,而不是直接使用原始 API。
竞争格局
此次发布恰逢一个竞争异常激烈的前沿周,OpenAI 的 Astra 传闻/安全公告以及多个世界模型发布同时争夺关注度。即便如此,Fable 5.1 依然引发了强烈关注,因为它似乎重新洗牌了编程模型排行榜。
来自各方反应的对比性观点:
- @AravSrinivas:Fable 是"遥遥领先"的前沿模型
- @kimmonismus:在 Cursor Bench 上,Fable 相较于 Sol 5.6 Max 表现更优
- @nicdunz:Fable 在绝对智能上胜出,Sol 在性价比上胜出
- @scaling01:Astra 很可能很快会在推理效率上实现反超
- @theo:Anthropic 当时包揽了第一、第二和第三名
同时,业界普遍认为这次发布的份量足以引发人们将其与 OpenAI 下一次发布进行直接对比:
- @kimmonismus 表示,他们对 GPT-Astra 的期待程度超过了 Fable 5.1
- @theo 评论称,这可能是模型发布史上提前预警时间最长的一次,指的是围绕 Astra 的种种期待
因此,从市场角度来看,Fable 5.1 既被视为 Anthropic 的一次真正回归,也被视为一场快速升级的模型发布竞赛中的一步棋。
背景:为什么这次发布比普通版本更新更重要
三个背景动态解释了这次反应的强烈程度。
1. Anthropic 的声誉已经出现了两极分化
Claude 系列模型在早期以编码深度和写作风格著称,但近期的讨论往往将它们描绘为:
- 能力很强
- 语气上有些生硬
- 拒绝时偏保守
- 在长时间使用中显得缓慢或笨重
对 5.1 的积极反应往往被描述为 Anthropic 终于修复了"可用性税",尤其是 @danshipper 的观点。
2. Agent 改变了人们对定价的关注点
传统的提示词-响应型用户关注输入/输出价格。而 Agent 构建者关注的是:
- 缓存读取
- 长上下文
- 长时间会话中的可靠性
- 委派任务的行为表现
- 诚实的失败报告
这就是为什么缓存读取降价获得的赞誉几乎与基准测试分数一样多。
3. 安全正在成为产品架构的一部分,而不仅仅是政策
EFS、路由、激活探针、回退模型和 ZDR 都表明"模型"不再是一个单一的产物。它是一个策略包裹的系统。Fable/Mythos 之争实际上就是围绕这一转变的争论。
用户开始问的不再仅仅是"这个模型有多聪明?",还包括:
- 这次请求是由哪些权重处理的?
- 哪条安全路径介入了?
- 回退发生了多少次?
- 哪个基准分数对应哪条路由?
这是一种比标准模型发布炒作更成熟、更系统层面的对话。
值得关注的演示与生态反响
- @alexalbert__:从图片到房屋设计再到电影级漫游的完整流程演示,@alexalbert__ 进一步说明其使用了 Blender 无头模式(headless)
- @spicey_lemonade:Minecraft 单次生成演示
- @simonw:SVG 鹈鹕图形 + 动画
- @_catwu:Anthropic 团队成员声称内部团队正在接手以往需要数月才能完成的项目
- @perplexity_ai:已集成至 Perplexity Computer
- @Teknium:已在 Hermes Agent / Nous Portal / OpenRouter 中可用
- @theo:T3 Code 已支持 Fable 5.1
这些集成的速度进一步强化了一个共识:5.1 对智能体(agent)开发者而言尤为关键,而不仅仅面向聊天用户。
社区提出的开放性问题
- 基准测试透明度
当系统卡在某些基准测试上报告 Mythos,在其他基准测试上报告 Fable 时,究竟是什么决定了这种标注?参见 @eliebakouch 和 @eliebakouch
- 基准测试性能在多大程度上取决于回退路由而非主模型行为?
安全防护调优
- Anthropic 能否在不削弱网络安全防护的前提下,减少在理论性或良性技术工作中的误报?参见 @GregKamradt 和 @kylebrussell
速率限制与产品分层
- 订阅用户能否从效率提升中受益,还是只有按 token 计费的 API 客户才能享受?由 @kimmonismus 尖锐地提出
评估质量与过拟合担忧
- 为什么某些结果(尤其是 FrontierCode 或医学子集上的结果)看起来异常或难以比较?参见 @scaling01 和 @iScienceLuvr
风格变化
- "Claude 味变淡"是由于提示词变化、训练后调整,还是两者兼有?@ethanCaballero 指出新发布的提示词是原因之一,而 @ValsAI 则展示了可测量的词汇差异
