Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.061 — 2026-09-03
NEWS 2 信源 约 5 分钟

Claude Fable 5.1:长任务再升级

Claude Fable 5.1 扩大长任务空间,也重写了 Claude Code 的成本账。

IMAGE — Claude Code Releases

你把一整个代码库交给 AI,让它查一个偶发故障。它刚读完关键文件,后面的对话、测试结果和修改记录又把前面的内容挤了出去。最后,它可能局部看得懂,却无法把漫长的调查串起来。Claude Fable 5.1 想改善的正是这类任务:让模型一次带上更多材料,并在多轮工具调用中持续工作。

这次值得关注,不只是因为 Anthropic 发布了新模型。它还同步修改了 Claude Code 的默认选择和计费条件。模型能力、工作入口与成本一起变化,会直接影响开发团队是否升级。以下性能描述主要来自 Anthropic 的产品文案,尚无公开基准、样本量和测试方法支撑;速度数据则来自 OpenRouter 的动态观测。

一百万 token,给长任务腾出空间

Claude Fable 5.1(模型标识 claude-fable-5-1)于 2026 年 9 月 1 日发布,上下文窗口为 100 万 token。Token 是模型处理文字时使用的基本计量单位;上下文窗口则是一次请求中可以共同处理的输入与输出总量。

窗口变大,意味着完整代码库、长文档,以及 Agent 多轮执行留下的任务轨迹,更有机会同时留在模型眼前。这里的 Agent,是会自行拆解任务、读取文件、调用工具、运行测试并反复修正的程序,不只是接着补几行代码。

但一百万 token 不是“记住一切”的保证。它只扩大了可用空间,模型能否准确找到很早以前的线索、在长任务中保持判断一致,仍要看实际使用表现。

Anthropic 提供了一个很能说明目标场景的案例:一家投资机构被一个约百万次运行才出现一次的崩溃困扰,团队追查四五年仍未解释。该机构一位高级投资组合经理称,Fable 5.1 反汇编了外部供应商的程序库,又把结果与 core dump——程序崩溃时留下的内存快照——对照,最终把问题指向供应商代码。这个故事来自 Anthropic,不能当作独立评测;但它清楚展示了产品定位:接手那些资料多、步骤长、人工排查成本过高的疑难任务。

升级重点不只是“写代码更好”

Anthropic 称,Fable 5.1 相比 Fable 5 的主要增益集中在 agentic coding、长时间运行的 Agent 工作流和知识工作,尤其包括跨文件的长代码重构、前端与视觉代码生成,以及金融和分析任务。它生成的计划与摘要通常也更简洁。

这些说法目前都是概括性描述。“全面提升”和“最大增益”属于发布方的产品判断,材料没有给出对照模型、测试题目或成功率。因此,更稳妥的理解不是“新版本已经在所有任务上获胜”,而是 Anthropic 正把 Fable 系列进一步推向需要规划、操作工具和持续修正的工作。

OpenRouter 观测到,该模型在其路由环境下,最佳供应商的 P50 吞吐量为每秒 70 token,P50 延迟为 4.62 秒。P50 可以理解为中位数:一半请求快于这个数,一半慢于它。这些数据会随供应商和路由情况变化,不代表 Anthropic 官方端点,也不能视为稳定承诺。

默认模型变了,成本账也变了

据 Anthropic 的 Claude Code 发布记录,Fable 5.1 已成为 Claude Code 默认的 Fable 模型。这个“默认”只适用于 Claude Code,不能外推为 Anthropic 所有产品或 API 的统一默认选项。

价格是每百万输入 token 10 美元、每百万输出 token 50 美元。输出单价是输入的五倍,因此长任务的成本不只取决于塞进去多少材料,也取决于模型最终生成多少内容。

更值得留意的是缓存读取价:每百万 token 只需 0.25 美元。提示缓存会复用模型此前处理过的长段输入,避免每一轮都重新计算。若同一百万 token 的代码库或文档可以命中缓存,仅比较这部分输入,读取费用是普通输入的四十分之一。对反复携带同一批材料的 Agent 会话,这可能比标价本身更影响总成本;输出仍按输出价格另计。

为什么现在值得看

这次更新把三个原本分开的选择绑在了一起:模型能装下多少材料,Agent 能连续工作多久,以及每轮调用要花多少钱。百万上下文让长任务具备了更大的操作空间;Claude Code 默认切换,则会让更多开发者无需主动选型便接触新版本;低价缓存读取又鼓励应用反复复用大型代码库和文档。

换句话说,Fable 5.1 的关键不在一次回答是否更漂亮,而在它能否把数十步工作稳定做完,并让这种工作在成本上可以持续。对开发者而言,真正需要测试的也不是单道题,而是完整流程:读文件、制定计划、修改、测试、遇错后继续,以及最终交付可核查的结果。

局限与未知

  • Anthropic 没有在材料中披露性能结论对应的基准测试、样本量和方法,所谓“全面提升”尚不能独立验证。
  • 一百万 token 说明容量上限,不等于模型一定能可靠利用窗口远端的信息。
  • OpenRouter 的速度和延迟来自多供应商路由环境,会动态变化,不能直接代表所有接入方式。

供稿材料 SOURCES — 2
01
v2.1.257 Claude Code Releases · NEWS
原文 ↗
02
Anthropic: Claude Fable 5.1 OpenRouter 新模型上架 · REPO
原文 ↗

← 返回 2026-09-03 · 开源板块