Agent.Space 博客

Claude Fable 5.1:价格、1M 上下文与 Coding Agent 适配

Claude Fable 5.1 提供 1M 上下文,API 输入/输出每百万 token 为 10/50 美元,cache read 为 0.25 美元。了解它适合哪些编程 Agent 任务。

Anthropic 于 2026 年 9 月 1 日发布 Claude Fable 5.1。它的 Claude API model ID 是 claude-fable-5-1,上下文窗口是 100 万 token,最大输出是 128,000 token。标准 API 价格是每百万输入 token 10 美元、每百万输出 token 50 美元;成功命中 Prompt Cache 后,cache read 是每百万 token 0.25 美元

对编程 Agent 来说,直接答案是:Fable 5.1 更适合作为困难、长时程任务的高价专项模型,而不是所有代码修改的自动默认选项。它较低的 cache-read 价格,可能明显改善反复读取同一份代码库上下文、项目规则和工具定义的 Agent 循环成本;但首次 cache write、未缓存输入、模型输出、工具结果、缓存未命中和返工仍然计费。

本文集中说明模型规格、API 成本和任务适配。如果你要比较 Pro、Max、Team、Enterprise 或 Console 的计费路径,请看单独的 Claude Code 价格指南。如果你要在 Claude Code 中选择 Fable 5.1 并控制 effort,请直接看 Claude Code 使用 Claude Fable 5.1 教程

事实与价格核验于 2026 年 9 月 9 日。 模型价格、规格、产品可用性和集成方式都可能变化,使用前请重新查看文中的 Anthropic 官方页面和产品实时选择器。

Claude Fable 5.1 规格与价格速览

Anthropic 的官方模型页面列出了以下信息:

项目Claude Fable 5.1
发布时间2026 年 9 月 1 日
Claude API model IDclaude-fable-5-1
上下文窗口100 万 token
最大输出128,000 token
标准输入每百万 token 10 美元
标准输出每百万 token 50 美元
5 分钟 cache write每百万 token 12.50 美元
1 小时 cache write每百万 token 20 美元
Cache read每百万 token 0.25 美元
ThinkingAdaptive,始终开启
默认 effortHigh
相对延迟Slower

1M 上下文窗口采用标准的按 token 价格,不另设长上下文加价。但是,请求越大,计费 token 仍然越多。“能放得下”不等于“成本更低”。

Anthropic 自己的选型建议也不是“永远使用能力最强的模型”。官方建议大多数工作先从 Claude Opus 5 开始;只有面对高难度推理、长时程 Agent 任务,或者 Opus 5 在较高 effort 下仍然不够时,再考虑 Fable 5.1。在你自己的评测给出不同证据前,这是一个更稳妥的默认顺序。

Prompt Caching 改变了什么,又没有改变什么

Prompt Caching(提示词缓存)让 API 应用重复使用已经处理过的提示词前缀,而不用每次都按标准输入价格重新处理。一个稳定前缀可能包含 system prompt、项目规则、工具定义、参考文档或前面的对话历史。

Anthropic 当前的 Prompt Caching 价格把费用分为三类:

  • 5 分钟 cache write:每百万 token 12.50 美元;
  • 1 小时 cache write:每百万 token 20 美元;
  • 缓存成功命中后的 cache read:每百万 token 0.25 美元。

首次写入比普通输入更贵,因为系统需要建立可复用的缓存;后续成功读取则便宜很多。因此,最终是否省钱取决于:多少内容能够保持不变、缓存过期前会复用几次,以及应用是否真的产生 cache hit(缓存命中)。

一个可以复核的成本例子

假设一个编程 Agent 循环里有 40 万 token 的稳定前缀,并在 5 分钟缓存有效期内发出 10 次请求。为了看清缓存本身的影响,暂时不计算每轮新增输入、输出、工具费用和其他成本。

不使用缓存时,这段前缀处理 10 次的费用为:

text
0.4 百万 token × 10 美元 × 10 次请求 = 40.00 美元

使用一次 5 分钟 cache write,加上 9 次成功读取时:

text
首次 cache write:0.4 × 12.50 美元 = 5.00 美元9 次 cache read: 0.4 × 0.25 美元 × 9 = 0.90 美元缓存前缀合计:                           5.90 美元

这只是说明计算方式,不是对一次真实任务的报价。实际账单还包括未缓存的提示词增长、按每百万 token 50 美元计费的模型输出、可能发生的工具与搜索费用、缓存刷新或重写,以及缓存未命中的请求。使用 1 小时缓存时,首次写入价格也会高于这个例子里的 5 分钟写入。

Anthropic 估算,Fable 5.1 更低的 cache-read 价格可以让典型 workload 的成本降低约 25%,高度 Agent 化的 workload 最多可能降低约 45%。这是 Anthropic 的估算,不是对某个 Agent 执行框架的保证。真正的路由决策仍应以你自己的缓存命中率和“可验收结果”成本为准。

为什么 Fable 5.1 可能适合长时程编程 Agent

编程 Agent 的成本结构不同于一次性聊天。它可能先读取一大段稳定上下文,再调用工具、追加结果、继续推理,并把这个循环重复很多次。当同一段有用前缀可以跨多轮保留时,低价 cache read 的价值最大。

根据 Anthropic 公布的规格与产品定位——而不是 Agent.Space 的实测——Fable 5.1 值得在以下任务中进入候选名单:

  • 需要在许多文件和互相冲突的证据之间定位原因的全仓库调查;
  • 需要连续数小时保留架构约束和验收条件的多阶段实现;
  • 如果浅层判断出错会带来大量返工的代码审查或性能分析;
  • 反复引用同一批资料的长时间研究任务;
  • 可以通过测试、diff、日志或清晰评审标准验证的委派任务。

Anthropic 把 Fable 5.1 描述为面向高难度编程工作,包括跨越整个代码库的功能、代码审查、性能优化和多日自主 Session。这里应把它视为厂商对能力的说明:它值得测试,但不能证明它一定会在你的代码库里胜过更便宜的模型。

1M 上下文窗口可以容纳真正很大的工作集,但不应该成为“把整个代码库不加筛选全部塞进去”的理由。更好的检索、更小的任务边界和清晰的信源优先级,通常同时有利于成本和可靠性。

哪些情况下不应该默认使用 Fable 5.1

如果任务范围很小、容易验证,而且不需要长推理链,Fable 5.1 的优势往往不明显。例如,已知文本替换、小范围格式修正,或文件边界明确且结果可确定的更新。

以下情况也不适合直接把它设为默认模型:

  • 交互速度比最大推理深度更重要;
  • 大部分提示内容每轮都会变化,难以复用缓存;
  • 任务会生成大量输出,而输出价格是每百万 token 50 美元;
  • Agent harness 无法提供可靠的缓存或用量数据;
  • 没有足够明确的验收方法,无法区分“真正正确”和“看起来很有说服力”。

对于这类任务,应在相同条件下比较 Fable 5.1、Opus 5、Sonnet 5 或其他兼容模型。真正有用的指标是整次任务的“每个可验收结果成本”,其中包括返工和人工 review,而不是模型家族名称或单次请求价格。

编程 Agent 模型选型框架进一步说明了如何先按兼容性、任务、上下文、成本和工具筛选,再进行可控测试。

如果选择范围已经缩小到两条最新的高价路线,可以继续看 GPT-6 Astra 与 Claude Fable 5.1 对比。那篇文章把各自价格与缓存细则留在专门指南中,只比较真正会改变选择的任务、harness、证据与“可验收结果成本”。

Model 与 Agent harness 的区别:Claude Code 在哪一层

Claude Fable 5.1 是一个 Model(模型)。Claude Code 是 Agent harness(Agent 执行框架或入口):它负责围绕模型收集上下文、调用工具、管理权限、修改文件并组织执行流程。Runtime 和具体产品界面还会增加其他约束。这些层不能被当成同一个产品。

如果你第一次接触这个区别,可以先看为什么 Agent harness 和 Model 是两项独立选择

Anthropic 当前的 Claude Code 模型配置文档说明,Fable 5.1 需要 Claude Code v2.1.255 或更高版本,并且必须由用户主动选择;它不是任何账户类型的默认模型。实际能否使用,还取决于服务器为当前组织与账户返回的权限。本页不展开 model picker、命令行、effort 控制与缺失排查,具体步骤请看独立的 Claude Code 教程。

在把真实任务路由到这个模型前,应确认:

  1. 实际使用的 harness 和产品界面;
  2. Provider 和准确的 model ID;
  3. 该集成真正支持的上下文与 effort 设置;
  4. 缓存如何启用和统计;
  5. 最终由哪个账户承担费用。

先做一次可控评测,再路由真实工作

选择一个足以体现预期优势、但仍然能由人检查的代表性任务。在候选模型之间尽量保持初始代码、提示词、权限、工具和验收条件一致。

至少记录以下信息:

  • 准确的模型与 harness 版本;
  • input、cache write、cache read 和 output token;
  • 每轮的缓存命中或未命中信息;
  • 总耗时与返工轮数;
  • 通过了哪些测试或检查;
  • 达到可验收状态前需要多少人工 review 时间。

不要只根据第一次回答判断模型。一次更慢、更贵的请求,如果避免了多轮返工,仍然可能更划算;看起来很强的结果,如果扩大了范围、忽略约束或没有核验证据,也仍然是不合格的。

对于长任务,还要测试恢复能力:中断一次运行、提供一条与早期假设矛盾的工具结果,或从明确的 handoff 继续。真正重要的是这个工作流能否在不丢失约束的情况下产生可评审结果,而不是能否输出最长的解释。

常见问题

Claude Fable 5.1 多少钱?

通过 Claude API 使用时,标准输入是每百万 token 10 美元,输出是每百万 token 50 美元。5 分钟 cache write 是 12.50 美元,1 小时 cache write 是 20 美元,成功命中的 cache read 是每百万 token 0.25 美元。订阅产品和 Console 是不同计费路径,最终应查看实际承担账单的产品。

Claude Fable 5.1 的上下文窗口多大?

官方模型规格列出 100 万 token 上下文窗口与 128,000 token 最大输出。它表达的是容量,并不代表应该跳过检索和筛选,把整个代码库直接放进每次请求。

如何在 Claude Code 中选择 Fable 5.1?

可以在 Claude Code Session 中使用 /model fable,也可以用 claude --model fable 启动。Fable 5.1 需要 Claude Code v2.1.255 或更高版本,实际权限取决于组织和账户。Claude Code 分步教程还说明了 effort 设置,以及模型没有出现时应该检查什么。

Claude Fable 5.1 和 Claude Code 是同一个产品吗?

不是。Fable 5.1 是负责生成回答的模型;Claude Code 是负责收集上下文、调用工具、管理权限并把任务发送给所选模型的 Agent harness。模型权限、上下文处理、effort 控制与计费,仍取决于具体的 Claude Code 使用路径和账户。

在 Agent.Space 里下一步怎么做

Agent.Space 独立于 Anthropic。本文不声称 Claude Fable 5.1 目前已经在 Agent.Space 可用,也不声称它能与某个 Agent harness 搭配。模型可用性、provider route 和兼容组合都可能变化。

如果你想在持续保存状态的云端 Workspace 中评测模型,应先选择 Agent harness,再以实时模型选择器为准。在 Agent.Space 使用 Claude Code 的指南介绍了周边工作流和产品边界。

当实时选择器确实提供兼容路径时,先从一个范围明确、可以验证的小任务开始。创建 Agent.Space Workspace,确认当前账户实际显示的模型与价格,再根据结果决定是否扩大使用。