Agent.Space 博客

GPT-6 Astra vs Claude Fable 5.1:编程 Agent 选型

比较 GPT-6 Astra 与 Claude Fable 5.1 的 API 成本、缓存、长上下文、官方 Benchmark、Codex / Claude Code 边界与可复现测试方法。

GPT-6 Astra 和 Claude Fable 5.1 之间不存在脱离任务的通用赢家。 两者的 API 基础价格都是每百万输入 token 10 美元、每百万输出 token 50 美元,上下文都在 100 万 token 左右,最大输出也都是 128,000 token。真正拉开成本差异的是细则:Astra 的输入超过 272,000 token 后,整次请求都会采用更高费率;Fable 5.1 的 cache read 只要每百万 token 0.25 美元,而且没有单独列出长上下文倍率。

执行层同样重要。GPT-6 Astra 有 Codex 这条原生路径,Claude Fable 5.1 有 Claude Code 这条原生路径。在一个 Agent harness(Agent 执行入口)里测出的结果,不会自动迁移到另一个工具、权限、提示词、上下文管理和重试机制都不同的 harness。

本文基于 2026 年 9 月 7 日核验的官方文档与厂商公开评测,不是 Agent.Space 实测,也不声称 Agent.Space 已经提供其中任何一个模型。想先了解 Astra 本身,可以阅读 GPT-6 Astra 发布与 Coding Agent 指南

规格与开放状态

项目GPT-6 AstraClaude Fable 5.1
官方 model IDgpt-6-astraclaude-fable-5-1
发布时间2026 年 9 月 3 日2026 年 9 月 1 日
上下文窗口1,050,000 token1,000,000 token
最大输出128,000 token128,000 token
基础输入 / 输出每 1M token $10 / $50每 1M token $10 / $50
Cached input / cache read每 1M token $1每 1M token $0.25
Cache write每 1M token $12.50每 1M token:5 分钟 $12.50;1 小时 $20
长上下文规则输入超过 272K 后,整次请求 input/cache 2 倍、output 1.5 倍官方未单列长上下文倍率
Thinking 控制lowmax reasoning effortAdaptive thinking,并可控制 effort
官方 API 状态已发布;核验时仍在分阶段开放Claude Platform 标记为 Active (latest)
原生 harness 示例CodexClaude Code

OpenAI 模型页Anthropic 模型页确认了这些合同,但不保证你的账户、云市场、地区或产品界面今天已经展示全部选项。

本文准备时,OpenAI 发布说明ChatGPT Release Notes仍把 Astra 描述为分阶段 rollout。Anthropic 则把 Fable 5.1 标为当前 active latest model,并通过 Claude API 与多个云平台提供。无论选哪一个,都应该先验证准确的调用路径,再围绕它设计生产工作流。

价格与上下文:基础单价相同,请求形状不同

对于一条较短、完全未缓存的请求,两者公开单价可以得到相同结果。假设输入 200,000 token、输出 20,000 token,不计算工具和其他费用,两边都是 3 美元:

text
输入:0.2 × $10 = $2.00输出:0.02 × $50 = $1.00合计:              $3.00

当输入达到 300,000 token 时,Astra 的长上下文规则会改变结果。它不是只给超过 272K 的部分加价,而是给整次请求的输入按 2 倍、输出按 1.5 倍计价。仍假设输出 20,000 token:

300K 输入 + 20K 输出,未缓存输入输出合计
GPT-6 Astra$6.00$1.50$7.50
Claude Fable 5.1$3.00$1.00$4.00

这不能证明 Fable 完成任务时一定更便宜。Astra 可能需要更少轮次、生成更少内容,或者少一次失败返工。这个例子只说明:看到“两者都是 $10/$50”还不足以做预算判断。

缓存会继续拉开成本结构。假设有一段 400,000 token 的稳定前缀,先写入一次,随后成功读取九次。为了看清缓存合同,暂时忽略输出、每轮新增输入、工具费和未命中:

text
GPT-6 Astra(每次请求都超过 272K):0.4 × ($12.50 × 2) + 9 × 0.4 × ($1 × 2) = $17.20
Claude Fable 5.1(5 分钟 cache write):0.4 × $12.50 + 9 × 0.4 × $0.25 = $5.90
Claude Fable 5.1(1 小时 cache write):0.4 × $20 + 9 × 0.4 × $0.25 = $8.90

这仍然只是价格算式,不是真实任务报价。实际 Coding Agent 每轮都会追加新 token,也可能重写缓存、缓存未命中、调用额外计费工具,并生成完全不同长度的输出。两家使用的 tokenizer 也不同,同一份代码不能默认产生相同的计费 token 数。最终应读取你实际测试路径返回的 usage 数据。

OpenAI 还列出 Batch 和 Flex 为 Standard 的 50%,Fast 为适用费率的 2 倍;Anthropic 为 Fable 5.1 列出 Batch API 的 50% 折扣。它们的延迟与执行合同不同,不能把异步批处理价格当成交互式 Agent Session 的直接替代。

如果需要进一步理解 Fable 的缓存成本,可以查看 Claude Fable 5.1 价格与 Coding Agent 指南

公开 Benchmark 能证明什么,不能证明什么

OpenAI 的 GPT-6 Astra 发布报告直接列出了 Claude Fable 5.1 的对比数据,其中两项与 Coding Agent 较相关:

评测GPT-6 AstraClaude Fable 5.1来源
Terminal-Bench 4.057.9%55.8%OpenAI 发布报告
Terminal-Bench Science 0.164.6%52.6%OpenAI 发布报告

OpenAI 还估算,在报告展示的配置里,Astra 的每任务 API 成本分别低约 63% 和 31%。这些是有价值的数据点,但必须明确标成 OpenAI 厂商自报结果。OpenAI 也说明,表中取各模型某个 effort 下的最高分,而且研究环境或 API 可能因为 system prompt、工具等差异而与生产 ChatGPT 不同。

Anthropic 的 Fable 5.1 Benchmark 说明恰好展示了为什么方法细节重要。Anthropic 表示 Terminal-Bench Science 0.1 每个模型的标准误约为 ±3.5–4.5 分,并明确区分自家设置与公共排行榜使用的 Claude Code harness;它也说明生产安全措施在部分任务中改变了结果。即便 benchmark 名字相同,任务版本不同也可能不能直接横向比较。

至少要通过以下六项读取一个公开 Benchmark:

  1. 准确的任务版本和子集;
  2. harness、可用工具与网络权限;
  3. system / developer instructions;
  4. 每个模型采用的 effort 或推理设置;
  5. 重试次数、停止规则与安全措施;
  6. “成本”指一次请求、一次 attempt,还是一个已经验收的任务。

GPT-6 Astra Benchmark 证据审计会把厂商、独立和内部数据分开,不把不同来源压成一张没有边界的排行榜。

Codex vs Claude Code 是 harness 选择

GPT-6 Astra 与 Claude Fable 5.1 是模型。Codex 和 Claude Code 是 Agent harness:它们决定如何搜索代码库、调用工具、修改文件、执行权限、保留上下文、从失败中恢复并展示证据。Agent Harness vs Model详细解释了这层区别。

Astra 在 Codex CLI 的最低兼容线是 0.153.0 或更高。官方 Codex release history显示:0.153.1 增加了通过 API 配置 Astra 的能力,但一开始没有把它放进 model picker;0.153.3 增加了支持的 Amazon Bedrock catalog route;0.153.4 修复 bundled picker 的显示,并在没有显式配置模型时把 Astra 设为 bundled default。客户端支持仍不等于你的账户已经获得权限。

Fable 5.1 应搭配当前版本的 Claude Code,而不是假设旧 binary 能完整提供 1M context 和最新缓存行为。Claude Code release history记录了 v2.1.260–v2.1.261 前后的 Fable model picker、1M context、prompt cache 与 effort 修复。账户权限、usage credits、provider route 和组织策略仍然需要分开确认。

有两种都合理的对比方式,但它们回答的是不同问题:

  • **模型对比:**让两个 API 通过同一个小型、中立的 harness,提供等价工具与验收条件。这样可以减少 harness 干扰,但不能复现两家原生产品的最佳体验。
  • **工作流对比:**在 Codex 里运行 Astra,在 Claude Code 里运行 Fable 5.1。这样测的是你实际会使用的产品,但结果属于完整的“模型 + harness”组合,而不是单纯模型能力。

不能把第二种实验的结果直接标成某个模型的纯智力结论。

按任务选择先测试谁

如果任务是这种形状可以先测的候选为什么值得进入测试,而不是为什么它必胜
已经使用 Codex,要做高难度多步骤编程或 computer useGPT-6 Astra原生 Codex 路径,以及较强的厂商自报终端评测结果
已经使用 Claude Code,要运行长时间、少人值守的实现Claude Fable 5.1原生 Claude Code 路径,以及 Anthropic 的长时程定位
同一段稳定提示前缀会被反复读取Claude Fable 5.1$0.25 cache read 可能明显改变多轮成本
单次输入经常超过 272K tokenFable 5.1 值得先做成本测试Astra 超过这个边界后会给整次请求加价
任务保持在 272K 以下,而且失败返工很贵Astra 值得做结果成本测试如果它用更少 attempt 完成任务,可能抵消更高单次费用
任务机械、重复、容易验证先测试更便宜的模型两款高端模型都没有必要自动成为默认值

Provider 与 harness 兼容性应该排在 benchmark 偏好之前。如果实际产品不能提供需要的模型、工具、输入类型或费用数据,理论赢家也不是一条可用路径。

一套可复现的评测协议

至少使用三类任务,不要只看一个漂亮 Demo:

  1. 有确定性测试的范围明确修改;
  2. 常规的多文件功能或代码审查;
  3. 需要工具恢复、长时间保留约束的易失败调查。

在中立模型对比里,保持初始 commit、任务提示、tool schema、权限、effort 规则、时间上限和验收检查相同,并给相同的重试预算。记录输入、cache write、cache read、输出、工具费用、耗时、失败 attempt、通过的检查、人工修改与最终验收。

然后再做 Codex 和 Claude Code 的端到端工作流对比。保持业务任务和验收标准一致,但允许各自 harness 使用原生上下文和工具流程。结果应写成“Codex + GPT-6 Astra”这样的完整路径,不能只写模型名。

核心指标应是每个可验收结果的成本。一条便宜请求如果需要三次返工,可能比一次昂贵但通过的请求成本更高;一项高 benchmark 分数如果扩大范围或丢掉受保护约束,也不是成功任务。

测试前先定义决策线:最大可接受成本、延迟、人工 review 分钟、失败率和安全边界。否则很容易在结果出来后,只选择表达最流畅的那一方。

Agent.Space 在其中的位置

Agent.Space 独立于 OpenAI 和 Anthropic。本文不声称 GPT-6 Astra 或 Claude Fable 5.1 已经能通过某个 Agent.Space harness 使用。官方 API 可用和原生客户端支持,都不能证明第三方已经完成兼容。

请以 Agent.Space 实时 model selector 为准:先选择 harness,再确认当前账户显示的模型和价格,用一个有验收条件的小任务试跑后,再迁移真实工作。

开始一个 Agent.Space Session,用真正能验证的任务比较当前可用路径。

FAQ

GPT-6 Astra 写代码一定比 Claude Fable 5.1 更好吗?

不一定。OpenAI 在自己发布的 Terminal-Bench 4.0 与 Terminal-Bench Science 0.1 配置中报告了 Astra 更高的结果。这些是有参考价值的厂商数据,不保证适用于你的代码库、工具或 harness。设置默认模型前,应分别做可控模型测试和端到端工作流测试。

哪个模型更便宜?

两者的基础未缓存 API 价格都是每百万输入 token 10 美元、每百万输出 token 50 美元。Fable 5.1 的 cache read 更便宜,也没有单列长上下文倍率;Astra 输入超过 272K 后,整次请求采用更高费率。不过,如果 Astra 用更少轮次完成任务,它的每个可验收结果成本仍可能更低。

哪个模型的上下文更大?

GPT-6 Astra 是 1,050,000 token,Claude Fable 5.1 是 1,000,000 token。相比这 50,000 token 的容量差异,检索质量、缓存复用、真实 token 数和 Astra 的 272K 价格边界通常更重要。

应该比较 Codex vs Claude Code,还是 Astra vs Fable 5.1?

两种都应该做,但必须正确命名。中立 API harness 更接近模型对比;Codex + Astra 与 Claude Code + Fable 更接近完整工作流对比。后者同时包含工具、提示词、权限和上下文管理的差异。

可以在 Agent.Space 使用这两个模型吗?

本文没有确认任何一条支持路径。请查看当前账户实时显示的 Agent 与模型组合,并在依赖该组合前先测试一个范围较小的任务。