GPT-6 Astra 和 Claude Fable 5.1 之间不存在脱离任务的通用赢家。 两者的 API 基础价格都是每百万输入 token 10 美元、每百万输出 token 50 美元,上下文都在 100 万 token 左右,最大输出也都是 128,000 token。真正拉开成本差异的是细则:Astra 的输入超过 272,000 token 后,整次请求都会采用更高费率;Fable 5.1 的 cache read 只要每百万 token 0.25 美元,而且没有单独列出长上下文倍率。
执行层同样重要。GPT-6 Astra 有 Codex 这条原生路径,Claude Fable 5.1 有 Claude Code 这条原生路径。在一个 Agent harness(Agent 执行入口)里测出的结果,不会自动迁移到另一个工具、权限、提示词、上下文管理和重试机制都不同的 harness。
本文基于 2026 年 9 月 7 日核验的官方文档与厂商公开评测,不是 Agent.Space 实测,也不声称 Agent.Space 已经提供其中任何一个模型。想先了解 Astra 本身,可以阅读 GPT-6 Astra 发布与 Coding Agent 指南。
规格与开放状态
OpenAI 模型页与 Anthropic 模型页确认了这些合同,但不保证你的账户、云市场、地区或产品界面今天已经展示全部选项。
本文准备时,OpenAI 发布说明和 ChatGPT Release Notes仍把 Astra 描述为分阶段 rollout。Anthropic 则把 Fable 5.1 标为当前 active latest model,并通过 Claude API 与多个云平台提供。无论选哪一个,都应该先验证准确的调用路径,再围绕它设计生产工作流。
价格与上下文:基础单价相同,请求形状不同
对于一条较短、完全未缓存的请求,两者公开单价可以得到相同结果。假设输入 200,000 token、输出 20,000 token,不计算工具和其他费用,两边都是 3 美元:
当输入达到 300,000 token 时,Astra 的长上下文规则会改变结果。它不是只给超过 272K 的部分加价,而是给整次请求的输入按 2 倍、输出按 1.5 倍计价。仍假设输出 20,000 token:
这不能证明 Fable 完成任务时一定更便宜。Astra 可能需要更少轮次、生成更少内容,或者少一次失败返工。这个例子只说明:看到“两者都是 $10/$50”还不足以做预算判断。
缓存会继续拉开成本结构。假设有一段 400,000 token 的稳定前缀,先写入一次,随后成功读取九次。为了看清缓存合同,暂时忽略输出、每轮新增输入、工具费和未命中:
这仍然只是价格算式,不是真实任务报价。实际 Coding Agent 每轮都会追加新 token,也可能重写缓存、缓存未命中、调用额外计费工具,并生成完全不同长度的输出。两家使用的 tokenizer 也不同,同一份代码不能默认产生相同的计费 token 数。最终应读取你实际测试路径返回的 usage 数据。
OpenAI 还列出 Batch 和 Flex 为 Standard 的 50%,Fast 为适用费率的 2 倍;Anthropic 为 Fable 5.1 列出 Batch API 的 50% 折扣。它们的延迟与执行合同不同,不能把异步批处理价格当成交互式 Agent Session 的直接替代。
如果需要进一步理解 Fable 的缓存成本,可以查看 Claude Fable 5.1 价格与 Coding Agent 指南。
公开 Benchmark 能证明什么,不能证明什么
OpenAI 的 GPT-6 Astra 发布报告直接列出了 Claude Fable 5.1 的对比数据,其中两项与 Coding Agent 较相关:
OpenAI 还估算,在报告展示的配置里,Astra 的每任务 API 成本分别低约 63% 和 31%。这些是有价值的数据点,但必须明确标成 OpenAI 厂商自报结果。OpenAI 也说明,表中取各模型某个 effort 下的最高分,而且研究环境或 API 可能因为 system prompt、工具等差异而与生产 ChatGPT 不同。
Anthropic 的 Fable 5.1 Benchmark 说明恰好展示了为什么方法细节重要。Anthropic 表示 Terminal-Bench Science 0.1 每个模型的标准误约为 ±3.5–4.5 分,并明确区分自家设置与公共排行榜使用的 Claude Code harness;它也说明生产安全措施在部分任务中改变了结果。即便 benchmark 名字相同,任务版本不同也可能不能直接横向比较。
至少要通过以下六项读取一个公开 Benchmark:
- 准确的任务版本和子集;
- harness、可用工具与网络权限;
- system / developer instructions;
- 每个模型采用的 effort 或推理设置;
- 重试次数、停止规则与安全措施;
- “成本”指一次请求、一次 attempt,还是一个已经验收的任务。
GPT-6 Astra Benchmark 证据审计会把厂商、独立和内部数据分开,不把不同来源压成一张没有边界的排行榜。
Codex vs Claude Code 是 harness 选择
GPT-6 Astra 与 Claude Fable 5.1 是模型。Codex 和 Claude Code 是 Agent harness:它们决定如何搜索代码库、调用工具、修改文件、执行权限、保留上下文、从失败中恢复并展示证据。Agent Harness vs Model详细解释了这层区别。
Astra 在 Codex CLI 的最低兼容线是 0.153.0 或更高。官方 Codex release history显示:0.153.1 增加了通过 API 配置 Astra 的能力,但一开始没有把它放进 model picker;0.153.3 增加了支持的 Amazon Bedrock catalog route;0.153.4 修复 bundled picker 的显示,并在没有显式配置模型时把 Astra 设为 bundled default。客户端支持仍不等于你的账户已经获得权限。
Fable 5.1 应搭配当前版本的 Claude Code,而不是假设旧 binary 能完整提供 1M context 和最新缓存行为。Claude Code release history记录了 v2.1.260–v2.1.261 前后的 Fable model picker、1M context、prompt cache 与 effort 修复。账户权限、usage credits、provider route 和组织策略仍然需要分开确认。
有两种都合理的对比方式,但它们回答的是不同问题:
- **模型对比:**让两个 API 通过同一个小型、中立的 harness,提供等价工具与验收条件。这样可以减少 harness 干扰,但不能复现两家原生产品的最佳体验。
- **工作流对比:**在 Codex 里运行 Astra,在 Claude Code 里运行 Fable 5.1。这样测的是你实际会使用的产品,但结果属于完整的“模型 + harness”组合,而不是单纯模型能力。
不能把第二种实验的结果直接标成某个模型的纯智力结论。
按任务选择先测试谁
Provider 与 harness 兼容性应该排在 benchmark 偏好之前。如果实际产品不能提供需要的模型、工具、输入类型或费用数据,理论赢家也不是一条可用路径。
一套可复现的评测协议
至少使用三类任务,不要只看一个漂亮 Demo:
- 有确定性测试的范围明确修改;
- 常规的多文件功能或代码审查;
- 需要工具恢复、长时间保留约束的易失败调查。
在中立模型对比里,保持初始 commit、任务提示、tool schema、权限、effort 规则、时间上限和验收检查相同,并给相同的重试预算。记录输入、cache write、cache read、输出、工具费用、耗时、失败 attempt、通过的检查、人工修改与最终验收。
然后再做 Codex 和 Claude Code 的端到端工作流对比。保持业务任务和验收标准一致,但允许各自 harness 使用原生上下文和工具流程。结果应写成“Codex + GPT-6 Astra”这样的完整路径,不能只写模型名。
核心指标应是每个可验收结果的成本。一条便宜请求如果需要三次返工,可能比一次昂贵但通过的请求成本更高;一项高 benchmark 分数如果扩大范围或丢掉受保护约束,也不是成功任务。
测试前先定义决策线:最大可接受成本、延迟、人工 review 分钟、失败率和安全边界。否则很容易在结果出来后,只选择表达最流畅的那一方。
Agent.Space 在其中的位置
Agent.Space 独立于 OpenAI 和 Anthropic。本文不声称 GPT-6 Astra 或 Claude Fable 5.1 已经能通过某个 Agent.Space harness 使用。官方 API 可用和原生客户端支持,都不能证明第三方已经完成兼容。
请以 Agent.Space 实时 model selector 为准:先选择 harness,再确认当前账户显示的模型和价格,用一个有验收条件的小任务试跑后,再迁移真实工作。
开始一个 Agent.Space Session,用真正能验证的任务比较当前可用路径。
FAQ
GPT-6 Astra 写代码一定比 Claude Fable 5.1 更好吗?
不一定。OpenAI 在自己发布的 Terminal-Bench 4.0 与 Terminal-Bench Science 0.1 配置中报告了 Astra 更高的结果。这些是有参考价值的厂商数据,不保证适用于你的代码库、工具或 harness。设置默认模型前,应分别做可控模型测试和端到端工作流测试。
哪个模型更便宜?
两者的基础未缓存 API 价格都是每百万输入 token 10 美元、每百万输出 token 50 美元。Fable 5.1 的 cache read 更便宜,也没有单列长上下文倍率;Astra 输入超过 272K 后,整次请求采用更高费率。不过,如果 Astra 用更少轮次完成任务,它的每个可验收结果成本仍可能更低。
哪个模型的上下文更大?
GPT-6 Astra 是 1,050,000 token,Claude Fable 5.1 是 1,000,000 token。相比这 50,000 token 的容量差异,检索质量、缓存复用、真实 token 数和 Astra 的 272K 价格边界通常更重要。
应该比较 Codex vs Claude Code,还是 Astra vs Fable 5.1?
两种都应该做,但必须正确命名。中立 API harness 更接近模型对比;Codex + Astra 与 Claude Code + Fable 更接近完整工作流对比。后者同时包含工具、提示词、权限和上下文管理的差异。
可以在 Agent.Space 使用这两个模型吗?
本文没有确认任何一条支持路径。请查看当前账户实时显示的 Agent 与模型组合,并在依赖该组合前先测试一个范围较小的任务。
