Agent.Space 博客

GPT-6 Astra Benchmark:这些跑分到底说明什么

拆解 GPT-6 Astra 的厂商与独立 benchmark,说明 harness、推理强度、安全策略和成本口径为何会改变跑分与选型结论。

GPT-6 Astra 的公开 benchmark(基准测试)足以让它进入高难度 Coding Agent 任务的候选名单,但还不能证明它在所有场景下都是赢家。 OpenAI 公布的 Terminal-Bench 4.0 里,Astra 明显领先 GPT-5.6 Sol;到了 DeepSWE,两者差距却很小;在 FrontierCode 上,差距又处于两者之间。Artificial Analysis 的当前独立指数也更偏向 Astra,但同时测得 Sol 的价格更低、输出更快。ARC Prize 则揭示了更关键的一点:只改变 harness,Astra 的 ARC-AGI-3 分数就从 62.7% 变成了 99.9%。

这些结果可以同时成立,因为 benchmark 分数属于一整套测试配置,而不只属于一个模型名字。任务集、版本、模型快照、推理强度、提示词、工具、上下文策略、安全限制和成本算法,都是结果的一部分。

本文会分开厂商发布、第三方评测和内部数据,再把这些公开数字转化成一套可在真实 Coding Agent 任务上执行的受控测试。它是一篇基于公开信源的分析,不是 Agent.Space 实测,也不代表 GPT-6 Astra 已经能在 Agent.Space 中使用。

最后核验:2026 年 9 月 7 日。 Benchmark 版本和在线排行榜可能继续变化。若要据此做购买或模型路由决定,请先打开文中的原始来源核对最新数据。

先说结论:测试设置也是结果的一部分

比“跑分最高,所以 Astra 赢了”更可靠的结论是:

  • Astra 在多项公开 Coding 与 Agent 评测中表现很强。
  • 与 GPT-5.6 Sol 相比,它的领先幅度会随任务明显变化。
  • 针对供应商特性优化过的 harness,对 Astra 的 ARC-AGI-3 结果产生了远大于普通模型差距的影响。
  • 每 token 更贵,并不一定意味着完成一个 benchmark 任务更贵,因为 token 用量、动作数和重试次数也会变化。
  • 除非评测任务与你的任务接近,而且你的 harness 能复现关键测试条件,否则这些数字都不能直接预测你自己的仓库结果。

如果这个区别还不清楚,可以先了解为什么 Agent harness 和模型是两层不同的选择。Harness 是包在模型外面的 Agent 执行层,决定给模型什么上下文、允许调用哪些工具、如何保存状态、何时重试,以及哪些操作必须获得批准。只看模型名字,会把系统中大部分真正影响结果的因素隐藏掉。

一张能正确读懂的 GPT-6 Astra benchmark 表

下表只选择几项有代表性的结果。我们不会把它们重新合成一个新分数,因为它们测试的是不同任务,发布条件也不同。

评测Astra 结果对比结果证据标签可以辅助判断什么
Terminal-Bench 4.057.9%GPT-5.6 Sol:37.3%OpenAI 发布表;厂商数据在公布设置下完成终端软件、系统配置和分析任务的表现
DeepSWE v1.174.1%GPT-5.6 Sol:72.7%OpenAI 发布表;厂商数据一个 Astra 领先很小、而非大幅领先的 Coding 结果
FrontierCode 1.1 Main53.3%GPT-5.6 Sol:47.5%OpenAI 发布表;厂商数据在该 benchmark 版本与提示词合同下的代码工作
Artificial Analysis Coding Agent Index v1.467.0GPT-5.6 Sol:65.1OpenAI 表中转录的第三方指数Coding Agent 综合对比;必须连同指数版本一起看
Artificial Analysis Intelligence Index v4.2,max effort55GPT-5.6 Sol:51第三方在线对比更广泛的智能任务,不是只针对编程的结论
ARC-AGI-3 Semi-PrivateStandard 62.7%;Provider Adapter 99.9%同一个 Astra 模型家族,不同 harness第三方原始评测方上下文保留和供应商专用编排会怎样改变 Agent 结果

前四项来自 OpenAI 的 GPT-6 Astra 发布表。OpenAI 说明,表中的模型成绩是在各推理强度下观察到的最高分;研究或 API 环境也可能因为系统提示词和可用工具不同,与正式 ChatGPT 产生差异。FrontierCode 还附有 Astra 所用 developer message 的说明。这些细节并不会让数字失效,但意味着整张表不是一场条件完全统一的单一比赛。

当前 Artificial Analysis 的 Astra 与 Sol 对比页 使用 Intelligence Index v4.2。本文核验时,Astra max 为 55,Sol max 为 51;同一页面也测得 Sol 更快,并在其声明的缓存、输入和输出 token 混合比例下给出更低的综合 token 价格。它给厂商发布叙事提供了一个有用的补充:综合得分更强,并不会让延迟和价格取舍消失。

厂商发布、第三方评测和内部数据不是同一种证据

Benchmark 的名字并不能告诉你是谁实际跑了测试,也不能告诉你测试设置公开到了什么程度。每条结论都应该保留下面三类标签之一。

厂商发布数据

OpenAI 的发布页是核对“OpenAI 官方声称了什么”以及其主动公布了哪些配置说明的权威来源。它同时也是一篇产品发布文。因此,即使某个 benchmark 数据集或指数来自外部,出现在这张发布表里的数字仍应标为厂商发布数据。

这类结果适合用于发现候选优势,也适合确认测试版本;但它不能替代第三方复现,更不能替代你自己的验收测试。

第三方原始评测方

ARC Prize 公布了 Astra 的 ARC-AGI-3 测试、harness 定义、推理强度、成本和任务级结果。Artificial Analysis 也公布了自己的方法和在线比较数据。这些来源减少了对厂商摘要的依赖,但它们依然只代表各自选择的任务与配置。

“第三方”也不等于“能代表所有场景”。ARC-AGI-3 研究的是受限交互环境中的探索、建模、目标设定和规划,而不是 Git 仓库迁移。Artificial Analysis 则会组合一套特定评测,它的组成和版本都可能调整。

内部评测

OpenAI 的发布表还包含 Internal Database Migration Tasks,其中 Astra 为 63.9%,Sol 为 42.7%。这里最重要的是 Internal:外部读者无法像检查公开 benchmark 那样完整审计这个私有任务集。内部结果可以支持厂商自己的产品主张,但证据权重不应与可复现的外部评测相同。

客户案例中的口头评价、没有公开设置的公司测试也遵循同一原则。它们可以作为信号,但不能直接迁移成你自己代码库的事实。

ARC-AGI-3 展示了 Harness 能产生多大影响

ARC Prize 的 GPT-6 Astra 分析 是理解“为什么不能只看模型分数”的最好例子之一。

在 ARC Prize 的 Standard harness 中,Astra 以 max 推理强度在 Semi-Private 集合上获得 62.7%,报告的整套评测成本约为 26,098 美元。这个供应商中立的配置允许模型自己选择需要带到后续步骤的可见笔记。

Provider Adapter harness 中,Astra 以 high 推理强度获得 99.9%,成本约为 18,817 美元。这个适配器会在请求间保留外部无法看到的推理状态,并通过 compaction 管理长对话。对于两套配置都解决的 Public 与 Semi-Private 游戏/推理强度组合,ARC Prize 报告 Provider Adapter 的汇总记录耗时约快 3.66 倍,总 token 少 49%。

这不代表所有供应商专用 harness 都能带来 37 个百分点的提升。它真正证明的是:上下文连续性和编排方式可能是决定结果的关键变量。它也解释了为什么两个产品即使用同一个模型 ID,在长任务里的表现仍可能明显不同。

推理强度也不是一个简单的“越高越好、越高越贵”旋钮。在 Standard harness 中,分数从 low 到 max 大体上升;但 max 因为用更少动作解决游戏,成本反而低于多个较低强度的配置。在 Provider Adapter 里,high 得到最高分,其他强度则都很接近。更强推理可能在某类任务里减少浪费,也可能在另一类任务里只增加延迟。

最后要注意,ARC-AGI-3 是一个边界清楚的交互式推理 benchmark。ARC Prize 明确表示,跑满它并不等于证明实现了 AGI;Provider Adapter 的结果也不是 Coding benchmark。它在本文中的方法论价值是:模型、记忆策略、工具和执行循环共同构成一个被评测的系统。

五个会破坏 benchmark 可比性的变量

比较两个数字之前,先核对下面五组字段。

1. 精确模型与访问路径

记录模型 ID 或快照、供应商、API、产品入口和日期。OpenAI 模型页列出了 gpt-6-astra,但 ChatGPT、Codex 客户端、OpenAI API、Azure 与 Bedrock 路径的开放时间、系统指令和可用能力仍可能不同。

2. Harness、上下文与工具

记录文件如何检索、哪些信息跨轮保留、何时压缩上下文、可以使用哪些工具,以及 sandbox 能否执行代码。ARC Prize 的两组 Astra 结果已经说明,“模型相同”远远不够。

3. 推理强度与推理预算

不能把 max-effort 的成绩和 medium-effort 的成绩当成成本、延迟完全相同的公平对比。OpenAI 发布表展示任一 effort 下的最高分,但真实产品路径必须选择一个具体设置。更可靠的运营对比要么固定 effort 策略,要么同时汇报质量、延迟与成本。

4. 任务版本、提示词与评分方法

Terminal-Bench 4.0 不是 Terminal-Bench 2.1。任务集、裁判、超时、重试上限或提示词一旦变化,分数就可能变化。OpenAI 对 FrontierCode 附上的 Astra developer instruction 也应与结果同时保留。

5. 安全策略、权限与成本核算

OpenAI 说明,部分能力评测没有启用生产安全策略。正式产品可能会暂停、拒绝或要求人工确认研究环境允许执行的操作。对安全敏感工作来说,这也是实际表现的一部分。

成本的分母也必须完整。GPT-6 Astra 官方模型页 给出的 Standard 价格是:每百万 token 10 美元输入、1 美元缓存输入、12.50 美元缓存写入、50 美元输出。输入超过 272,000 token 后,整次请求使用更高费率。Benchmark 的预估 API 成本取决于 token 构成、工具、动作、重试和服务层级,而不只取决于首页显示的输入单价。

把公开跑分转成自己的 Coding Agent 测试

排行榜负责产生假设,最终结论要由与你实际工作相近的任务验证。

  1. 选择 3–5 个代表性任务。 至少包括一次边界清楚的修改、一次普通多文件变更,以及一次过去容易失败的调查任务。
  2. 固定起始状态。 每次运行使用同一 commit、文件、依赖、环境、提示词和验收标准。
  3. 记录完整路径。 写清 harness 与版本、供应商、模型 ID、推理强度、权限、工具和上下文策略。
  4. 在候选模型之间重置。 不让第二个模型继承第一个模型生成的文件、笔记或发现。
  5. 验收最终产物。 运行相同的测试、类型检查、构建、范围审查和安全检查;不要把对话语气自信当成正确性。
  6. 计算整个任务。 纳入所有重试、修复轮次、缓存写入、工具费用、耗时和人工改动,直到结果真正通过验收。
  7. 重复到能看出波动。 不要用一次幸运通过或一次供应商故障设置默认模型。

更完整的如何选择 Coding Agent 模型可以把这些观察转成快速、深度与升级三条路径。核算费用时,使用 Coding Agent API 成本方法,避免低 token 单价掩盖反复失败的调用。

一条可执行的选型规则

当任务含糊、执行链很长、依赖大量工具,或出错代价高,而且确切 harness 支持任务需要的模型能力时,可以把 Astra 放进首选测试名单。现有公开证据足以支持这个试验。

但不要因为它领先一张图,就直接设成所有任务的默认值。如果更便宜的候选能以更低总成本和延迟达到同一验收门槛,就应该保留它。相邻的 GPT-6 Astra 价格、上下文与 Codex 接入指南整理了 105 万 token 上下文窗口,以及长 Agent 循环需要注意的计费边界。

Benchmark 审查的正确产物不是一个永久冠军,而是一条带证据的路由规则:什么任务从哪个模型开始、什么失败会触发升级、用什么验收命令判断成功。

开始一个 Agent.Space Session,先选择符合工作流的 Agent,再查看这条路径当前可用的模型,并用一个能客观验收的小任务做测试。

FAQ

想在自己的仓库里留下可重复的对照,可以参考 Coding Agent 回归检查方法,按真实任务准备独立起点、验收条件,并明确小样本能支持多大的结论。

对 Coding Agent 来说,哪个 GPT-6 Astra benchmark 最值得看?

没有唯一最好的一个。Terminal-Bench 关注终端任务,DeepSWE 与 FrontierCode 使用不同 Coding 合同,综合指数又会组合多个任务。先选与你的工作最接近的评测,再用自己的仓库和验收标准确认。

GPT-6 Astra 在 Coding benchmark 上超过 GPT-5.6 Sol 了吗?

OpenAI 9 月 3 日的发布表显示,Astra 在表内 Coding 评测上领先 Sol,但领先幅度从 Terminal-Bench 4.0 的明显差距,到 DeepSWE 和 Artificial Analysis Coding Agent Index 的很小差距都有。本文核验时,Artificial Analysis 的在线综合指数也更偏向 Astra,但同时测得 Sol 更快、综合价格更低。

为什么 GPT-6 Astra 在 ARC-AGI-3 上既是 62.7%,又是 99.9%?

因为两次测试使用不同 harness。Standard harness 使用供应商中立的可见笔记方式;Provider Adapter 会保留不可见推理状态,并在请求之间管理 compaction。ARC Prize 同时报告两者,是因为它们分别回答“统一接口下的可比性”和“供应商优化系统表现”两个不同问题。

更高的推理强度一定更贵吗?

不一定。更高设置可能消耗更多推理预算,但也可能用更少动作或重试完成任务。ARC Prize 就观察到 Astra max 比某些较低 effort 的 Standard-harness 运行更便宜。应衡量通过验收的整项任务成本,而不是预设一条单调关系。

排行榜能证明 Astra 在 Agent.Space 中一定更好吗?

不能。如果所选路径已经提供这个模型,排行榜可以支持你测试它;但 Agent.Space 的实时可用性、harness 行为、任务上下文、权限和验收标准仍会决定最终结果。本文没有提供 Agent.Space 实测数据。