Agent.Space 博客

Codex 的 GPT-5.6 Sol、Terra、Luna 怎么选?

对比 Codex 中 GPT-5.6 Sol、Terra 与 Luna 的任务定位、API 成本和可用方式,并判断哪些困难任务值得升级到 GPT-6 Astra。

复杂、开放式的高价值任务优先测试 GPT-5.6 Sol;日常开发优先从 Terra 开始;边界清晰、重复且量大的任务优先测试 Luna。 这是 OpenAI 当前 Codex 模型说明里最实用的起点。

它不是永久排名。Codex 的实际效果还取决于任务难度、推理档位、Agent 需要执行多少轮,以及用量最终记在 ChatGPT 还是 API 账户。一个规则明确的批量转换任务可能更需要速度和低成本;一次含糊的系统迁移则可能值得使用更强的模型,以减少错误修改和返工。

本文对比 GPT-5.6 Sol、Terra 与 Luna,说明已经发生的 8 月 31 日 GPT-5.4 迁移,并给出改变真实工作流前的小规模测试方法。如果你还分不清产品层级,可以先看模型与 Agent harness 的区别

最后核验:2026-09-07。 模型可用性、别名、价格、推理控制和 Codex 入口都可能变化。OpenAI 当前模型页仍把 Sol、Terra、Luna 与 GPT-6 Astra 并列,并未说明 Astra 已整体替代 GPT-5.6 家族。

GPT-5.6 Sol、Terra、Luna 快速对比

它们都属于 GPT-5.6 家族,但 OpenAI 为三个模型分配了不同的任务角色。

模型官方定位适合作为起点的任务API 每 100 万 tokens:输入 / 缓存输入 / 输出*
GPT-5.6 Sol复杂专业工作的旗舰模型含糊的架构问题、困难排错、高价值变更、精细 Review$4.00 / $0.40 / $20.00
GPT-5.6 Terra在能力与成本之间平衡日常功能开发、常规排错、代码 Review、工具型任务$2.00 / $0.20 / $12.00
GPT-5.6 Luna面向成本敏感和高批量工作抽取、分类、机械修改、结构化总结$0.20 / $0.02 / $1.20

*价格来自 2026 年 9 月 7 日核验的三个官方 API 模型页,只适用于 API 计费,不能直接换算成 ChatGPT 套餐用量或 Codex Credits。OpenAI 将 Sol 当前价格标为至少持续到 2026 年 11 月 21 日的促销价。三个页面都列出 105 万 token 上下文窗口和 128,000 token 最大输出,但窗口容量本身不能证明模型能多好地理解某个仓库。

这张表的作用是缩小第一轮测试范围,不是替你完成最终选择。如果 Luna 需要多轮纠错,它的实际工作成本可能高于一次通过的 Terra。反过来,如果任务规则明确、验证又便宜,使用 Sol 也可能只是增加等待和消耗。

最难、最不明确的工作从 GPT-5.6 Sol 开始

OpenAI 把 GPT-5.6 Sol 定位为复杂专业工作的旗舰模型。在 Codex 指南中,典型场景包括复杂代码变更、深度研究、computer use,以及需要更多判断或打磨的工作。

出现以下特征时,可以优先把 Sol 放进测试:

  • 开始时并不知道正确方案是什么;
  • Agent 必须跨多个系统或仓库模块调查;
  • 错误的架构决定会带来高昂返工;
  • 最终结果需要细致推理、Review 或表达;
  • 你能说清目标,但不适合把每一步都预先写死。

“任务很大”不等于一定要用 Sol。全仓库重命名可能改很多文件,却只是机械工作;五行鉴权代码可能 diff 很小,风险却很高。应该看的是含糊程度和失败代价,而不是文件数量。

更高的推理档位可能改善困难任务,但也会增加等待和 token 使用。先用默认档位加明确验收标准;只有模型在证据和工具都齐全时仍因分析深度不足而失败,再提高推理档位。缺工具或被权限拦住,不是加大推理就能解决的问题。

日常 Codex 工作优先测试 GPT-5.6 Terra

GPT-5.6 Terra 是 OpenAI 的平衡档。当前 Codex 说明把它描述为日常工作主力:需要较强推理和工具能力,但没有必要支付 Sol 全部深度时,可以从 Terra 开始。

典型任务包括:

  • 按清楚验收标准实现一个功能;
  • 排查可以稳定复现的故障;
  • 按仓库规则 Review 一个 PR;
  • 随代码同步更新测试与文档;
  • 执行工具和成功条件都已知的多步骤流程。

这里的关键词是“默认起点”,不是“赢家”。Terra 提供了方便上下调整的中间位置。如果它能稳定完成任务,Sol 可能只会增加成本和时间;如果 Terra 在拥有正确证据和工具后仍反复漏掉架构影响,再把模型作为唯一变量切到 Sol 测试。

团队也可以据此建立更容易审计的路由规则:普通工作默认 Terra;明确记录哪些条件允许升级 Sol;只有任务合同足够窄时才使用 Luna。这比每次凭感觉选择最贵或最快的模型更可控。

规则清楚、可重复的工作测试 GPT-5.6 Luna

GPT-5.6 Luna 是 GPT-5.6 中 API 标价最低的一档,面向成本敏感和高批量工作。OpenAI 给出的代表任务包括抽取、分类、转换和结构化总结。

在编程工作流中,可以对应为:

  • 把文件转换成既定格式;
  • 按固定分类体系整理 Issue 或测试失败;
  • 执行能用测试或 linter 验证的重复修改;
  • 按固定 schema 总结一个边界明确的 diff;
  • 依据已经批准的模板生成常规产物。

不能把“可重复”误解成“无需 Review”。API 单价低不会让高风险迁移自动变低风险,也无法弥补模糊 prompt、缺失上下文或无限重试的 Agent 循环。

适合 Luna 的工作通常有四个条件:输入范围窄、输出合同明确、工具集合有限、验收可以自动化。缺少任何一个,都应先修工作流,再判断模型是否不够用。

API 模型价格不等于 ChatGPT 里的 Codex 用量

上表数字来自 OpenAI API 模型页。只有当 Codex 使用 API Key 登录,并由相应 API 组织承担账单时,它们才是直接相关的价格。

这些数字不能告诉你一次任务会消耗多少 ChatGPT 套餐额度或 Codex Credits。OpenAI 可以采用产品侧用量规则,一次编程任务也可能包含多轮模型调用、工具、上下文读取和重试。

要把两条路径分开:

  • ChatGPT 登录: 遵循当前 ChatGPT 套餐、Workspace 规则、符合条件的 Credits 和 Codex 产品控制。
  • API Key 登录: 按当前 API 模型价格和政策,把用量记到 API 组织或项目。

如果你正在选这两种登录方式,可以看不订阅 ChatGPT 能否使用 Codex。更完整的账单区别可参考 Codex 价格指南,其中把套餐额度、Credits、API 用量和组织计费分开说明。

更有意义的内部指标是每个通过验收任务的成本。要把所有模型轮次、重试、失败运行、工具调用和人工 Review 时间都算进去。最低 token 单价只有在结果仍能通过同一验收标准时才真正有价值。

GPT-5.4 在 Codex 停用意味着什么

OpenAI 当前的 Codex 模型指南 写明:使用 ChatGPT 登录的 Codex 已在 2026 年 8 月 31 日停用 GPT-5.4 和 GPT-5.4 Mini。

官方给出的替换关系是:

  • gpt-5.4 改为 gpt-5.6-terra
  • gpt-5.4-mini 改为 gpt-5.6-luna

这可能影响仍显式写入旧模型的配置、custom agents、scheduled tasks、组织默认值和命令。OpenAI 同时说明,这次“ChatGPT 登录的 Codex 停用”不影响 API,以及使用自有 API Key 登录的 Codex。

建议按以下顺序迁移:

  1. 在配置和自动化中搜索已经停用的精确模型 ID。
  2. 按含糊程度、风险和验证成本给工作分类。
  3. 从官方建议的 Terra 或 Luna 替代项开始。
  4. 如果保留了有效的旧结果基线,可以用相同代表任务对比替代项;不要为了重做测试继续保留已停用的生产设置。
  5. 比较通过验收的输出、延迟、重试和用量,而不只看两边是否都“跑完”。
  6. 更新保存的配置,并记录为什么选择这一档。

不要把所有 GPT-5.4 任务一律升级成 Sol。官方映射到 Terra 和 Luna,正说明模型代际与档位不是简单的数字越大、级别完全相同。

Codex 里哪些地方可以选模型?

在本地交互式 Codex CLI 中,官方文档使用 /model 打开会话内选择器。启动时也可以使用 --model-m 指定模型,非交互的 codex exec 同样支持。

ChatGPT 桌面端、本地 Codex CLI 和 IDE 插件共用 config.toml 设置本地默认模型。如果没有明确配置,OpenAI 会使用推荐模型。根据当前官方说明,不带后缀的 gpt-5.6 别名会路由到 Sol。

Codex Cloud 是重要例外:OpenAI 当前写明,用户不能自行更改 Cloud chats 的默认模型。不要因为某个模型在 API 可用,或写进 CLI 的 model 配置,就推断 Codex Cloud 也能选择它。

实际可用性还会受到套餐、登录方式、Workspace policy 和产品入口影响。最终以当前选择器和 feature availability 页面为准。

用一个真实任务测试 GPT-5.6 模型

为每个候选模型使用相同的仓库起点、prompt、权限、工具和验证命令。第一轮只更换模型;确有必要时,第二轮再调整推理档位。

至少记录:

  1. 验收结果: 是否通过相同测试和人工 Review 标准?
  2. 调查质量: 修改前是否找到相关文件和限制?
  3. 工具可靠性: 参数是否合法,调用是否必要,遇到错误能否恢复?
  4. 延迟: 多久出现第一个有效动作,多久得到可接受结果?
  5. 用量: 完整运行包含多少轮、多少重试和多少 tokens?
  6. Review 负担: 人需要花多少时间纠错或补充解释?

然后按证据调整:

  • Terra 在需要更深判断时确实提高合格率,再升级 Sol。
  • 任务可重复且 Luna 能稳定通过同一检查,再从 Terra 下调 Luna。
  • Terra 已达到质量要求,且两端没有明显收益,就保持 Terra。

这是一套持续路由规则,不是一次性 Benchmark。模型、价格、prompt、工具或仓库变化后,都需要重新检查。

这对 Agent.Space 意味着什么

Agent.Space 把 Agent harness 和兼容模型作为两层选择,但这不代表任意模型都能与任意 Agent 组合。某个精确组合是否可用,仍以当前生产选择器为准。

本文准备时不声称 Agent.Space 已经提供全部 GPT-5.6 版本。如果你在产品中看到一个可选组合,可以用上面的边界任务和验收标准测试。托管 Workspace 可以改变文件、Session 和进程放在哪里,但不会把上游 ChatGPT 套餐转成 API 余额,也不会替换上游计费规则。

结论

Codex 的复杂开放式任务先测 Sol,日常开发先测 Terra,规则明确的高批量任务先测 Luna。最终比较的是通过验收的结果,不是 API 单价本身,更不能把 API 价格直接套到 ChatGPT 套餐或 Credits 上。

如果某个保存的工作流在 8 月 31 日之后仍写着 GPT-5.4,现在就应检查显式模型设置,先按 OpenAI 的 Terra / Luna 映射做小范围验证,再改全局配置。

GPT-6 Astra 是新增的独立旗舰选择,不是抛弃这套三档路由的理由。如果真正的问题是困难的 Sol 任务是否值得支付 Astra 的更高价格,可以继续看 GPT-6 Astra 与 GPT-5.6 Sol 的专项对比

如果模型只是更大产品决策的一部分,Codex 与 Claude Code 对比会把 harness、工作流和计费差异分开说明。

FAQ

如果回答不像自己选中的模型,可以按模型路由核验指南检查界面选择、发出的请求与供应方响应。模型在聊天里的自我介绍,不能证明后台身份。

Codex 最适合用哪个 GPT-5.6 模型?

没有通用最佳答案。OpenAI 把 Sol 定位于最复杂的开放式工作,Terra 定位于平衡的日常工作,Luna 定位于明确、重复且成本敏感的任务。应从能稳定通过真实验收标准的最低档位开始。

GPT-5.6 Luna 比 Terra 和 Sol 便宜吗?

按 2026 年 9 月 7 日核验的 API token 标价,Luna 更低。但这不能保证每个完成任务的总成本最低,也不代表 ChatGPT 套餐或 Codex Credits 的消耗规则。

gpt-5.6 别名会选哪个模型?

OpenAI 当前说明不带后缀的 gpt-5.6 会路由到 GPT-5.6 Sol。别名可能变化;需要可复现时应固定精确模型,并关注停用通知。

Codex Cloud 可以手动选择 Luna 或 Terra 吗?

OpenAI 当前写明,用户不能更改 Codex Cloud chats 的默认模型。本地 Codex 入口提供模型选择,但仍受套餐、政策和登录方式限制。

Codex 里谁替代 GPT-5.4?

针对 2026 年 8 月 31 日“使用 ChatGPT 登录的 Codex”停用,OpenAI 建议用 GPT-5.6 Terra 替代 GPT-5.4,用 GPT-5.6 Luna 替代 GPT-5.4 Mini。API 与 API Key 登录的 Codex 另行处理。