复杂、开放式的高价值任务优先测试 GPT-5.6 Sol;日常开发优先从 Terra 开始;边界清晰、重复且量大的任务优先测试 Luna。 这是 OpenAI 当前 Codex 模型说明里最实用的起点。
它不是永久排名。Codex 的实际效果还取决于任务难度、推理档位、Agent 需要执行多少轮,以及用量最终记在 ChatGPT 还是 API 账户。一个规则明确的批量转换任务可能更需要速度和低成本;一次含糊的系统迁移则可能值得使用更强的模型,以减少错误修改和返工。
本文对比 GPT-5.6 Sol、Terra 与 Luna,说明已经发生的 8 月 31 日 GPT-5.4 迁移,并给出改变真实工作流前的小规模测试方法。如果你还分不清产品层级,可以先看模型与 Agent harness 的区别。
最后核验:2026-09-07。 模型可用性、别名、价格、推理控制和 Codex 入口都可能变化。OpenAI 当前模型页仍把 Sol、Terra、Luna 与 GPT-6 Astra 并列,并未说明 Astra 已整体替代 GPT-5.6 家族。
GPT-5.6 Sol、Terra、Luna 快速对比
它们都属于 GPT-5.6 家族,但 OpenAI 为三个模型分配了不同的任务角色。
*价格来自 2026 年 9 月 7 日核验的三个官方 API 模型页,只适用于 API 计费,不能直接换算成 ChatGPT 套餐用量或 Codex Credits。OpenAI 将 Sol 当前价格标为至少持续到 2026 年 11 月 21 日的促销价。三个页面都列出 105 万 token 上下文窗口和 128,000 token 最大输出,但窗口容量本身不能证明模型能多好地理解某个仓库。
这张表的作用是缩小第一轮测试范围,不是替你完成最终选择。如果 Luna 需要多轮纠错,它的实际工作成本可能高于一次通过的 Terra。反过来,如果任务规则明确、验证又便宜,使用 Sol 也可能只是增加等待和消耗。
最难、最不明确的工作从 GPT-5.6 Sol 开始
OpenAI 把 GPT-5.6 Sol 定位为复杂专业工作的旗舰模型。在 Codex 指南中,典型场景包括复杂代码变更、深度研究、computer use,以及需要更多判断或打磨的工作。
出现以下特征时,可以优先把 Sol 放进测试:
- 开始时并不知道正确方案是什么;
- Agent 必须跨多个系统或仓库模块调查;
- 错误的架构决定会带来高昂返工;
- 最终结果需要细致推理、Review 或表达;
- 你能说清目标,但不适合把每一步都预先写死。
“任务很大”不等于一定要用 Sol。全仓库重命名可能改很多文件,却只是机械工作;五行鉴权代码可能 diff 很小,风险却很高。应该看的是含糊程度和失败代价,而不是文件数量。
更高的推理档位可能改善困难任务,但也会增加等待和 token 使用。先用默认档位加明确验收标准;只有模型在证据和工具都齐全时仍因分析深度不足而失败,再提高推理档位。缺工具或被权限拦住,不是加大推理就能解决的问题。
日常 Codex 工作优先测试 GPT-5.6 Terra
GPT-5.6 Terra 是 OpenAI 的平衡档。当前 Codex 说明把它描述为日常工作主力:需要较强推理和工具能力,但没有必要支付 Sol 全部深度时,可以从 Terra 开始。
典型任务包括:
- 按清楚验收标准实现一个功能;
- 排查可以稳定复现的故障;
- 按仓库规则 Review 一个 PR;
- 随代码同步更新测试与文档;
- 执行工具和成功条件都已知的多步骤流程。
这里的关键词是“默认起点”,不是“赢家”。Terra 提供了方便上下调整的中间位置。如果它能稳定完成任务,Sol 可能只会增加成本和时间;如果 Terra 在拥有正确证据和工具后仍反复漏掉架构影响,再把模型作为唯一变量切到 Sol 测试。
团队也可以据此建立更容易审计的路由规则:普通工作默认 Terra;明确记录哪些条件允许升级 Sol;只有任务合同足够窄时才使用 Luna。这比每次凭感觉选择最贵或最快的模型更可控。
规则清楚、可重复的工作测试 GPT-5.6 Luna
GPT-5.6 Luna 是 GPT-5.6 中 API 标价最低的一档,面向成本敏感和高批量工作。OpenAI 给出的代表任务包括抽取、分类、转换和结构化总结。
在编程工作流中,可以对应为:
- 把文件转换成既定格式;
- 按固定分类体系整理 Issue 或测试失败;
- 执行能用测试或 linter 验证的重复修改;
- 按固定 schema 总结一个边界明确的 diff;
- 依据已经批准的模板生成常规产物。
不能把“可重复”误解成“无需 Review”。API 单价低不会让高风险迁移自动变低风险,也无法弥补模糊 prompt、缺失上下文或无限重试的 Agent 循环。
适合 Luna 的工作通常有四个条件:输入范围窄、输出合同明确、工具集合有限、验收可以自动化。缺少任何一个,都应先修工作流,再判断模型是否不够用。
API 模型价格不等于 ChatGPT 里的 Codex 用量
上表数字来自 OpenAI API 模型页。只有当 Codex 使用 API Key 登录,并由相应 API 组织承担账单时,它们才是直接相关的价格。
这些数字不能告诉你一次任务会消耗多少 ChatGPT 套餐额度或 Codex Credits。OpenAI 可以采用产品侧用量规则,一次编程任务也可能包含多轮模型调用、工具、上下文读取和重试。
要把两条路径分开:
- ChatGPT 登录: 遵循当前 ChatGPT 套餐、Workspace 规则、符合条件的 Credits 和 Codex 产品控制。
- API Key 登录: 按当前 API 模型价格和政策,把用量记到 API 组织或项目。
如果你正在选这两种登录方式,可以看不订阅 ChatGPT 能否使用 Codex。更完整的账单区别可参考 Codex 价格指南,其中把套餐额度、Credits、API 用量和组织计费分开说明。
更有意义的内部指标是每个通过验收任务的成本。要把所有模型轮次、重试、失败运行、工具调用和人工 Review 时间都算进去。最低 token 单价只有在结果仍能通过同一验收标准时才真正有价值。
GPT-5.4 在 Codex 停用意味着什么
OpenAI 当前的 Codex 模型指南 写明:使用 ChatGPT 登录的 Codex 已在 2026 年 8 月 31 日停用 GPT-5.4 和 GPT-5.4 Mini。
官方给出的替换关系是:
gpt-5.4改为gpt-5.6-terra;gpt-5.4-mini改为gpt-5.6-luna。
这可能影响仍显式写入旧模型的配置、custom agents、scheduled tasks、组织默认值和命令。OpenAI 同时说明,这次“ChatGPT 登录的 Codex 停用”不影响 API,以及使用自有 API Key 登录的 Codex。
建议按以下顺序迁移:
- 在配置和自动化中搜索已经停用的精确模型 ID。
- 按含糊程度、风险和验证成本给工作分类。
- 从官方建议的 Terra 或 Luna 替代项开始。
- 如果保留了有效的旧结果基线,可以用相同代表任务对比替代项;不要为了重做测试继续保留已停用的生产设置。
- 比较通过验收的输出、延迟、重试和用量,而不只看两边是否都“跑完”。
- 更新保存的配置,并记录为什么选择这一档。
不要把所有 GPT-5.4 任务一律升级成 Sol。官方映射到 Terra 和 Luna,正说明模型代际与档位不是简单的数字越大、级别完全相同。
Codex 里哪些地方可以选模型?
在本地交互式 Codex CLI 中,官方文档使用 /model 打开会话内选择器。启动时也可以使用 --model 或 -m 指定模型,非交互的 codex exec 同样支持。
ChatGPT 桌面端、本地 Codex CLI 和 IDE 插件共用 config.toml 设置本地默认模型。如果没有明确配置,OpenAI 会使用推荐模型。根据当前官方说明,不带后缀的 gpt-5.6 别名会路由到 Sol。
Codex Cloud 是重要例外:OpenAI 当前写明,用户不能自行更改 Cloud chats 的默认模型。不要因为某个模型在 API 可用,或写进 CLI 的 model 配置,就推断 Codex Cloud 也能选择它。
实际可用性还会受到套餐、登录方式、Workspace policy 和产品入口影响。最终以当前选择器和 feature availability 页面为准。
用一个真实任务测试 GPT-5.6 模型
为每个候选模型使用相同的仓库起点、prompt、权限、工具和验证命令。第一轮只更换模型;确有必要时,第二轮再调整推理档位。
至少记录:
- 验收结果: 是否通过相同测试和人工 Review 标准?
- 调查质量: 修改前是否找到相关文件和限制?
- 工具可靠性: 参数是否合法,调用是否必要,遇到错误能否恢复?
- 延迟: 多久出现第一个有效动作,多久得到可接受结果?
- 用量: 完整运行包含多少轮、多少重试和多少 tokens?
- Review 负担: 人需要花多少时间纠错或补充解释?
然后按证据调整:
- Terra 在需要更深判断时确实提高合格率,再升级 Sol。
- 任务可重复且 Luna 能稳定通过同一检查,再从 Terra 下调 Luna。
- Terra 已达到质量要求,且两端没有明显收益,就保持 Terra。
这是一套持续路由规则,不是一次性 Benchmark。模型、价格、prompt、工具或仓库变化后,都需要重新检查。
这对 Agent.Space 意味着什么
Agent.Space 把 Agent harness 和兼容模型作为两层选择,但这不代表任意模型都能与任意 Agent 组合。某个精确组合是否可用,仍以当前生产选择器为准。
本文准备时不声称 Agent.Space 已经提供全部 GPT-5.6 版本。如果你在产品中看到一个可选组合,可以用上面的边界任务和验收标准测试。托管 Workspace 可以改变文件、Session 和进程放在哪里,但不会把上游 ChatGPT 套餐转成 API 余额,也不会替换上游计费规则。
结论
Codex 的复杂开放式任务先测 Sol,日常开发先测 Terra,规则明确的高批量任务先测 Luna。最终比较的是通过验收的结果,不是 API 单价本身,更不能把 API 价格直接套到 ChatGPT 套餐或 Credits 上。
如果某个保存的工作流在 8 月 31 日之后仍写着 GPT-5.4,现在就应检查显式模型设置,先按 OpenAI 的 Terra / Luna 映射做小范围验证,再改全局配置。
GPT-6 Astra 是新增的独立旗舰选择,不是抛弃这套三档路由的理由。如果真正的问题是困难的 Sol 任务是否值得支付 Astra 的更高价格,可以继续看 GPT-6 Astra 与 GPT-5.6 Sol 的专项对比。
如果模型只是更大产品决策的一部分,Codex 与 Claude Code 对比会把 harness、工作流和计费差异分开说明。
FAQ
如果回答不像自己选中的模型,可以按模型路由核验指南检查界面选择、发出的请求与供应方响应。模型在聊天里的自我介绍,不能证明后台身份。
Codex 最适合用哪个 GPT-5.6 模型?
没有通用最佳答案。OpenAI 把 Sol 定位于最复杂的开放式工作,Terra 定位于平衡的日常工作,Luna 定位于明确、重复且成本敏感的任务。应从能稳定通过真实验收标准的最低档位开始。
GPT-5.6 Luna 比 Terra 和 Sol 便宜吗?
按 2026 年 9 月 7 日核验的 API token 标价,Luna 更低。但这不能保证每个完成任务的总成本最低,也不代表 ChatGPT 套餐或 Codex Credits 的消耗规则。
gpt-5.6 别名会选哪个模型?
OpenAI 当前说明不带后缀的 gpt-5.6 会路由到 GPT-5.6 Sol。别名可能变化;需要可复现时应固定精确模型,并关注停用通知。
Codex Cloud 可以手动选择 Luna 或 Terra 吗?
OpenAI 当前写明,用户不能更改 Codex Cloud chats 的默认模型。本地 Codex 入口提供模型选择,但仍受套餐、政策和登录方式限制。
Codex 里谁替代 GPT-5.4?
针对 2026 年 8 月 31 日“使用 ChatGPT 登录的 Codex”停用,OpenAI 建议用 GPT-5.6 Terra 替代 GPT-5.4,用 GPT-5.6 Luna 替代 GPT-5.4 Mini。API 与 API Key 登录的 Codex 另行处理。
