套餐还是那个套餐,能连续干活的时间却短了。这是最近不少 Astra 用量讨论里,最让人关心的体验。
要查清楚,需要同时看两件事:账户给了多少额度,完成一个任务又要消耗多少。前者减少,或者后者增加,都会让一天能完成的工作变少。
一份 9 月 10 日的用户报告提到,作者在两个 Pro 20x 账户上的估算中,每周 API 等价价值从 Sol 时期约 2,500 美元降到了 Astra 的约 1,200 美元。这是一位用户在特定任务和假设下的测量,不是官方承诺的额度表,也没有经过我们的独立复现。
它提供了值得追查的线索。要推广到每一个订阅者,还需要更多证据。
先分清楚,哪一层发生了变化
OpenAI 的 Codex 定价文档说明,用量受任务规模、复杂度、模型和执行上下文影响,也存在共享额度与不同模型的 Credit 费率;目前 Astra Fast 的 Credit 消耗是 Standard 的 2.5 倍。这些费率不等于每个 Plus 或 Pro 账户都有固定的 API 美元余额。自己的限制,应查看当前用量面板或 CLI 的 /status。
因此,拿一张公开费率表乘上额度百分比,直接算成“平台每个月保证给我的钱”,中间缺了关键依据。
算输入成本时,别把同一批 Token 算两遍
做 API 等价估算,先确认日志字段的含义。有些记录里的输入总量已经包含缓存命中,再把缓存 Token 额外加一遍,就重复计数了。
截至 9 月 15 日,Astra API 模型页列出的 Standard 费率,在未达到长上下文加价门槛时,每百万 Token 分别是:普通输入 10 美元、缓存读取 1 美元、缓存写入 12.50 美元、输出 50 美元。输入超过 272,000 Token 的请求另有倍率。API 美元价格和 Codex 订阅 Credit 费率需要分别看。
官方缓存文档还说明,缓存写入采用独立的输入计费类别,不是在普通输入价格上再叠加一次写入价格。当前 GPT-5.6 及之后模型的缓存控制,也与更早模型有所不同。旧模型的保留时长和配置经验,不能不核对就套到新账单上。
当你已经拿到互不重叠的各类数量,可以这样估算:
输出以供应方的计费总量为准。如果其中已经包含推理 Token,就不要再加一遍。日志没有区分缓存写入时,应注明估算不完整,而不是悄悄把这部分按便宜的命中价格计算。
同样长度的请求,可以算出三种账单
下面只是演算示例,不是实测 Codex 会话。每一行都有 100,000 个输入 Token、2,000 个输出 Token,使用上述 Standard API 价格,不涉及长上下文倍率或额外工具费。
三次回答的可见长度可以完全相同,输入账单却有明显差异。缓存写入还可能让后续调用享受到较低的读取价格,所以应当连着相关调用一起看,不能见到写入费就认定浪费了钱。
这个例子也不能直接换算成你的 Codex 额度会掉几个百分点。要做那一步,还得知道对应的订阅计费方式。
掉了 1% 的额度,未必是一把足够精确的尺子
假设用量表只显示整数百分比。两个经过取整的读数相减,差值可能接近一个百分点的误差。显示掉了 5 个百分点,实际可能大约是 4 到 6 个百分点,具体取决于取整与刷新方式。相对于这次 5 个百分点的样本,仅显示精度就可能带来约 20% 的不确定性。
如果只看掉了 1 个百分点,波动会更明显。刷新延迟、测试中途额度重置、另一个会话同时用掉共享额度,都可能盖过你真正想测的差异。
这不代表观察额度没有价值。报告里要保留起止时间、原始读数、额度周期和显示精度,避免拿一小段测量外推整个月,再给出精确到美元的结论。订阅 Token 价值分析也解释了另一个前提:所谓理论 API 价值,通常还假设你真的用完了套餐。
用一小组真实任务,测出自己的变化
选择平时确实会做的工作,例如一个范围明确的 Bug 修复、一处小型 UI 修改、一项答案可核对的代码调查。每次尝试都从干净的相同基线开始,保留相同要求与验收条件。
开始前,记下账户、额度周期、客户端版本、harness、模型、推理强度、速度模式及适用费率。不要一边用空白新会话,另一边用已经塞满资料的长会话。测试期间尽量避免其他任务使用同一份共享额度;无法隔离,就把这个限制记下来。
每次保留四类信息:
- 起止额度读数及时间;
- 服务实际暴露的 Token 分类;
- 为完成这项任务发生的失败与重试;
- 最后是否通过验收,以及人工修补了多久。
先定一个小预算,收集到计划中的样本就停。中途发生重置,要把前后分成两段,不能跨着重置点直接做减法。
真正昂贵的,可能是一直没做完的任务
再看一个假设例子:配置 A 每次尝试花 1 美元,第三次才完成;配置 B 一次花 2 美元,首次就通过验收。这个任务上,A 共花 3 美元,B 花 2 美元,还没算人的检查时间。
一个例子不足以判断平均能力,但它说明了为什么分母要选对:
如果一个都没通过,就记录“花了多少、合格结果为零”,这个比值没有有限值。人工修补时间可以单独列一栏,除非你已经明确规定了如何折算人力成本。
质量问题也会在这里变成额度问题。重复读仓库、反复改错补丁、纠正被误解的要求,每一轮都增加工作量。如果重复来自不合适的旧规则,可以检查 AGENTS.md 和 Skills。但清理指令不能解释账户额度的所有变化。
根据查到的原因,再决定换什么
如果主要变化来自费率或速度模式,可以拿一个小任务试试更合适的配置。如果缓存构成变了,先看实际分类,再决定是否调整流程。如果花费差不多,合格产出却明显减少,应当调查任务质量,继续压缩失败任务的 Token 数帮助有限。
在 Agent.Space 尝试替代配置时,可以保留项目文件与验收说明,为当前 harness 选择兼容模型,同时记下新配置自己的计费条件。原来 Codex 订阅里的额度,不会自动变成另一个服务里的余额。
买哪种工具,最终要回答的是:按自己的工作方式,这份预算能完成多少个验收合格的任务。理论 Token 再多,也要落到你真正能用的结果上。
费率与文档核对日期为 2026 年 9 月 15 日。文中两组数字均为演算示例;用户报告中的账户测量未经 Agent.Space 独立验证。
