计算 Coding Agent API 成本时,需要把一个完整任务里每次模型调用的已计费成本相加。每次 Call 分别统计未缓存输入、Cache Write、Cache Read、输出和工具专项费用,再计入规划、实现、测试、Review、重试,以及真正产生了计费用量的 Fallback Call。
本文是一份可以复算的计算指南,不是可以直接输入数字的互动计算器。不存在一个诚实、通用的“单个编程任务平均成本”:代码仓库大小、上下文策略、模型、Reasoning、工具、Cache 和重试都会改变结果。
信息核验日期:2026 年 9 月 7 日。 Usage 字段、Service Tier、模型价格和工具费都可能变化。每次计算都应使用当天有效的供应商 Usage Schema 与价格页。
使用五个互不重叠的成本 Bucket
对第 i 次 API Call,定义:
U_i:未缓存输入 Token;W_i:单独计费时的 Cache Write 或 Cache Creation Token;C_i:Cache Read Token;O_i:已计费输出 Token,包括 Output 中报告的已计费 Reasoning;F_i:工具或其他按量功能的非 Token 费用。
R_U、R_W、R_C、R_O 是每一百万 Token 的有效价格;只有实际适用的 Service Tier、Batch、Data Residency 或合同修正才计入。
如果供应商不报告或不收取某个类别,就把对应 Bucket 与 Rate 设为零。同一批 Token 绝不能进入两个 Bucket。
OpenAI 的 API 价格与 Responses Usage Schema定义了当前字段与费率证据。Anthropic 则在价格文档中说明 Input、Cache Creation / Read、Output 和受支持工具费用。字段名相似,不代表包含关系相同。
相乘之前,先把 Provider 记录归一化
对每次 Call:
- 记录 Provider、Endpoint、Model ID、Service Tier、Currency 和 Pricing Date;
- 阅读该 Endpoint 的官方 Usage Field 定义;
- 检查 Total Input 是否已经包含 Cached Input;
- 让每个已计费 Token 只进入
U、W、C或O中的一个; - 只有当天 Price Sheet 明确收费时,才加入 Hosted Search、Code Execution、Computer Use 或其他工具费;
- 用供应商或平台的权威 Usage View 对账。
如果请求经过 Agent.Space,Developer API 指南解释了模型发现与 Request history 在流程中的作用。Request history 可以证明一次 Call,但不能替代当前价格合同。
一个可复算的假设示例
下面所有数字都只是为了演示。它们不是 Agent.Space、OpenAI、Anthropic 或其他供应商当前的真实价格。
如果想看一个当前真实、且存在特殊阈值的例子,GPT-6 Astra 价格指南会演示输入超过 272K token 后,为什么整次请求都要切换费率。应把这种 Provider 专属规则单独放进费率表,而不是藏进一个平均输入单价里。
这个例子说明,肉眼看到的最终答案长度不能代表成本。重复发送的仓库上下文可能占据大量 Input,Reasoning 与最终响应也可能让 Output 成为主要费用。只有真实 Usage Record 能说明构成。
计算完整的已验收任务,而不是一条 Response
一个 Coding Agent 任务可能包含检查仓库、规划、编辑、测试、修复、Review 和最终总结。如果重试、Fallback Model、Reviewer 或 Validator 又产生计费 Call,应把它归到同一个 Task Ledger。
比较前先定义“通过验收”。一次便宜但测试失败、或需要人工全部重写的运行,与一次被接受的改动不是同一个结果。至少记录:
- Task ID、Run ID 与 Call ID;
- Provider 与 Model;
- 归一化后的 Usage Bucket 与工具费;
- 成功、失败或取消;
- 自动测试与人工验收结果;
- 重试与人工介入次数。
建立一张可审计的 Worksheet
每次 API Call 占一行:
计算 call_cost 后按 task_id 汇总,并且只比较验收条件一致的任务 Cohort。原始 Provider Response 应单独保留,以便以后审计归一化过程。
选择模型前,可以先用编程模型价格指南按能力筛选,再比较费率。如果低价模型需要更多 Call、更多上下文或更多修复,它的已验收任务成本不一定更低。
建立单任务计量方法后,可以用 2026 年 AI Coding Agent 价格对比,把这张 Worksheet 对应到订阅、包含额度、超额用量与团队计费结构。
用情景比较代替捏造平均值
使用自己的 Pilot Data 建立三种情景:
- 低用量: 小型仓库、高 Cache Reuse、一次运行通过;
- 预期: 一组有代表性的已验收任务用量中位数;
- 高用量: 大上下文、低 Cache Reuse、一次修复循环与真实工具费。
每次只改变一个假设,就能看出成本主要受模型费率、上下文、Cache Hit Rate、输出、重试还是工具影响。
避免这些计算错误
- 把 Cached Token 计算两次;
- 忽略 Cache Creation 或 Output 中的已计费 Reasoning;
- 把一条 Response 当成完整 Agent Loop;
- 漏掉 Retry 与 Fallback Call;
- 没有 Model、Date、Tier 与 Currency 就写死费率;
- 比较验收标准不同的运行;
- 把估算当成发票。
当 Bucket 足够干净时,计算本身很简单:归一化每次 Call、应用当前费率,再加总完整的已验收任务。
用结果比较 Agent.Space 当前套餐与模型价格;资金路径符合工作负载后,可以注册 Agent.Space 账户并开始使用。
