Agent.Space 博客

Coding Agent API 成本怎么算?一套可复算的计算指南

用未缓存输入、Cache、输出、工具费、重试和完整任务调用记录,计算 Coding Agent API 的真实任务成本。

计算 Coding Agent API 成本时,需要把一个完整任务里每次模型调用的已计费成本相加。每次 Call 分别统计未缓存输入、Cache Write、Cache Read、输出和工具专项费用,再计入规划、实现、测试、Review、重试,以及真正产生了计费用量的 Fallback Call。

本文是一份可以复算的计算指南,不是可以直接输入数字的互动计算器。不存在一个诚实、通用的“单个编程任务平均成本”:代码仓库大小、上下文策略、模型、Reasoning、工具、Cache 和重试都会改变结果。

信息核验日期:2026 年 9 月 7 日。 Usage 字段、Service Tier、模型价格和工具费都可能变化。每次计算都应使用当天有效的供应商 Usage Schema 与价格页。

使用五个互不重叠的成本 Bucket

对第 i 次 API Call,定义:

  • U_i:未缓存输入 Token;
  • W_i:单独计费时的 Cache Write 或 Cache Creation Token;
  • C_i:Cache Read Token;
  • O_i:已计费输出 Token,包括 Output 中报告的已计费 Reasoning;
  • F_i:工具或其他按量功能的非 Token 费用。

R_UR_WR_CR_O 是每一百万 Token 的有效价格;只有实际适用的 Service Tier、Batch、Data Residency 或合同修正才计入。

text
call_cost_i =  (U_i / 1,000,000 × R_U)  + (W_i / 1,000,000 × R_W)  + (C_i / 1,000,000 × R_C)  + (O_i / 1,000,000 × R_O)  + F_i
task_cost = 任务中每一次 call_cost_i 的总和

如果供应商不报告或不收取某个类别,就把对应 Bucket 与 Rate 设为零。同一批 Token 绝不能进入两个 Bucket。

OpenAI 的 API 价格Responses Usage Schema定义了当前字段与费率证据。Anthropic 则在价格文档中说明 Input、Cache Creation / Read、Output 和受支持工具费用。字段名相似,不代表包含关系相同。

相乘之前,先把 Provider 记录归一化

对每次 Call:

  1. 记录 Provider、Endpoint、Model ID、Service Tier、Currency 和 Pricing Date;
  2. 阅读该 Endpoint 的官方 Usage Field 定义;
  3. 检查 Total Input 是否已经包含 Cached Input;
  4. 让每个已计费 Token 只进入 UWCO 中的一个;
  5. 只有当天 Price Sheet 明确收费时,才加入 Hosted Search、Code Execution、Computer Use 或其他工具费;
  6. 用供应商或平台的权威 Usage View 对账。

如果请求经过 Agent.Space,Developer API 指南解释了模型发现与 Request history 在流程中的作用。Request history 可以证明一次 Call,但不能替代当前价格合同。

一个可复算的假设示例

下面所有数字都只是为了演示。它们不是 Agent.Space、OpenAI、Anthropic 或其他供应商当前的真实价格。

类别用量假设价格成本
未缓存输入180,000 Token$2.00 / 1M$0.360
Cache Write0 Token$0.00 / 1M$0.000
Cache Read720,000 Token$0.20 / 1M$0.144
输出90,000 Token$10.00 / 1M$0.900
工具专项费用$0.060
总计$1.464
text
(180,000 / 1,000,000 × 2.00)+ (720,000 / 1,000,000 × 0.20)+ (90,000 / 1,000,000 × 10.00)+ 0.060= 1.464

如果想看一个当前真实、且存在特殊阈值的例子,GPT-6 Astra 价格指南会演示输入超过 272K token 后,为什么整次请求都要切换费率。应把这种 Provider 专属规则单独放进费率表,而不是藏进一个平均输入单价里。

这个例子说明,肉眼看到的最终答案长度不能代表成本。重复发送的仓库上下文可能占据大量 Input,Reasoning 与最终响应也可能让 Output 成为主要费用。只有真实 Usage Record 能说明构成。

计算完整的已验收任务,而不是一条 Response

一个 Coding Agent 任务可能包含检查仓库、规划、编辑、测试、修复、Review 和最终总结。如果重试、Fallback Model、Reviewer 或 Validator 又产生计费 Call,应把它归到同一个 Task Ledger。

比较前先定义“通过验收”。一次便宜但测试失败、或需要人工全部重写的运行,与一次被接受的改动不是同一个结果。至少记录:

  • Task ID、Run ID 与 Call ID;
  • Provider 与 Model;
  • 归一化后的 Usage Bucket 与工具费;
  • 成功、失败或取消;
  • 自动测试与人工验收结果;
  • 重试与人工介入次数。

建立一张可审计的 Worksheet

每次 API Call 占一行:

text
task_id,run_id,call_id,provider,model,pricing_date,uncached_input,cache_write,cache_read,output,tool_fees,call_cost,status,accepted

计算 call_cost 后按 task_id 汇总,并且只比较验收条件一致的任务 Cohort。原始 Provider Response 应单独保留,以便以后审计归一化过程。

选择模型前,可以先用编程模型价格指南按能力筛选,再比较费率。如果低价模型需要更多 Call、更多上下文或更多修复,它的已验收任务成本不一定更低。

建立单任务计量方法后,可以用 2026 年 AI Coding Agent 价格对比,把这张 Worksheet 对应到订阅、包含额度、超额用量与团队计费结构。

用情景比较代替捏造平均值

使用自己的 Pilot Data 建立三种情景:

  • 低用量: 小型仓库、高 Cache Reuse、一次运行通过;
  • 预期: 一组有代表性的已验收任务用量中位数;
  • 高用量: 大上下文、低 Cache Reuse、一次修复循环与真实工具费。

每次只改变一个假设,就能看出成本主要受模型费率、上下文、Cache Hit Rate、输出、重试还是工具影响。

避免这些计算错误

  • 把 Cached Token 计算两次;
  • 忽略 Cache Creation 或 Output 中的已计费 Reasoning;
  • 把一条 Response 当成完整 Agent Loop;
  • 漏掉 Retry 与 Fallback Call;
  • 没有 Model、Date、Tier 与 Currency 就写死费率;
  • 比较验收标准不同的运行;
  • 把估算当成发票。

当 Bucket 足够干净时,计算本身很简单:归一化每次 Call、应用当前费率,再加总完整的已验收任务。

用结果比较 Agent.Space 当前套餐与模型价格;资金路径符合工作负载后,可以注册 Agent.Space 账户并开始使用。