Claude Managed Agents 有两个官方计费维度:模型 Token,以及会话真正处于 running 状态的时间;单独定价的服务端工具还可能产生附加费用。截至 2026 年 8 月 31 日,Anthropic 公布的 session runtime 价格是每个运行会话小时 0.08 美元。Token 价格取决于所选 Claude 模型;web search 等工具还可能在其内容消耗的 Token 之外,增加按次计费。
不要把这张账单和 Claude Code 订阅价格混在一起。Claude Managed Agents 是在托管基础设施上运行 Agent 的 API 平台;Claude Code Pro 或 Max 访问是另一项产品决策。如果你真正要解决的是后者,请查看 Claude Code 价格对比。
价格和产品合同都可能变化。下文数据已在 2026 年 8 月 31 日根据 Anthropic 官方价格文档核验;正式做预算前,仍应检查最新 Claude 价格页面。
先看结论和成本公式
单个 Managed Agents session 可以按下面的结构计算:
内部预算还应该保留第四行,用来记录 Anthropic 账单之外的费用,例如自己的数据库、对象存储、可观测性服务、自定义 MCP Server 或其他供应商 API。这些确实是工作负载成本,但如果把它们全塞进“Claude Token 成本”,后续就很难判断该优化哪里。
这些账单组成分别受不同因素影响:
总价并不是给每个 Session 都简单加上“一小时运行费”。Runtime 按毫秒计量,而且只有一个 Session 状态会累计这项费用。
核心计费维度一:模型 Token
Managed Agents Session 消耗的所有 Token 都按所选模型的当前价格计费。Prompt caching 的价格倍率也与 Claude Platform 其他模型请求相同。
一份有用的 Token 账本至少要分开记录:
- 未缓存的输入 Token;
- 缓存写入 Token,以及使用的缓存有效期;
- 缓存读取 Token;
- 输出 Token;
- 进入上下文的工具定义、工具调用和工具结果。
这样拆分很重要,因为启用缓存后,“输入 Token”不再只有一个实际价格。反复出现的稳定指令或仓库上下文可能通过缓存读取降低成本;频繁变化的上下文则可能持续产生缓存写入。
不要默认 Batch API 折扣适用。Anthropic 的 Managed Agents 价格说明明确表示它不适用:Session 是有状态、交互式的,而且 Managed Agents 没有 batch mode。如果任务确实异步、互相独立且不在意延迟,应把 Messages Batch API 当作另一种架构比较,而不是在 Managed Agents 预算里加一个不存在的折扣。
其他模型倍率仍可能生效。官方页面说明,当 Agent 的模型速度设为 fast 时会应用 fast mode 溢价;只在美国推理也会应用文档规定的数据驻留倍率。这些设置应该能在 Agent 版本或部署配置里查到,不能只在账单里表现为一笔来历不明的差额。
核心计费维度二:运行中的 Session 时间
Anthropic 目前列出的 Managed Agents runtime 价格是每个运行会话小时 0.08 美元,并按毫秒计量。只有 Session 状态为 running 时才会累计费用。
根据官方合同,以下状态不累计 Managed Agents runtime:
idle,包括等待用户下一条消息或等待工具确认的时间;rescheduling;terminated。
这会带来两个实际结论。
第一,一个 Session 从创建到结束存在了一小时,不代表一定收一小时 runtime。预算需要的是各段 running 状态的总时长,而不是从创建到终止的墙上时间。
第二,不要在它之上再添加普通 Code Execution 的 container-hour 价格。对 Managed Agents 来说,session runtime 取代了那套容器小时计费。Anthropic 明确说明,不会在 session runtime 之外再次收取容器小时费。
这不等于所有基础设施都免费。自托管环境、外部工具服务器、数据存储、网络服务或第三方沙箱仍可能有自己的成本。这里的结论更窄:不要把 Anthropic 标准 Code Execution 容器费重复算进 Claude Managed Agents Session。
额外费用:工具
工具通过两种方式影响账单。每个进入模型上下文的工具定义、调用、结果、截图或抓取文本都可能增加 Token;部分服务端工具还有单独的用量费。
现在最清楚的对比是 web search 与 web fetch:
- Anthropic 公布的 web search价格为每 1,000 次搜索 10 美元,另加搜索内容产生的标准 Token 成本。一次搜索执行计为一次,而不是按返回结果数计费。
- Web fetch没有额外按次费用,但抓取内容一旦进入对话,仍然按 Token 计费。因此,抓取一篇很长的页面并不等于没有成本。
对自定义工具,要把三种可能的费用分开:
- 向 Claude 描述工具、返回工具结果产生的 Token;
- Anthropic 官方价格表定义的服务端工具费用;
- 工具所调用外部系统自己的费用。
这能避免常见的诊断错误。如果工具调用次数没变,但 Token 成本上涨,问题可能是结果变长,而不是单次调用价格上涨。如果 Token 量稳定但总成本上涨,应先检查所选模型、speed、数据驻留或单独计量的工具。
在生产前建立预算
可靠的预测应该从自己的代表性任务开始,而不是套用一个通用“每个 Agent 成本”基准。任务长度、工具结果大小、模型、重试方式和缓存复用都会明显改变答案。
用目标 Agent 版本运行一组受控样本,并按每个完成任务记录:
- 模型与配置版本;
- 未缓存输入、缓存写入、缓存读取与输出 Token;
running状态的总时长;- 每种服务端工具的请求次数;
- 外部工具或基础设施成本;
- 任务结果,包括失败、取消或转交人工;
- 重试与重复工作。
接下来不要只算一个平均数,而要观察分布。中位数能表示常规路径;较高分位数可以暴露超长 Session、异常大的上下文或反复工具循环,这些才是预算风险。成功与失败任务也应分开统计,避免“很便宜但没完成”的失败路径让系统看起来很高效。
做月度预测时,按任务类别乘以预计数量,再根据实际观察到的波动留余量。在还没有分布数据时,不要凭空规定一个统一百分比。证据很少的新工作流应该先设更低的消费上限、用更小的发布批次,直到长尾行为可见。
怎么降本又不破坏 Agent 效果
哪一层真正上涨,就优化哪一层。
如果 Token 成本占主导
- 使用仍能满足任务验收标准的最低成本模型。
- 让稳定指令和可复用上下文更适合缓存。
- 限制读取文件与工具结果,只保留下一个决策真正需要的内容。
- 已完成阶段用摘要承接,不要持续回放全部工作历史。
- 比较质量与总重试次数,而不是只看每百万 Token 单价。
如果 runtime 占主导
- 找出长时间
running却没有有效进展的区间。 - 给工具设置明确超时,并终止无法恢复的 Session。
- 如果工作流支持,应把等待人工的时间放进 idle 或审批状态,而不是让 Agent loop 不断轮询。
- 在不会造成状态过期风险时,通过版本化稳定环境减少重复初始化。
如果工具成本占主导
- 限制搜索深度、抓取内容和结果大小。
- 在应用层缓存安全且不易变化的外部数据。
- 设计重试策略时,先判断上次调用是否真的完成或已计费。
- 重复进行昂贵搜索前,要求它能带来明确的新信息。
只有在任务完成率和审查质量仍然可接受时,降本才算成功。一个更便宜却导致更多重试的模型,或一个缩小到遗漏关键约束的上下文,即使单价更低,也可能抬高总成本。
Managed Agents 与 Agent.Space 计费不能直接相减
Claude Managed Agents 与 Agent.Space 不是两个功能完全相同的 runtime SKU,不能只拿价格做一一对比。
Managed Agents 提供 Anthropic 运营的 Agent loop、Agent 版本、Session、沙箱执行和 Session 事件,账单包括上面所述的 Token、runtime 与适用工具费用。
Agent.Space 的产品边界不同。Share 提供固定的 OpenAI 模型容量;Flex 是其他可用模型的按量余额;所选模型决定资金来源,而且二者不会静默互相替代。Share 与 Flex 指南解释了这份产品合同。
通过 Agent.Space Developer API,受支持的客户端可以发现可用模型并使用兼容协议。这个访问层不声称复现 Anthropic Managed Agents 的 Session API、runtime、工具或定价。
比较价格前,先问一个问题:你需要 Anthropic 帮你运营 Agent runtime,还是你已经有 coding harness,主要缺模型访问和 Workspace?
- 如果你需要 Managed Agents Sessions API 及其托管执行边界,就直接按 Anthropic 的两个官方计费维度和实际适用的服务端工具费用做预算。
- 如果你本来就准备使用 Claude Code 或其他受支持的 harness,就应该单独比较模型访问与 Workspace 路径。
对第二种情况,可以根据实时模型列表和当前条款查看 Agent.Space 套餐。它是为不同任务提供的另一条路径,并不承诺与 Claude Managed Agents 在功能或计费上等价。
最实际的结论
分别维护 Token、running runtime 与付费工具三份账本,再把外部基础设施单列。不要仅仅因为同一套架构里都出现了“Claude”和“Agent”,就把 Claude Code 订阅费或普通 Code Execution 容器小时费重复加进去。每项成本都有自己的计量后,正确的优化动作和正确的产品比较都会更容易看清。
