Agent.Space 博客

GLM-5.3-Flash(Ox Alpha)发布:价格与 GLM-5.3 对比

GLM-5.3-Flash 曾以 Ox Alpha 匿名测试,并于 8 月 26 日发布。本文核对价格、Benchmark、开放权重以及它与 GLM-5.3 的差异。

2026 年 8 月 26 日发布的是 GLM-5.3-Flash,不是 GLM-5.3。 旗舰 GLM-5.3 已经在 8 月 14 日发布。Z.ai 表示,Flash 此前曾以 ox-alpha 的名称在 OpenCode 和 OpenRouter 匿名测试。这个区别很重要,因为 Flash 不是给同一个模型换了个便宜套餐,而是一个原生多模态、开放权重、成本结构明显不同的新模型。

对 Coding Agent 来说,真正值得关注的也不是某一项榜单分数。GLM-5.3-Flash 同时提供 100 万 token 上下文、图片与视频输入、Function Calling,以及远低于 GLM-5.3 的 API 标价。Z.ai 公布的多项 Coding 和工具使用 Benchmark 也比 GLM-5.2 有明显提高。

这些信息足以让它进入候选清单,却不能证明它会在每一种编程工作流里更快、更便宜或更可靠。模型仍然需要通过兼容的 Agent harness、Provider、工具实现和运行环境完成任务。如果这些层级容易混淆,可以先看模型与 Agent harness 的区别

GLM-5.3-Flash 是什么?

GLM-5.3-Flash 是 GLM-5 系列的第一个原生多模态模型。根据官方模型文档,它共有 3200 亿参数,每个 token 激活 180 亿参数,并能在 100 万 token 的上下文窗口中接收文本、图片、视频和文件。

它的 API 模型 ID 是 glm-5.3-flash。Z.ai 介绍其采用稀疏注意力与线性注意力的混合架构,目标是降低相对 GLM-5.3 的注意力计算量和 KV Cache 需求;官方还称其使用了 30 万亿 token 的多模态语料完成预训练。

与“Flash”这个名称相比,具体规格更能说明它适合什么:

能力GLM-5.3-Flash 规格
参数320B 总参数、18B 激活参数
上下文窗口1M tokens
输入文本、图片、视频和文件
最大输出最高 131,072 tokens;API 默认值为 65,536
推理始终开启;支持 lowhighmax 三档 effort
Agent 能力Function Calling、Context Caching、Structured Output、流式工具输出
权重已在官方 Hugging Face 仓库提供
许可MIT

所以,“Flash”代表它是这个系列中更强调低成本和效率的版本,不代表它是能在普通笔记本上轻松运行的小模型。320B 总参数的模型在自托管时仍然需要相当可观的基础设施。

GLM-5.3-Flash vs GLM-5.3

两者都提供长上下文,并把推理和 Coding 作为重点,但它们不是同一次部署里的两个简单档位。

对比项GLM-5.3-FlashGLM-5.3
官方发布日期2026 年 8 月 26 日2026 年 8 月 14 日
定位更低成本的原生多模态模型旗舰文本模型
输入模态文本、图片、视频、文件文本
上下文窗口1M tokens1M tokens
已公布参数量320B 总参数 / 18B 激活参数当前 GLM-5.3 页面未列出
8 月 27 日核验的开放权重状态已以 MIT 许可提供尚未核验到官方 GLM-5.3 权重仓库
API 输入标价每 1M tokens 为 $0.15每 1M tokens 为 $1.40
API 输出标价每 1M tokens 为 $0.50每 1M tokens 为 $4.40

按标价计算,Flash 的输入和输出价格都大约是旗舰版的十分之一,而且支持 GLM-5.3 不具备的视觉输入。但 GLM-5.3 仍然是 Z.ai 定位最高的文本模型,不能因此从表格直接推出“Flash 全面更强”。

更实用的判断方式是看任务。GLM-5.3 仍可作为最困难的纯文本规划或推理任务候选;GLM-5.3-Flash 更值得在高频执行、视觉 Coding,或者单次调用成本会限制迭代次数的工作流中测试。这个分工是否适用于你的代码库和 harness,仍然只能靠同条件测试确认。

GLM-5.3-Flash API 价格与当前限时优惠

本文在 2026 年 8 月 27 日核验 Z.ai 官方价格页时,看到的价格如下:

用量每 1M tokens 标价每 1M tokens 限时价
输入$0.15$0.075
缓存输入$0.03$0.015
输出$0.50$0.25

50% 限时优惠计划在 2026 年 9 月 9 日 24:00(UTC+8)结束,缓存输入存储也标注为限时免费。这两项都应按短期活动理解,不能当作模型长期不变的成本。

API 单价也只是 Coding Agent 成本的一部分。更有用的指标是一个通过验收的任务成本,其中包括:

  • 每一轮模型调用的输入和输出 token;
  • 重复上下文,以及其中真正命中缓存的比例;
  • 工具调用和 Provider 可能另收的费用;
  • 编辑失败或工具调用无效后的重试;
  • 等待延迟和人工 Review 所花的时间;
  • 在同一验收标准下真正通过的运行比例。

一个 token 很便宜的模型,如果推理输出很长、重复调用工具或需要多次纠正,总成本仍然可能很高。反过来,单次请求较贵的模型如果能用更少轮次正确完成任务,也可能更经济。应该比较完整执行循环,而不是只拿一次 Prompt 乘以宣传页单价。

GLM-5.3-Flash Benchmark 说明了什么,又没有说明什么?

官方发布文章中,Z.ai 公布了 GLM-5.3-Flash 相比 GLM-5.2 在多项 Coding 与 Agent 测试中的结果:

BenchmarkGLM-5.3-FlashGLM-5.2
Terminal-Bench 2.184.381.0
DeepSWE v1.163.446.2
NL2Repo56.348.9
Toolathlon Verified78.459.9
AutomationBench v1.0.648.826.2
Agents’ Last Exam26.320.4

这些都是厂商公布的数据,不是 Agent.Space 的实测。发布文章还显示:在 Z.ai 自建的 Code Bench 中,GLM-5.3-Flash 使用 Max 推理档位时得到 29.0,表中 Claude Opus 4.8 为 29.5。它支持的准确说法是“在 Z.ai 的测试条件下接近”,不能进一步写成 Flash 在所有代码库、harness、Provider 或任务类型中都超过 Opus。

Agent Benchmark 测到的不只是模型。Tool schema、System Prompt、超时时间、重试规则、环境配置和评分方法都可能改变结果。同一个模型在 Provider 改变量化方式、Serving 配置或参数支持后,也可能有不同表现。

因此,可以用官方分数判断它值不值得进入测试;是否值得进入生产工作流,则要靠你自己的验收标准决定。

为什么 GLM-5.3-Flash 对 Coding Agent 值得关注?

这次发布有四点与 Agent 工作流尤其相关。

1. 原生视觉输入可以扩展 Coding 循环

编程任务经常不是从代码文件开始,而是从错位的页面截图、设计参考、图表、控制台图片或一段产品录屏开始。原生图片与视频输入可以让同一个模型同时理解视觉证据和代码库。

这不会自动创造一个视觉 Agent。Harness 仍然要正确传递媒体、提供所需工具,并验证最终结果;但它减少了视觉检查与实现工作流中的一项能力缺口。

2. 100 万 token 上下文扩大了可用工作集

更大的上下文窗口可以容纳更多源码、文档、工具输出或长 Session 历史,但不能保证每一项内容都会被准确使用。把整个代码库直接塞进去也可能增加成本和噪音。

实际收益取决于上下文如何组装:harness 选择了哪些文件、如何搜索、总结了什么,以及 Compaction 后保留了哪些约束。应该把 100 万 token 当作容量,而不是“完美理解整个代码库”的证明。

3. 工具和结构化输出覆盖了 Agent 的核心合同

Function Calling、Structured Output、Context Caching 和流式工具输出,是多步骤 Agent 的基础集成能力。它们让 GLM-5.3-Flash 不只适合聊天或一次性代码补全,也具备进入 Agent 工作流的技术前提。

但兼容性始终是具体的。某个 harness 可能依赖准确的事件格式、Tool Calling 行为、推理控制或 Provider Adapter。模型“支持 Function Calling”,不等于每个 Agent 产品今天都已支持这个模型。

4. 更低价格让多轮迭代更容易成立

Coding Agent 会在搜索、编辑、测试和失败恢复过程中多次调用模型。相比一次聊天回复,较低的 token 单价在这种循环里更可能产生明显差异。

它带来的机会是更大的试验预算和更频繁的验证,而不是可以跳过测量。除了 token,还应该记录通过验收的任务成本、工具成功率和人工纠正时间。

如何使用 GLM-5.3-Flash?

目前可以从三类官方路径使用它,但每条路径的运维合同不同。

Z.ai API

API 使用模型 ID glm-5.3-flash。官方文档为默认高能力配置推荐 temperature: 1top_p: 0.95 和 Max reasoning effort;流式 Agent 集成还建议开启工具输出流。不要直接复制 GLM-5.3 或其他 Provider 的参数,应以当前模型文档为准。

GLM Coding Plan

Z.ai 已把 GLM-5.3-Flash 列入 Coding Plan,并称该模型在套餐内的可用额度是 GLM-5.3 的三倍。套餐额度与 Points 规则属于产品条款,不等同于 API token 单价;应该根据自己的调用模式比较,而不是换算成一个假设的通用单价。

开放权重

官方 Hugging Face 模型仓库以 MIT 许可提供权重,并列出 SGLang、vLLM、TokenSpeed 和 KTransformers 等部署路径。开放权重能让团队更直接控制部署与数据流,但自托管 320B 模型是一个严肃的基础设施项目。硬件、量化、吞吐、延迟、安全和持续运维都要进入成本比较。

Z.ai 还表示,GLM-5.3-Flash 发布前曾以 ox-alpha 的代号在 OpenCode 和 OpenRouter 匿名测试。这是发布历史,不代表所有当前仍使用 ox-alpha 名称的第三方路由都是官方模型。发送生产数据前,应核对当前 Model ID 和 Provider 页面。如果通过 OpenRouter 评估它,可以沿用按价格比较 OpenRouter 编程模型一文中的能力与成本检查方法。

切换 Coding Agent 工作流前应该测试什么?

选择一个边界明确的代码库任务,并让不同模型使用完全相同的起始状态。至少记录以下项目:

  1. 准确兼容性: 当前 harness 和 Provider 是否明确列出 glm-5.3-flash?视觉输入、推理控制和流式工具调用是真正完成了集成,还是基础 API 只接受相应参数?
  2. 工具调用可靠性: 模型能否选择正确工具、生成有效参数、从工具错误中恢复,并在验收通过时停止?
  3. 代码质量: 最终改动是否通过仓库的测试、Type Check、格式规则和人工 Review 标准?
  4. 延迟与输出行为: 测量第一次有效行动所需时间,以及到通过验收所需的总时间;留意过长推理或冗长输出是否改变实际成本。
  5. 上下文表现: 选择一个需要多个相关文件的任务,检查 harness 是否找到了正确证据、模型是否保留了关键约束。
  6. 通过验收的总成本: 统计全部轮次、缓存上下文、重试、失败运行和 Review 时间,而不只看最后一次成功调用。
  7. 安全边界: 核对源码与媒体会发到哪里、开放了哪些工具,以及自托管或托管 API 哪一种符合项目的数据要求。

不要一次改变多个变量。如果同时更换模型、Provider、harness、Prompt 和环境,最后的结果无法告诉你究竟是哪一层造成差异。

可以在 Agent.Space 使用 GLM-5.3-Flash 吗?

截至 2026 年 8 月 27 日,Agent.Space 已核验的生产模型目录还没有确认 GLM-5.3-Flash。公共信息中支持更广义的 GLM 系列,并不能证明这个准确版本已经兼容。

启动 Session 前,请查看当前模型选择器。如果后续出现 glm-5.3-flash,可以使用上面的同一边界任务和验收标准测试它。不能只凭 API 发布或开放权重就推断 Agent.Space 已经支持。

Agent.Space 会把 Agent harness 与兼容模型分开选择。你可以查看可用 Agent当前 Agent.Space 方案,但具体组合仍以生产模型选择器为准。

核心结论

GLM-5.3-Flash 对 Coding Agent 是一次值得关注的发布:它把原生多模态输入、100 万 token 上下文、面向 Agent 的 API 能力、开放权重和远低于 GLM-5.3 的标价组合在一起。

发布当天最可靠的结论,是它值得接受一次同条件测试,而不是它已经获胜。Z.ai 公布的 Benchmark 很有吸引力但仍是厂商数据;限时价格会变化;真正价值取决于完整 Agent 工作流里的兼容性和通过验收的任务成本。

从一个有代表性的真实任务开始,保持 harness 与环境不变,再比较最终真正能通过验收的结果。

FAQ

GLM-5.3 是在 8 月 26 日发布的吗?

不是。2026 年 8 月 26 日发布的是 GLM-5.3-Flash;旗舰 GLM-5.3 在 2026 年 8 月 14 日发布。

GLM-5.3-Flash 是开源模型吗?

Z.ai 已在官方 Hugging Face 仓库以 MIT 许可发布模型权重。“开源”可能分别指权重、训练代码、数据或完整研发过程,因此本文更准确地称它为“以 MIT 许可发布的开放权重模型”。

GLM-5.3-Flash 的上下文窗口有多大?

官方文档列出 100 万 token 上下文窗口,最大输出为 131,072 tokens;API 默认最大输出为 65,536 tokens。

GLM-5.3-Flash API 多少钱?

本文在 2026 年 8 月 27 日核验的标价为:每 100 万输入 token $0.15、每 100 万缓存输入 token $0.03、每 100 万输出 token $0.50。50% 限时优惠计划在 2026 年 9 月 9 日 24:00(UTC+8)结束。做预算前应再次查看 Z.ai 当前价格页。

GLM-5.3-Flash 比 GLM-5.3 更好吗?

不能一概而论。Flash 的标价低得多,支持视觉输入,而且已有开放权重;GLM-5.3 仍然是旗舰文本模型。真正选择取决于实际工作流中的任务质量、延迟、成本和集成表现。

ox-alpha 就是 GLM-5.3-Flash 吗?

Z.ai 称 GLM-5.3-Flash 发布前曾以 ox-alpha 在 OpenCode 和 OpenRouter 测试。这条历史信息不能验证所有当前使用该名称的第三方路由;检查可用性时应以官方 Model ID 为准。

Agent.Space 已经可以使用 GLM-5.3-Flash 了吗?

本文在 2026 年 8 月 27 日准备时,Agent.Space 已核验的生产模型目录还没有确认该模型。请查看当前模型选择器获取最新兼容组合。