GLM-5.3 和 GLM-5.2 编程对比
GLM-5.3 沿用 GLM-5.2 的底模,但通过更强的后训练、新 effort 控制和一项不兼容的 thinking 迁移改变了编程选型。
GLM-5.3 和 GLM-5.2 编程对比的核心是后训练差异,而不是新底模与旧底模的比较。Z.ai 表示两个版本使用相同底模;GLM-5.3 增加了面向长程、可执行工程环境的训练,并在编程、Agent 与安全评测中报告了明显提升。
实际结论需要分情况。对于困难、长时间运行的编程任务,GLM-5.3 更值得优先评测,但它目前还不能在所有场景里直接替换 5.2。2026 年 8 月 14 日,Z.ai 已向 GLM Coding Plan 用户开放 5.3;与此同时,开发者模型页仍写着 “The GLM-5.3 API is coming soon.” OmniAKey 当前目录也只列出 glm-5.2。
核验于 2026 年 8 月 14 日。 规格、基准数值、推理参数、Coding Plan 可用性、API 状态和权重发布时间均来自 Z.ai 发布文章与开发者文档。下文 benchmark 是 Z.ai 报告的结果,不是 OmniAKey 独立复测。官方 API 价格表尚未列出 GLM-5.3,因此本文不填写猜测价格。
GLM-5.3 与 GLM-5.2 一览
| 决策点 | GLM-5.3 | GLM-5.2 |
|---|---|---|
| 底模 | 与 5.2 相同 | 两个版本共用的底模 |
| 主要变化 | 增加长程专业工作流后训练 | 较早的后训练栈与基线 |
| 上下文窗口 | 1M token | 1M token |
| 最大输出 | 128K token | 128K token |
| Thinking | 始终开启 | 可以开启或关闭 |
| Reasoning effort | low、high、max,默认 max | 已有可配置推理控制 |
| Coding Plan | 发布当天已可用 | 可用 |
| 开发者 API | 官方页面标注 coming soon | 已可用 |
| 开放权重 | 宣布约在发布两周后提供 | 走现有发布路径 |
| OmniAKey 目录 | 当前未列出 | 以 glm-5.2 提供 |
因此需要把两个问题分开:
- GLM-5.3 是否值得进入评测?值得,尤其是长程编程任务。
- 是否应该今天就切换全部生产 API 流量?不应该,必须先确认访问方式、价格、客户端支持与迁移行为。
GLM-5.2 模型页负责当前 OmniAKey 价格、请求示例和在线状态;GLM-5.2 API 价格指南负责详细成本计算;本文只回答升级决策。
GLM-5.3 到底改了什么?
Z.ai 明确表示,GLM-5.3 使用与 GLM-5.2 完全相同的底模。官方报告的提升来自扩大长程任务环境上的后训练。
这个区别很重要。新版本号不一定意味着更大的上下文、新架构或不同预训练语料。本次发布主张的是:通过更多环境、更丰富任务和更长专业工作流训练之后,模型行为变得更好。
Z.ai 描述的训练任务更像完整工程工作单元,而不是孤立编程题。模型可能需要读取代码库与文档,使用计算和存储系统,定位瓶颈,实施修改,执行实验,并在保持正确性的前提下交付结果。
需要测试的不是单个函数写得是否更漂亮,而是模型能否持续完成整条链路:
如果只是做一个短 autocomplete 测试,基本看不到 Z.ai 声称的主要差异。
官方编程 benchmark 对比
发布报告给出以下两代模型数值:
| Benchmark | GLM-5.3 | GLM-5.2 | 官方报告变化 |
|---|---|---|---|
| Terminal-Bench 2.1 | 88.2 | 81.0 | +7.2 分 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | +23.7 分 |
| DeepSWE v1.1 | 66.9 | 46.2 | +20.7 分 |
| NL2Repo | 58.0 | 48.9 | +9.1 分 |
| FrontierSWE | 78.1 | 67.5 | +10.6 分 |
| SWE-Marathon v1.1 | 42.5 | 19.4 | +23.1 分 |
| PostTrainBench | 39.8 | 31.7 | +8.1 分 |
| Agents' Last Exam CLI | 28.5 | 23.8 | +4.7 分 |
Z.ai 还表示,GLM-5.3 在私有 Z.ai Code Bench 上相对 5.2 提升 50%。发布图表中,Max effort 下 5.3 约用每任务 75K 输出 token 得到 34.5%,5.2 则约用 96K 得到 23.4%。
这些数字足以支持“5.3 值得测试”,却不能证明所有团队都会提升 50%。私有 benchmark 无法根据发布文章复现,公开 benchmark 也使用了特定 harness、超时、token 上限、采样参数和评分规则。
例如,Z.ai 的 Terminal-Bench 3.0 使用 Claude Code 2.1.207、reasoning_effort=max、400K 上下文、最多 128K 输出、最多 600 个 Agent 回合、十小时超时,并对每个任务执行三次。五分钟本地 smoke test 不是同一个实验。
安全能力也改变了部署边界
Z.ai 在后训练中加入漏洞发现数据与环境,并报告:
| 安全 benchmark | GLM-5.3 | GLM-5.2 |
|---|---|---|
| CyberGym | 84.5 | 77.2 |
| ExploitBench | 54.4 | 24.4 |
| ExploitGym,两小时预算 | 105 个任务 | 29 个任务 |
| ExploitGym,六小时预算 | 130 个任务 | 39 个任务 |
这些结果对经过授权的防御性审查有价值,同时意味着权限管理应该更严格:收窄仓库权限、隔离执行、限制网络、记录工具活动,并对敏感修改保留人工审批。
Benchmark 能力不等于授权。模型能提出可行 exploit,不代表可以对第三方系统进行测试。
API 迁移存在不兼容的 thinking 变化
GLM-5.3 支持三个推理等级:
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
可选值是 low、high、max;Z.ai 将 max 列为默认,并建议编程任务使用它。
关键迁移规则是 GLM-5.3 不再支持:
"thinking": { "type": "disabled" }
Z.ai 表示,带该设置的请求会失败。修改模型 ID 之前,应先改为:
{
"thinking": { "type": "enabled" },
"reasoning_effort": "low"
}
如果原路径关闭 thinking,先用 low 作为最接近的替代,再在真实任务上测试 high 与 max。不要同时改变模型 ID 和 effort 策略,却不测量延迟、输出量与验收通过率。
Coding Plan 可用不等于 API 可用
发布当天,GLM-5.3 有三种不同访问状态:
- **GLM Coding Plan:**Z.ai 表示已经向全部 Coding Plan 用户开放。
- **开发者 API:**官方 GLM-5.3 开发者页仍写着 API coming soon。
- **开放权重:**Z.ai 表示经过安全评测与加固后,约在发布两周后提供。
三者不能互相替代。模型能在 ZCode 或订阅计划里运行,不代表 API key 已经能请求 model: "glm-5.3";宣布即将开放权重,也不等于今天已经有生产级自托管部署。
核验时,OmniAKey 模型目录在 Z.ai 分类下只列出 glm-5.2。请求未列出的模型应当失败,而不是静默 fallback。
GLM-5.3 API 价格尚未公布
Z.ai 开发者价格页目前列出的 GLM-5.2 费率是:每百万未缓存输入 token $1.40、缓存输入 $0.26、输出 $4.40。页面尚无 GLM-5.3 一行。
不要直接沿用 5.2 费率,不要把 Coding Plan points 换算成臆测 token 单价,也不要把第三方网关价格称为 Z.ai 官方价格。这些是不同计费关系。
生产升级之前,至少等待目标 route 明确给出:
- 官方输入、缓存输入与输出费率;
- 缓存存储或写入条款;
- 目标区域的模型与 API 可用性;
- rate limit 与并发行为;
- 各 reasoning effort 的实际 token 消耗。
在此之前,GLM-5.2 仍是可以测量的 API 选项。其官方与 OmniAKey 当前成本见价格指南。
现在是否应该从 GLM-5.2 升级?
适合评测 GLM-5.3 的情况
- 任务跨越大量文件、系统或验证步骤;
- GLM-5.2 会在长工具链中丢失计划;
- 工作负载以困难调试或仓库级修改为主;
- 任务包含经过授权的安全审查;
- 可以通过官方支持的访问方式运行匹配测试。
适合暂时继续使用 GLM-5.2 的情况
- 今天就需要普遍可用、按量计费的 API;
- 现有生产行为稳定且价格已知;
- 客户端依赖
thinking.type: "disabled"; - 工作负载短、确定,而且已经可靠通过;
- 暂时无法在 5.3 上复现相同权限、工具和验收条件。
版本号不是决策依据。只有新模型在你的任务上提高了完整任务成本或可靠性,才值得升级。
如何公平测试 GLM-5.3 与 GLM-5.2
当两款模型能通过可比 route 访问后,请固定:
| 控制项 | 保持一致的内容 |
|---|---|
| 代码库 | 同一个 commit 与依赖状态 |
| Prompt | 同一目标、约束与完成定义 |
| Harness | 同一客户端版本与上下文管理策略 |
| 权限 | 同一文件、Shell、网络与审批范围 |
| 工具 | 同一工具集与外部服务 |
| 预算 | 可比的超时、回合上限与 effort 策略 |
| 验证 | 同一测试、lint、build 与人工审查标准 |
记录通过率、耗时、输入、缓存输入、输出、重试、工具失败、人工修正和最终账单。长程 Agent 结果有波动,因此不能只跑一次。
编程模型指南说明了如何按任务类型做路由,而不是宣布一个通用赢家。
最终结论
GLM-5.3 是有实质变化的编程版本,不是只换版本号。Z.ai 报告的提升覆盖范围足够广,值得优先用于困难仓库任务评测;在底模不变的前提下,这种后训练提升尤其值得观察。
但现在仍不足以把它称为 GLM-5.2 的通用生产替代。API 官方状态是 coming soon,token 价格未公布,开放权重需要等待,而且 thinking 配置需要迁移。
今天需要已知、可计量 API 时继续使用 GLM-5.2。将 GLM-5.3 放到长程编程评测队列最前面,等匹配测试与真实 API 经济性都可用后再切换。
常见问题
GLM-5.3 编程能力是否强于 GLM-5.2?
Z.ai 报告 GLM-5.3 在私有 Code Bench 和多个公开编程 benchmark 上得分更高,因此 5.3 更值得优先评测。但团队仍应在自己的任务上复现决策。
GLM-5.3 使用了新底模吗?
没有。Z.ai 表示它与 GLM-5.2 使用相同底模,提升来自额外后训练。
GLM-5.3 API 已经可用吗?
Z.ai 已于 2026 年 8 月 14 日向 Coding Plan 用户开放 5.3,但开发者模型页仍表示 API coming soon。订阅可用不等于 API 可用。
GLM-5.3 API 多少钱?
核验时,Z.ai 开发者价格表尚未列出 GLM-5.3,因此没有可以引用的官方逐 token API 价格。不能拿 5.2 价格占位。
从 GLM-5.2 迁移时什么会报错?
GLM-5.3 不支持 thinking.type: "disabled"。Z.ai 要求先开启 thinking 并把 reasoning_effort 设为 low,再改变模型 ID,否则请求会失败。
现在能通过 OmniAKey 使用 GLM-5.3 吗?
核验时不能。OmniAKey 当前只列出 glm-5.2,也不会把未列出的模型静默替换成别的模型。后续请检查在线目录。
核验来源
事实核验于 2026 年 8 月 14 日。API 访问、模型可用性、价格、权重发布、benchmark 文档和客户端支持均可能变化,迁移生产流量前请重新核验第一方页面。