GLM-5.3 和 GLM-5.2 编程对比
GLM-5.3 沿用 GLM-5.2 的底模和官方价位,但通过更强的后训练、新 effort 控制和一项不兼容的 thinking 迁移改变了编程选型。
GLM-5.3 和 GLM-5.2 编程对比的核心是后训练差异,而不是新底模与旧底模的比较。Z.ai 表示两个版本使用相同底模;GLM-5.3 增加了面向长程、可执行工程环境的训练,并在编程、Agent 与安全评测中报告了明显提升。
实际结论比发布当天更明确。对于困难、长时间运行的编程任务,GLM-5.3 更值得优先评测;它的 API、开放权重和 OmniaKey 路由现在都已可用。但它仍不是零风险的模型 ID 替换:GLM-5.3 始终开启 thinking,不接受 thinking.type: "disabled",仍应在与 5.2 相同的 harness 和权限环境里做回归。
事实核验于 2026 年 9 月 18 日。 规格、基准数值、推理参数、API 端点、官方价格、Coding Plan、开放权重和 OmniaKey 可用性均对照 Z.ai 开发者文档、价格表、发布报告、官方模型卡与 OmniaKey 实时目录。下文 benchmark 是 Z.ai 报告的结果,不是 OmniaKey 独立复测。
GLM-5.3 与 GLM-5.2 一览
| 决策点 | GLM-5.3 | GLM-5.2 |
|---|---|---|
| 底模 | 与 5.2 相同 | 两个版本共用的底模 |
| 主要变化 | 增加长程专业工作流后训练 | 较早的后训练栈与基线 |
| 上下文窗口 | 1M token | 1M token |
| 最大输出 | 128K token | 128K token |
| Thinking | 始终开启 | 可以开启或关闭 |
| Reasoning effort | low、high、max,默认 max | 已有可配置推理控制 |
| Coding Plan | 发布当天已可用 | 可用 |
| 开发者 API | glm-5.3 已可用 | glm-5.2 已可用 |
| 官方价格 | 每百万输入 $1.40、缓存输入 $0.26、输出 $4.40 | 相同 |
| 开放权重 | zai-org/GLM-5.3 已发布 | 走现有发布路径 |
| OmniaKey 目录 | 以 glm-5.3 提供 | 以 glm-5.2 提供 |
因此需要把两个问题分开:
- GLM-5.3 是否更值得优先评测?值得,尤其是长程编程任务。
- 是否应该立即切换全部生产 API 流量?不应该,还要用匹配测试确认客户端兼容性、effort 策略、延迟和完整任务成本。
GLM-5.3 模型页和 GLM-5.2 模型页负责 OmniaKey 当前报价、请求示例和在线状态;GLM-5.2 API 价格指南保留 5.2 的详细成本计算;本文只回答升级决策。
GLM-5.3 到底改了什么?
Z.ai 明确表示,GLM-5.3 使用与 GLM-5.2 完全相同的底模。官方报告的提升来自扩大长程任务环境上的后训练。
这个区别很重要。新版本号不一定意味着更大的上下文、新架构或不同预训练语料。本次发布主张的是:通过更多环境、更丰富任务和更长专业工作流训练之后,模型行为变得更好。
Z.ai 描述的训练任务更像完整工程工作单元,而不是孤立编程题。模型可能需要读取代码库与文档,使用计算和存储系统,定位瓶颈,实施修改,执行实验,并在保持正确性的前提下交付结果。
需要测试的不是单个函数写得是否更漂亮,而是模型能否持续完成整条链路:
理解目标
-> 检查环境
-> 规划并修改
-> 运行工具与测试
-> 诊断失败
-> 验证交付结果
如果只是做一个短 autocomplete 测试,基本看不到 Z.ai 声称的主要差异。
官方编程 benchmark 对比
发布报告给出以下两代模型数值:
| Benchmark | GLM-5.3 | GLM-5.2 | 官方报告变化 |
|---|---|---|---|
| Terminal-Bench 2.1 | 88.2 | 81.0 | +7.2 分 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | +23.7 分 |
| DeepSWE v1.1 | 66.9 | 46.2 | +20.7 分 |
| NL2Repo | 58.0 | 48.9 | +9.1 分 |
| FrontierSWE | 78.1 | 67.5 | +10.6 分 |
| SWE-Marathon v1.1 | 42.5 | 19.4 | +23.1 分 |
| PostTrainBench | 39.8 | 31.7 | +8.1 分 |
| Agents' Last Exam CLI | 28.5 | 23.8 | +4.7 分 |
Z.ai 还表示,GLM-5.3 在私有 Z.ai Code Bench 上相对 5.2 提升 50%。发布图表中,Max effort 下 5.3 约用每任务 75K 输出 token 得到 34.5%,5.2 则约用 96K 得到 23.4%。
这些数字足以支持“5.3 值得测试”,却不能证明所有团队都会提升 50%。私有 benchmark 无法根据发布文章复现,公开 benchmark 也使用了特定 harness、超时、token 上限、采样参数和评分规则。
例如,Z.ai 的 Terminal-Bench 3.0 使用 Claude Code 2.1.207、reasoning_effort=max、400K 上下文、最多 128K 输出、最多 600 个 Agent 回合、十小时超时,并对每个任务执行三次。五分钟本地 smoke test 不是同一个实验。
安全能力也改变了部署边界
Z.ai 在后训练中加入漏洞发现数据与环境,并报告:
| 安全 benchmark | GLM-5.3 | GLM-5.2 |
|---|---|---|
| CyberGym | 84.5 | 77.2 |
| ExploitBench | 54.4 | 24.4 |
| ExploitGym,两小时预算 | 105 个任务 | 29 个任务 |
| ExploitGym,六小时预算 | 130 个任务 | 39 个任务 |
这些结果对经过授权的防御性审查有价值,同时意味着权限管理应该更严格:收窄仓库权限、隔离执行、限制网络、记录工具活动,并对敏感修改保留人工审批。
Benchmark 能力不等于授权。模型能提出可行 exploit,不代表可以对第三方系统进行测试。
API 迁移存在不兼容的 thinking 变化
GLM-5.3 支持三个推理等级:
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
可选值是 low、high、max;Z.ai 将 max 列为默认,并建议编程任务使用它。
关键迁移规则是 GLM-5.3 不再支持:
"thinking": { "type": "disabled" }
Z.ai 表示,带该设置的请求会失败。修改模型 ID 之前,应先改为:
{
"thinking": { "type": "enabled" },
"reasoning_effort": "low"
}
如果原路径关闭 thinking,先用 low 作为最接近的替代,再在真实任务上测试 high 与 max。不要同时改变模型 ID 和 effort 策略,却不测量延迟、输出量与验收通过率。
API、Coding Plan 与开放权重现在都已可用
GLM-5.3 在订阅、API 和权重上的发布时间不同。到 2026 年 9 月 18 日,三条路径都已存在:
- **GLM Coding Plan:**Z.ai 表示已向 Coding Plan 用户完整开放。
- **开发者 API:**官方页面已为
glm-5.3提供 OpenAI Chat Completions、OpenAI Responses 与 Anthropic Messages 兼容端点说明。 - **开放权重:**Z.ai 已发布官方
zai-org/GLM-5.3模型卡与部署指引。
三者仍不能互相替代。Coding Plan 订阅、按量 API key 和自托管部署分别有不同的计费、配额、运维和支持边界;请确认生产系统使用的具体路径。
OmniaKey 模型目录现在同时列出 glm-5.3 和 glm-5.2。OmniaKey 不会静默替换模型,因此请求的 ID 会保留在用量和账单记录中。
GLM-5.3 与 GLM-5.2 官方 API 价格相同
Z.ai 开发者价格页目前将两款模型都列为:每百万未缓存输入 token $1.40、缓存输入 $0.26、输出 $4.40;缓存输入存储标为限时免费。
官方单价相同,只是减少了直接 API 对比中的一个变量,并不意味着每个任务总成本相同。5.3 的 reasoning 和输出 token、重试以及人工修正都可能不同;Coding Plan points、Z.ai 按量 API 和网关报价也是不同计费关系。
生产升级前,请在实际使用的 route 上测量:
- 每个已验收任务的输入、缓存输入与输出 token;
- 缓存行为与存储条款;
- 目标区域的可用性与延迟;
- rate limit 与并发行为;
- 各 reasoning effort 的重试、工具失败与人工修正。
OmniaKey 当前对两款模型采用同一 Z.ai 价格关系;具体报价请以各自模型页为准。GLM-5.2 价格指南仍可参考缓存算式,但不能代替实时目录核验。
现在是否应该从 GLM-5.2 升级?
适合评测 GLM-5.3 的情况
- 任务跨越大量文件、系统或验证步骤;
- GLM-5.2 会在长工具链中丢失计划;
- 工作负载以困难调试或仓库级修改为主;
- 任务包含经过授权的安全审查;
- 可以通过官方支持的访问方式运行匹配测试。
适合暂时继续使用 GLM-5.2 的情况
- 现有生产行为稳定且价格已知;
- 客户端依赖
thinking.type: "disabled"; - 工作负载短、确定,而且已经可靠通过;
- 暂时无法在 5.3 上复现相同权限、工具和验收条件。
API 已可用不再是继续使用 5.2 的理由。剩下的理由是兼容性、已验证行为与运维风险。只有新模型在你的任务上提高了完整任务成本或可靠性,才值得升级。
如何公平测试 GLM-5.3 与 GLM-5.2
当两款模型能通过可比 route 访问后,请固定:
| 控制项 | 保持一致的内容 |
|---|---|
| 代码库 | 同一个 commit 与依赖状态 |
| Prompt | 同一目标、约束与完成定义 |
| Harness | 同一客户端版本与上下文管理策略 |
| 权限 | 同一文件、Shell、网络与审批范围 |
| 工具 | 同一工具集与外部服务 |
| 预算 | 可比的超时、回合上限与 effort 策略 |
| 验证 | 同一测试、lint、build 与人工审查标准 |
记录通过率、耗时、输入、缓存输入、输出、重试、工具失败、人工修正和最终账单。长程 Agent 结果有波动,因此不能只跑一次。
编程模型指南说明了如何按任务类型做路由,而不是宣布一个通用赢家。
最终结论
GLM-5.3 是有实质变化的编程版本,不是只换版本号。Z.ai 报告的提升覆盖范围足够广,值得优先用于困难仓库任务评测;在底模不变的前提下,这种后训练提升尤其值得观察。
它仍不是 GLM-5.2 的通用即插即用替代。API、价格、权重和 OmniaKey 路由都已可用,但 thinking 配置仍需迁移,生产行为仍需匹配测试。
新的长程编程评测可以从 GLM-5.3 开始。若工作流依赖可选 thinking,或回归证据还不足以承担迁移风险,则继续使用 GLM-5.2。
常见问题
GLM-5.3 编程能力是否强于 GLM-5.2?
Z.ai 报告 GLM-5.3 在私有 Code Bench 和多个公开编程 benchmark 上得分更高,因此 5.3 更值得优先评测。但团队仍应在自己的任务上复现决策。
GLM-5.3 使用了新底模吗?
没有。Z.ai 表示它与 GLM-5.2 使用相同底模,提升来自额外后训练。
GLM-5.3 API 已经可用吗?
可以。Z.ai 开发者页现在为 glm-5.3 提供 API 端点和示例;Coding Plan、按量 API 和自托管仍是不同路径。
GLM-5.3 API 多少钱?
Z.ai 将 GLM-5.3 列为每百万未缓存输入 $1.40、缓存输入 $0.26、输出 $4.40,与核验时 GLM-5.2 的官方价位相同。
从 GLM-5.2 迁移时什么会报错?
GLM-5.3 不支持 thinking.type: "disabled"。Z.ai 要求先开启 thinking 并把 reasoning_effort 设为 low,再改变模型 ID,否则请求会失败。
现在能通过 OmniaKey 使用 GLM-5.3 吗?
可以。OmniaKey 当前把 glm-5.3 与 glm-5.2 作为两个独立的 Z.ai 模型 ID 列出;切换生产流量前仍请查看实时报价。
核验来源
- Z.ai:GLM-5.3 发布报告
- Z.ai:GLM-5.3 开发者模型页
- Z.ai:开发者 API 价格
- Z.ai:GLM-5.2 模型页
- Z.ai:GLM-5.3 官方模型卡
- OmniaKey 在线模型目录
事实核验于 2026 年 9 月 18 日。API 访问、模型可用性、价格、benchmark 文档和客户端支持均可能变化,迁移生产流量前请重新核验第一方页面。