DeepSeek V4 Flash 上线 · 我们的 GLM-5.2 价格本次下调至 5折
博客
产品对比

GLM-5.3 和 GLM-5.2 编程对比

GLM-5.3 沿用 GLM-5.2 的底模,但通过更强的后训练、新 effort 控制和一项不兼容的 thinking 迁移改变了编程选型。

12 分钟阅读OmniaKey
GLM-5.3GLM-5.2AI codingmodel comparison

GLM-5.3 和 GLM-5.2 编程对比的核心是后训练差异,而不是新底模与旧底模的比较。Z.ai 表示两个版本使用相同底模;GLM-5.3 增加了面向长程、可执行工程环境的训练,并在编程、Agent 与安全评测中报告了明显提升。

实际结论需要分情况。对于困难、长时间运行的编程任务,GLM-5.3 更值得优先评测,但它目前还不能在所有场景里直接替换 5.2。2026 年 8 月 14 日,Z.ai 已向 GLM Coding Plan 用户开放 5.3;与此同时,开发者模型页仍写着 “The GLM-5.3 API is coming soon.” OmniAKey 当前目录也只列出 glm-5.2

核验于 2026 年 8 月 14 日。 规格、基准数值、推理参数、Coding Plan 可用性、API 状态和权重发布时间均来自 Z.ai 发布文章与开发者文档。下文 benchmark 是 Z.ai 报告的结果,不是 OmniAKey 独立复测。官方 API 价格表尚未列出 GLM-5.3,因此本文不填写猜测价格。

GLM-5.3 与 GLM-5.2 一览

决策点GLM-5.3GLM-5.2
底模与 5.2 相同两个版本共用的底模
主要变化增加长程专业工作流后训练较早的后训练栈与基线
上下文窗口1M token1M token
最大输出128K token128K token
Thinking始终开启可以开启或关闭
Reasoning effortlowhighmax,默认 max已有可配置推理控制
Coding Plan发布当天已可用可用
开发者 API官方页面标注 coming soon已可用
开放权重宣布约在发布两周后提供走现有发布路径
OmniAKey 目录当前未列出glm-5.2 提供

因此需要把两个问题分开:

  1. GLM-5.3 是否值得进入评测?值得,尤其是长程编程任务。
  2. 是否应该今天就切换全部生产 API 流量?不应该,必须先确认访问方式、价格、客户端支持与迁移行为。

GLM-5.2 模型页负责当前 OmniAKey 价格、请求示例和在线状态;GLM-5.2 API 价格指南负责详细成本计算;本文只回答升级决策。

GLM-5.3 到底改了什么?

Z.ai 明确表示,GLM-5.3 使用与 GLM-5.2 完全相同的底模。官方报告的提升来自扩大长程任务环境上的后训练。

这个区别很重要。新版本号不一定意味着更大的上下文、新架构或不同预训练语料。本次发布主张的是:通过更多环境、更丰富任务和更长专业工作流训练之后,模型行为变得更好。

Z.ai 描述的训练任务更像完整工程工作单元,而不是孤立编程题。模型可能需要读取代码库与文档,使用计算和存储系统,定位瓶颈,实施修改,执行实验,并在保持正确性的前提下交付结果。

需要测试的不是单个函数写得是否更漂亮,而是模型能否持续完成整条链路:

code

如果只是做一个短 autocomplete 测试,基本看不到 Z.ai 声称的主要差异。

官方编程 benchmark 对比

发布报告给出以下两代模型数值:

BenchmarkGLM-5.3GLM-5.2官方报告变化
Terminal-Bench 2.188.281.0+7.2 分
Terminal-Bench 3.028.34.6+23.7 分
DeepSWE v1.166.946.2+20.7 分
NL2Repo58.048.9+9.1 分
FrontierSWE78.167.5+10.6 分
SWE-Marathon v1.142.519.4+23.1 分
PostTrainBench39.831.7+8.1 分
Agents' Last Exam CLI28.523.8+4.7 分

Z.ai 还表示,GLM-5.3 在私有 Z.ai Code Bench 上相对 5.2 提升 50%。发布图表中,Max effort 下 5.3 约用每任务 75K 输出 token 得到 34.5%,5.2 则约用 96K 得到 23.4%。

这些数字足以支持“5.3 值得测试”,却不能证明所有团队都会提升 50%。私有 benchmark 无法根据发布文章复现,公开 benchmark 也使用了特定 harness、超时、token 上限、采样参数和评分规则。

例如,Z.ai 的 Terminal-Bench 3.0 使用 Claude Code 2.1.207、reasoning_effort=max、400K 上下文、最多 128K 输出、最多 600 个 Agent 回合、十小时超时,并对每个任务执行三次。五分钟本地 smoke test 不是同一个实验。

安全能力也改变了部署边界

Z.ai 在后训练中加入漏洞发现数据与环境,并报告:

安全 benchmarkGLM-5.3GLM-5.2
CyberGym84.577.2
ExploitBench54.424.4
ExploitGym,两小时预算105 个任务29 个任务
ExploitGym,六小时预算130 个任务39 个任务

这些结果对经过授权的防御性审查有价值,同时意味着权限管理应该更严格:收窄仓库权限、隔离执行、限制网络、记录工具活动,并对敏感修改保留人工审批。

Benchmark 能力不等于授权。模型能提出可行 exploit,不代表可以对第三方系统进行测试。

API 迁移存在不兼容的 thinking 变化

GLM-5.3 支持三个推理等级:

json
{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

可选值是 lowhighmax;Z.ai 将 max 列为默认,并建议编程任务使用它。

关键迁移规则是 GLM-5.3 不再支持:

json
"thinking": { "type": "disabled" }

Z.ai 表示,带该设置的请求会失败。修改模型 ID 之前,应先改为:

json
{
  "thinking": { "type": "enabled" },
  "reasoning_effort": "low"
}

如果原路径关闭 thinking,先用 low 作为最接近的替代,再在真实任务上测试 highmax。不要同时改变模型 ID 和 effort 策略,却不测量延迟、输出量与验收通过率。

Coding Plan 可用不等于 API 可用

发布当天,GLM-5.3 有三种不同访问状态:

  • **GLM Coding Plan:**Z.ai 表示已经向全部 Coding Plan 用户开放。
  • **开发者 API:**官方 GLM-5.3 开发者页仍写着 API coming soon。
  • **开放权重:**Z.ai 表示经过安全评测与加固后,约在发布两周后提供。

三者不能互相替代。模型能在 ZCode 或订阅计划里运行,不代表 API key 已经能请求 model: "glm-5.3";宣布即将开放权重,也不等于今天已经有生产级自托管部署。

核验时,OmniAKey 模型目录在 Z.ai 分类下只列出 glm-5.2。请求未列出的模型应当失败,而不是静默 fallback。

GLM-5.3 API 价格尚未公布

Z.ai 开发者价格页目前列出的 GLM-5.2 费率是:每百万未缓存输入 token $1.40、缓存输入 $0.26、输出 $4.40。页面尚无 GLM-5.3 一行。

不要直接沿用 5.2 费率,不要把 Coding Plan points 换算成臆测 token 单价,也不要把第三方网关价格称为 Z.ai 官方价格。这些是不同计费关系。

生产升级之前,至少等待目标 route 明确给出:

  1. 官方输入、缓存输入与输出费率;
  2. 缓存存储或写入条款;
  3. 目标区域的模型与 API 可用性;
  4. rate limit 与并发行为;
  5. 各 reasoning effort 的实际 token 消耗。

在此之前,GLM-5.2 仍是可以测量的 API 选项。其官方与 OmniAKey 当前成本见价格指南

现在是否应该从 GLM-5.2 升级?

适合评测 GLM-5.3 的情况

  • 任务跨越大量文件、系统或验证步骤;
  • GLM-5.2 会在长工具链中丢失计划;
  • 工作负载以困难调试或仓库级修改为主;
  • 任务包含经过授权的安全审查;
  • 可以通过官方支持的访问方式运行匹配测试。

适合暂时继续使用 GLM-5.2 的情况

  • 今天就需要普遍可用、按量计费的 API;
  • 现有生产行为稳定且价格已知;
  • 客户端依赖 thinking.type: "disabled"
  • 工作负载短、确定,而且已经可靠通过;
  • 暂时无法在 5.3 上复现相同权限、工具和验收条件。

版本号不是决策依据。只有新模型在你的任务上提高了完整任务成本或可靠性,才值得升级。

如何公平测试 GLM-5.3 与 GLM-5.2

当两款模型能通过可比 route 访问后,请固定:

控制项保持一致的内容
代码库同一个 commit 与依赖状态
Prompt同一目标、约束与完成定义
Harness同一客户端版本与上下文管理策略
权限同一文件、Shell、网络与审批范围
工具同一工具集与外部服务
预算可比的超时、回合上限与 effort 策略
验证同一测试、lint、build 与人工审查标准

记录通过率、耗时、输入、缓存输入、输出、重试、工具失败、人工修正和最终账单。长程 Agent 结果有波动,因此不能只跑一次。

编程模型指南说明了如何按任务类型做路由,而不是宣布一个通用赢家。

最终结论

GLM-5.3 是有实质变化的编程版本,不是只换版本号。Z.ai 报告的提升覆盖范围足够广,值得优先用于困难仓库任务评测;在底模不变的前提下,这种后训练提升尤其值得观察。

但现在仍不足以把它称为 GLM-5.2 的通用生产替代。API 官方状态是 coming soon,token 价格未公布,开放权重需要等待,而且 thinking 配置需要迁移。

今天需要已知、可计量 API 时继续使用 GLM-5.2。将 GLM-5.3 放到长程编程评测队列最前面,等匹配测试与真实 API 经济性都可用后再切换。

常见问题

GLM-5.3 编程能力是否强于 GLM-5.2?

Z.ai 报告 GLM-5.3 在私有 Code Bench 和多个公开编程 benchmark 上得分更高,因此 5.3 更值得优先评测。但团队仍应在自己的任务上复现决策。

GLM-5.3 使用了新底模吗?

没有。Z.ai 表示它与 GLM-5.2 使用相同底模,提升来自额外后训练。

GLM-5.3 API 已经可用吗?

Z.ai 已于 2026 年 8 月 14 日向 Coding Plan 用户开放 5.3,但开发者模型页仍表示 API coming soon。订阅可用不等于 API 可用。

GLM-5.3 API 多少钱?

核验时,Z.ai 开发者价格表尚未列出 GLM-5.3,因此没有可以引用的官方逐 token API 价格。不能拿 5.2 价格占位。

从 GLM-5.2 迁移时什么会报错?

GLM-5.3 不支持 thinking.type: "disabled"。Z.ai 要求先开启 thinking 并把 reasoning_effort 设为 low,再改变模型 ID,否则请求会失败。

现在能通过 OmniAKey 使用 GLM-5.3 吗?

核验时不能。OmniAKey 当前只列出 glm-5.2,也不会把未列出的模型静默替换成别的模型。后续请检查在线目录。

核验来源

事实核验于 2026 年 8 月 14 日。API 访问、模型可用性、价格、权重发布、benchmark 文档和客户端支持均可能变化,迁移生产流量前请重新核验第一方页面。