GPT-6 Sol、Claude Opus 5.5 已上线GPT-6 Sol 价格仅为 5.6 Sol 的一半
博客
产品对比

GLM-5.3 和 GLM-5.2 编程对比

GLM-5.3 沿用 GLM-5.2 的底模和官方价位,但通过更强的后训练、新 effort 控制和一项不兼容的 thinking 迁移改变了编程选型。

12 分钟阅读OmniaKey
GLM-5.3GLM-5.2AI codingmodel comparison

GLM-5.3 和 GLM-5.2 编程对比的核心是后训练差异,而不是新底模与旧底模的比较。Z.ai 表示两个版本使用相同底模;GLM-5.3 增加了面向长程、可执行工程环境的训练,并在编程、Agent 与安全评测中报告了明显提升。

实际结论比发布当天更明确。对于困难、长时间运行的编程任务,GLM-5.3 更值得优先评测;它的 API、开放权重和 OmniaKey 路由现在都已可用。但它仍不是零风险的模型 ID 替换:GLM-5.3 始终开启 thinking,不接受 thinking.type: "disabled",仍应在与 5.2 相同的 harness 和权限环境里做回归。

事实核验于 2026 年 9 月 18 日。 规格、基准数值、推理参数、API 端点、官方价格、Coding Plan、开放权重和 OmniaKey 可用性均对照 Z.ai 开发者文档、价格表、发布报告、官方模型卡与 OmniaKey 实时目录。下文 benchmark 是 Z.ai 报告的结果,不是 OmniaKey 独立复测。

GLM-5.3 与 GLM-5.2 一览

决策点GLM-5.3GLM-5.2
底模与 5.2 相同两个版本共用的底模
主要变化增加长程专业工作流后训练较早的后训练栈与基线
上下文窗口1M token1M token
最大输出128K token128K token
Thinking始终开启可以开启或关闭
Reasoning effortlow、high、max,默认 max已有可配置推理控制
Coding Plan发布当天已可用可用
开发者 APIglm-5.3 已可用glm-5.2 已可用
官方价格每百万输入 $1.40、缓存输入 $0.26、输出 $4.40相同
开放权重zai-org/GLM-5.3 已发布走现有发布路径
OmniaKey 目录以 glm-5.3 提供以 glm-5.2 提供

因此需要把两个问题分开:

  1. GLM-5.3 是否更值得优先评测?值得,尤其是长程编程任务。
  2. 是否应该立即切换全部生产 API 流量?不应该,还要用匹配测试确认客户端兼容性、effort 策略、延迟和完整任务成本。

GLM-5.3 模型页和 GLM-5.2 模型页负责 OmniaKey 当前报价、请求示例和在线状态;GLM-5.2 API 价格指南保留 5.2 的详细成本计算;本文只回答升级决策。

GLM-5.3 到底改了什么?

Z.ai 明确表示,GLM-5.3 使用与 GLM-5.2 完全相同的底模。官方报告的提升来自扩大长程任务环境上的后训练。

这个区别很重要。新版本号不一定意味着更大的上下文、新架构或不同预训练语料。本次发布主张的是:通过更多环境、更丰富任务和更长专业工作流训练之后,模型行为变得更好。

Z.ai 描述的训练任务更像完整工程工作单元,而不是孤立编程题。模型可能需要读取代码库与文档,使用计算和存储系统,定位瓶颈,实施修改,执行实验,并在保持正确性的前提下交付结果。

需要测试的不是单个函数写得是否更漂亮,而是模型能否持续完成整条链路:

text
理解目标
  -> 检查环境
  -> 规划并修改
  -> 运行工具与测试
  -> 诊断失败
  -> 验证交付结果

如果只是做一个短 autocomplete 测试,基本看不到 Z.ai 声称的主要差异。

官方编程 benchmark 对比

发布报告给出以下两代模型数值:

BenchmarkGLM-5.3GLM-5.2官方报告变化
Terminal-Bench 2.188.281.0+7.2 分
Terminal-Bench 3.028.34.6+23.7 分
DeepSWE v1.166.946.2+20.7 分
NL2Repo58.048.9+9.1 分
FrontierSWE78.167.5+10.6 分
SWE-Marathon v1.142.519.4+23.1 分
PostTrainBench39.831.7+8.1 分
Agents' Last Exam CLI28.523.8+4.7 分

Z.ai 还表示,GLM-5.3 在私有 Z.ai Code Bench 上相对 5.2 提升 50%。发布图表中,Max effort 下 5.3 约用每任务 75K 输出 token 得到 34.5%,5.2 则约用 96K 得到 23.4%。

这些数字足以支持“5.3 值得测试”,却不能证明所有团队都会提升 50%。私有 benchmark 无法根据发布文章复现,公开 benchmark 也使用了特定 harness、超时、token 上限、采样参数和评分规则。

例如,Z.ai 的 Terminal-Bench 3.0 使用 Claude Code 2.1.207、reasoning_effort=max、400K 上下文、最多 128K 输出、最多 600 个 Agent 回合、十小时超时,并对每个任务执行三次。五分钟本地 smoke test 不是同一个实验。

安全能力也改变了部署边界

Z.ai 在后训练中加入漏洞发现数据与环境,并报告:

安全 benchmarkGLM-5.3GLM-5.2
CyberGym84.577.2
ExploitBench54.424.4
ExploitGym,两小时预算105 个任务29 个任务
ExploitGym,六小时预算130 个任务39 个任务

这些结果对经过授权的防御性审查有价值,同时意味着权限管理应该更严格:收窄仓库权限、隔离执行、限制网络、记录工具活动,并对敏感修改保留人工审批。

Benchmark 能力不等于授权。模型能提出可行 exploit,不代表可以对第三方系统进行测试。

API 迁移存在不兼容的 thinking 变化

GLM-5.3 支持三个推理等级:

json
{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

可选值是 low、high、max;Z.ai 将 max 列为默认,并建议编程任务使用它。

关键迁移规则是 GLM-5.3 不再支持:

json
"thinking": { "type": "disabled" }

Z.ai 表示,带该设置的请求会失败。修改模型 ID 之前,应先改为:

json
{
  "thinking": { "type": "enabled" },
  "reasoning_effort": "low"
}

如果原路径关闭 thinking,先用 low 作为最接近的替代,再在真实任务上测试 high 与 max。不要同时改变模型 ID 和 effort 策略,却不测量延迟、输出量与验收通过率。

API、Coding Plan 与开放权重现在都已可用

GLM-5.3 在订阅、API 和权重上的发布时间不同。到 2026 年 9 月 18 日,三条路径都已存在:

  • **GLM Coding Plan:**Z.ai 表示已向 Coding Plan 用户完整开放。
  • **开发者 API:**官方页面已为 glm-5.3 提供 OpenAI Chat Completions、OpenAI Responses 与 Anthropic Messages 兼容端点说明。
  • **开放权重:**Z.ai 已发布官方 zai-org/GLM-5.3 模型卡与部署指引。

三者仍不能互相替代。Coding Plan 订阅、按量 API key 和自托管部署分别有不同的计费、配额、运维和支持边界;请确认生产系统使用的具体路径。

OmniaKey 模型目录现在同时列出 glm-5.3 和 glm-5.2。OmniaKey 不会静默替换模型,因此请求的 ID 会保留在用量和账单记录中。

GLM-5.3 与 GLM-5.2 官方 API 价格相同

Z.ai 开发者价格页目前将两款模型都列为:每百万未缓存输入 token $1.40、缓存输入 $0.26、输出 $4.40;缓存输入存储标为限时免费。

官方单价相同,只是减少了直接 API 对比中的一个变量,并不意味着每个任务总成本相同。5.3 的 reasoning 和输出 token、重试以及人工修正都可能不同;Coding Plan points、Z.ai 按量 API 和网关报价也是不同计费关系。

生产升级前,请在实际使用的 route 上测量:

  1. 每个已验收任务的输入、缓存输入与输出 token;
  2. 缓存行为与存储条款;
  3. 目标区域的可用性与延迟;
  4. rate limit 与并发行为;
  5. 各 reasoning effort 的重试、工具失败与人工修正。

OmniaKey 当前对两款模型采用同一 Z.ai 价格关系;具体报价请以各自模型页为准。GLM-5.2 价格指南仍可参考缓存算式,但不能代替实时目录核验。

现在是否应该从 GLM-5.2 升级?

适合评测 GLM-5.3 的情况

  • 任务跨越大量文件、系统或验证步骤;
  • GLM-5.2 会在长工具链中丢失计划;
  • 工作负载以困难调试或仓库级修改为主;
  • 任务包含经过授权的安全审查;
  • 可以通过官方支持的访问方式运行匹配测试。

适合暂时继续使用 GLM-5.2 的情况

  • 现有生产行为稳定且价格已知;
  • 客户端依赖 thinking.type: "disabled";
  • 工作负载短、确定,而且已经可靠通过;
  • 暂时无法在 5.3 上复现相同权限、工具和验收条件。

API 已可用不再是继续使用 5.2 的理由。剩下的理由是兼容性、已验证行为与运维风险。只有新模型在你的任务上提高了完整任务成本或可靠性,才值得升级。

如何公平测试 GLM-5.3 与 GLM-5.2

当两款模型能通过可比 route 访问后,请固定:

控制项保持一致的内容
代码库同一个 commit 与依赖状态
Prompt同一目标、约束与完成定义
Harness同一客户端版本与上下文管理策略
权限同一文件、Shell、网络与审批范围
工具同一工具集与外部服务
预算可比的超时、回合上限与 effort 策略
验证同一测试、lint、build 与人工审查标准

记录通过率、耗时、输入、缓存输入、输出、重试、工具失败、人工修正和最终账单。长程 Agent 结果有波动,因此不能只跑一次。

编程模型指南说明了如何按任务类型做路由,而不是宣布一个通用赢家。

最终结论

GLM-5.3 是有实质变化的编程版本,不是只换版本号。Z.ai 报告的提升覆盖范围足够广,值得优先用于困难仓库任务评测;在底模不变的前提下,这种后训练提升尤其值得观察。

它仍不是 GLM-5.2 的通用即插即用替代。API、价格、权重和 OmniaKey 路由都已可用,但 thinking 配置仍需迁移,生产行为仍需匹配测试。

新的长程编程评测可以从 GLM-5.3 开始。若工作流依赖可选 thinking,或回归证据还不足以承担迁移风险,则继续使用 GLM-5.2。

常见问题

GLM-5.3 编程能力是否强于 GLM-5.2?

Z.ai 报告 GLM-5.3 在私有 Code Bench 和多个公开编程 benchmark 上得分更高,因此 5.3 更值得优先评测。但团队仍应在自己的任务上复现决策。

GLM-5.3 使用了新底模吗?

没有。Z.ai 表示它与 GLM-5.2 使用相同底模,提升来自额外后训练。

GLM-5.3 API 已经可用吗?

可以。Z.ai 开发者页现在为 glm-5.3 提供 API 端点和示例;Coding Plan、按量 API 和自托管仍是不同路径。

GLM-5.3 API 多少钱?

Z.ai 将 GLM-5.3 列为每百万未缓存输入 $1.40、缓存输入 $0.26、输出 $4.40,与核验时 GLM-5.2 的官方价位相同。

从 GLM-5.2 迁移时什么会报错?

GLM-5.3 不支持 thinking.type: "disabled"。Z.ai 要求先开启 thinking 并把 reasoning_effort 设为 low,再改变模型 ID,否则请求会失败。

现在能通过 OmniaKey 使用 GLM-5.3 吗?

可以。OmniaKey 当前把 glm-5.3 与 glm-5.2 作为两个独立的 Z.ai 模型 ID 列出;切换生产流量前仍请查看实时报价。

核验来源

事实核验于 2026 年 9 月 18 日。API 访问、模型可用性、价格、benchmark 文档和客户端支持均可能变化,迁移生产流量前请重新核验第一方页面。