GLM-5.2 API 价格
Z.ai 公布的 GLM-5.2 每百万 Token 价格为:输入 $1.40、缓存输入 $0.26、输出 $4.40;OmniaKey 当前按这些费率的 50% 计费。
Z.ai 官方公布的 GLM-5.2 API 价格是:每百万输入 Token $1.40、每百万缓存输入 Token $0.26、每百万输出 Token $4.40。OmniaKey 当前对应价格是输入 $0.70、缓存输入 $0.13、输出 $2.20。
比例虽然简单,但一次请求不一定只按输入标价乘以 Token 总数。请求可能同时包含未缓存输入、缓存输入和模型输出,三部分分别使用不同费率。
价格核对日期为 2026 年 8 月 9 日。 下表的 Z.ai 一栏来自 Z.ai 国际开发者定价页;OmniaKey 一栏是当前平台价格,不是 Z.ai 新的官方标价。费率和活动可能变化,正式制定生产预算前应再次检查两个实时页面。
**GLM-5.3 发布更新:**Z.ai 已于 8 月 14 日向 Coding Plan 用户发布 GLM-5.3,但开发者 API 页面仍标注 coming soon,官方价格表也没有 5.3 一行。升级判断请阅读 GLM-5.3 和 GLM-5.2 编程对比;下文费率仍只适用于 GLM-5.2。
GLM-5.2 API 价格一览
下表金额均为每百万 Token 的美元价格。
| 用量类型 | Z.ai 官方价格 | OmniaKey 当前价格 | 当前差额 |
|---|---|---|---|
| 未缓存输入 | $1.40 | $0.70 | 低 50% |
| 缓存输入 | $0.26 | $0.13 | 低 50% |
| 输出 | $4.40 | $2.20 | 低 50% |
GLM-5.2 模型页会展示 OmniaKey 当前费率、上下文窗口、能力和请求示例;需要横向查看其它可用模型时,可打开模型目录。
通用成本公式是:
成本 = 未缓存输入百万数 × 输入费率
+ 缓存输入百万数 × 缓存输入费率
+ 输出百万数 × 输出费率
Token 数由计费系统统计,不等于字符数或文件大小。一百万字符不一定就是一百万 Token。
GLM-5.2 三种价格分别代表什么
未缓存输入
未缓存输入包括没有命中缓存的请求内容:系统指令、历史对话、文件、工具定义和其它上下文。发送一百万未缓存输入 Token,官方费率下需要 $1.40,OmniaKey 当前费率下需要 $0.70;这还不包含模型生成的输出。
缓存输入
缓存输入是符合条件、以较低读取费率提供的重复上下文。Z.ai 当前标价为每百万缓存输入 Token $0.26,OmniaKey 当前为 $0.13。
出现缓存输入费率,不等于每个重复 Token 都一定命中缓存。请求结构、缓存有效期和供应商行为都会影响资格。不要把所有重复 Prompt 都按缓存价估算,应以实际用量记录为准。
缓存输入存储
Z.ai 定价表还单独把 cached-input storage 标为“Limited-time Free”。它和 $0.26 的缓存读取费率不是同一个计费项。限时免费存储的期限与条款可以单独变化,不能当成永久免费。
输出
输出包括计费记录中的生成内容和 reasoning Token。官方价格是每百万输出 Token $4.40,OmniaKey 当前为 $2.20,是表格中单 Token 成本最高的一项。
长回答、冗长工具循环、反复修正和过高的输出上限,可能比输入略微增长更影响账单。应按任务需要约束输出,而不是默认请求最大值。
三个可复算的成本案例
下面只按已公布费率计算,不包含可能单独收费的工具、税费、汇率转换或未来调价。
案例 1:读取一个大型代码库
假设一次任务使用一百万未缓存输入 Token,并产生 10 万输出 Token。
| 计算项 | Z.ai 官方 | OmniaKey 当前 |
|---|---|---|
| 输入 | 1 × $1.40 = $1.40 | 1 × $0.70 = $0.70 |
| 输出 | 0.1 × $4.40 = $0.44 | 0.1 × $2.20 = $0.22 |
| 合计 | $1.84 | $0.92 |
一百万 Token 上下文窗口只是容量,不是赠送额度。即使模型只返回很短的答案,只要窗口里放入了一百万未缓存输入 Token,就会产生输入费用。
案例 2:一段较长的工程任务
假设多次调用合计使用一千万未缓存输入 Token,并产生两百万输出 Token。
Z.ai: 10 × $1.40 + 2 × $4.40 = $22.80
OmniaKey: 10 × $0.70 + 2 × $2.20 = $11.40
这是工作负载成本,不是 Benchmark 估算。完成一个任务实际需要多少 Token,会受客户端、Prompt、代码库、工具、重试和模型行为影响。
案例 3:重复上下文命中缓存
假设一千万 Token 被计为缓存输入,同时模型产生一百万输出 Token。
Z.ai: 10 × $0.26 + 1 × $4.40 = $7.00
OmniaKey: 10 × $0.13 + 1 × $2.20 = $3.50
只有供应商确实把这一千万 Token 记录为 cache hit 时,这个案例才成立。Prompt 看起来相同,不保证计费分类也相同。
为什么 OmniaKey 价格与 Z.ai 标价不同
Z.ai 公布的是国际版上游 API 标价,OmniaKey 公布的是通过自身预付网关调用时收取的价格。截至核对日期,OmniaKey 对 GLM-5.2 的未缓存输入、缓存输入和输出统一应用 0.5 的价格比例。
两列价格对应不同的计费关系:
- 直接使用 Z.ai API 账号时,按 Z.ai 一栏做预算;
- 请求从 OmniaKey 余额扣费时,按 OmniaKey 一栏计算;
- 不要把一个平台的输入价格和另一个平台的输出价格混用;
- 不要假设当前 50% 差额永久有效。
OmniaKey 不会靠改掉请求的模型 ID 来实现这个价差。请求仍使用 glm-5.2;模型不可用时返回错误,而不是悄悄换成另一个模型。
更完整的账单判断标准可参考透明 API 计费应该如何工作。
这个价格包含哪些 GLM-5.2 能力
Z.ai 把 GLM-5.2 定位为面向长程任务的旗舰模型。官方模型页列出:
- 一百万 Token 上下文窗口;
- 最大 128,000 输出 Token;
- thinking 模式和可配置 reasoning effort;
- 流式输出;
- function calling 与 MCP 集成;
- structured output;
- context caching。
这些是容量和接口事实,不保证每个客户端都暴露全部选项。网关提供兼容 API 路径,也不等于每个编程产品都原生支持该模型。
不能从价格表推出通用质量冠军。Z.ai 在模型页发布了 Benchmark 和产品主张,但本文没有独立复现这些测试。
哪些任务使用 GLM-5.2 更划算
当任务需要下面这些能力时,可以把 GLM-5.2 列入候选:
- 同时容纳代码、测试、文档和工程约束的项目级上下文;
- 长链路、多步骤实现或重构;
- 结构化工具调用和机器可读输出;
- 能够命中缓存输入计费的重复上下文;
- 生成大型产物时需要较高输出上限。
对于很小的分类、简短抽取或机械修改,如果更小的模型也能稳定完成,GLM-5.2 可能并不经济。真正重要的是某类任务里最便宜的合格模型,而不是定价页上最大的折扣百分比。
编程模型选择指南解释了为什么应按验收通过的工作做路由,而不是只看一个标价。
按验收任务衡量成本
用 GLM-5.2 对比其它模型时,应固定仓库状态、Prompt、工具、权限和验收测试,并记录:
- 未缓存、缓存和输出 Token;
- 模型轮数与工具调用次数;
- 延迟和失败尝试;
- 人工修正时间;
- 必要测试与验收标准是否通过;
- 最终实际扣费。
Token 单价更低的模型,如果需要额外重试,总成本仍可能更高;费率更高的模型,如果能一次完成困难任务,也可能更经济。Agent 输出具有随机性,同一任务应重复测试。
通过 OmniaKey 调用 GLM-5.2
先在 API Key 面板创建用途明确的 Key,再调用 OpenAI 兼容的 Chat Completions 路径:
curl https://api.omniakey.com/v1/chat/completions \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Review this migration plan"}],
"stream": true
}'
模型 ID 必须精确写成 glm-5.2。API 快速上手记录了端点与鉴权方式。
完成一个有代表性的任务后,把客户端 Token 报告与用量面板核对。余额与用量指南说明了逐次调用记录和 Key 限额。
控制预算,但不要把限额当成节省
Key 支出上限只能限制财务风险,不会减少上限以内的 Token 消耗。本地开发、CI 和共享自动化应使用不同 Key,方便分别归因和撤销。
更实际的顺序是:
- 运行一个有代表性的任务;
- 检查实际的未缓存、缓存和输出用量;
- 去掉可避免的上下文和重试;
- 在正常任务波动之上设置 Key 限额;
- 提高限额前先复查用量。
上下文层面的优化方法可参考降低 Token 消耗指南。其中命令虽然针对 Claude Code,但优化原则同样适用于其它 Agent。
常见定价错误
把 1M 上下文当成免费额度
上下文窗口是最大容量,放入其中的输入仍按实际计费分类收费。
混淆缓存读取与缓存存储
Z.ai 同时列出按 Token 收费的缓存命中费率和单独的限时存储活动,两者不能互换。
把所有重复 Prompt 都按缓存价计算
只有供应商记录的 cache hit 才适用。应检查真实用量明细。
比价格时忽略输出量
输出单价高于输入。产生过多 reasoning 或反复生成补丁的工作流,可能抵消 Prompt 端的节省。
把今天的折扣当成永久合同
OmniaKey 的 50% 比例截至 2026 年 8 月 9 日有效。发布预算或采购决定前应重查实时目录。
把低费率写成 Benchmark 胜利
价格只说明计费,不代表正确率、延迟、工具可靠性或任务完成率。应测试真实工作负载。
常见问题
GLM-5.2 API 多少钱?
Z.ai 标价是每百万未缓存输入 Token $1.40、每百万缓存输入 Token $0.26、每百万输出 Token $4.40;OmniaKey 当前对应为 $0.70、$0.13 和 $2.20。
通过 OmniaKey 使用 GLM-5.2 更便宜吗?
按 2026 年 8 月 9 日核对结果,是的:OmniaKey 当前费率为 Z.ai 国际标价的 50%。这是当前平台价格,不是 Z.ai 永久调价。
一百万 Token 的 GLM-5.2 Prompt 要多少钱?
一百万未缓存输入 Token 按 Z.ai 标价为 $1.40,按 OmniaKey 当前价格为 $0.70,输出另计。如果这一百万全部被记录为缓存输入,对应读取费用分别是 $0.26 和 $0.13。
GLM-5.2 支持 1M 上下文吗?
支持。Z.ai 标明一百万 Token 上下文窗口和 128,000 最大输出 Token。容量不代表整块窗口免费,也不代表每次任务都需要填满。
GLM-5.2 支持工具调用和结构化输出吗?
Z.ai 模型页列出了 function calling、MCP、structured output、streaming、thinking 模式与 context caching。生产使用前仍需确认具体客户端和 API 路径暴露哪些能力。
来源
事实核对日期:2026 年 8 月 9 日。供应商费率、平台折扣、缓存条款和支持能力都可能变化;正式制定生产预算前,请检查上述第一方文档和 OmniaKey 实时模型目录。