DeepSeek V4 Flash 上线 · 我们的 GLM-5.2 价格本次下调至 5折
博客
成本控制

GLM-5.2 API 价格

Z.ai 公布的 GLM-5.2 每百万 Token 价格为:输入 $1.40、缓存输入 $0.26、输出 $4.40;OmniaKey 当前按这些费率的 50% 计费。

10 分钟阅读OmniaKey
GLM-5.2API pricingZ.aicost control

Z.ai 官方公布的 GLM-5.2 API 价格是:每百万输入 Token $1.40、每百万缓存输入 Token $0.26、每百万输出 Token $4.40。OmniaKey 当前对应价格是输入 $0.70、缓存输入 $0.13、输出 $2.20

比例虽然简单,但一次请求不一定只按输入标价乘以 Token 总数。请求可能同时包含未缓存输入、缓存输入和模型输出,三部分分别使用不同费率。

价格核对日期为 2026 年 8 月 9 日。 下表的 Z.ai 一栏来自 Z.ai 国际开发者定价页;OmniaKey 一栏是当前平台价格,不是 Z.ai 新的官方标价。费率和活动可能变化,正式制定生产预算前应再次检查两个实时页面。

**GLM-5.3 发布更新:**Z.ai 已于 8 月 14 日向 Coding Plan 用户发布 GLM-5.3,但开发者 API 页面仍标注 coming soon,官方价格表也没有 5.3 一行。升级判断请阅读 GLM-5.3 和 GLM-5.2 编程对比;下文费率仍只适用于 GLM-5.2。

GLM-5.2 API 价格一览

下表金额均为每百万 Token 的美元价格。

用量类型Z.ai 官方价格OmniaKey 当前价格当前差额
未缓存输入$1.40$0.70低 50%
缓存输入$0.26$0.13低 50%
输出$4.40$2.20低 50%

GLM-5.2 模型页会展示 OmniaKey 当前费率、上下文窗口、能力和请求示例;需要横向查看其它可用模型时,可打开模型目录

通用成本公式是:

text
成本 = 未缓存输入百万数 × 输入费率
     + 缓存输入百万数 × 缓存输入费率
     + 输出百万数 × 输出费率

Token 数由计费系统统计,不等于字符数或文件大小。一百万字符不一定就是一百万 Token。

GLM-5.2 三种价格分别代表什么

未缓存输入

未缓存输入包括没有命中缓存的请求内容:系统指令、历史对话、文件、工具定义和其它上下文。发送一百万未缓存输入 Token,官方费率下需要 $1.40,OmniaKey 当前费率下需要 $0.70;这还不包含模型生成的输出。

缓存输入

缓存输入是符合条件、以较低读取费率提供的重复上下文。Z.ai 当前标价为每百万缓存输入 Token $0.26,OmniaKey 当前为 $0.13。

出现缓存输入费率,不等于每个重复 Token 都一定命中缓存。请求结构、缓存有效期和供应商行为都会影响资格。不要把所有重复 Prompt 都按缓存价估算,应以实际用量记录为准。

缓存输入存储

Z.ai 定价表还单独把 cached-input storage 标为“Limited-time Free”。它和 $0.26 的缓存读取费率不是同一个计费项。限时免费存储的期限与条款可以单独变化,不能当成永久免费。

输出

输出包括计费记录中的生成内容和 reasoning Token。官方价格是每百万输出 Token $4.40,OmniaKey 当前为 $2.20,是表格中单 Token 成本最高的一项。

长回答、冗长工具循环、反复修正和过高的输出上限,可能比输入略微增长更影响账单。应按任务需要约束输出,而不是默认请求最大值。

三个可复算的成本案例

下面只按已公布费率计算,不包含可能单独收费的工具、税费、汇率转换或未来调价。

案例 1:读取一个大型代码库

假设一次任务使用一百万未缓存输入 Token,并产生 10 万输出 Token。

计算项Z.ai 官方OmniaKey 当前
输入1 × $1.40 = $1.401 × $0.70 = $0.70
输出0.1 × $4.40 = $0.440.1 × $2.20 = $0.22
合计$1.84$0.92

一百万 Token 上下文窗口只是容量,不是赠送额度。即使模型只返回很短的答案,只要窗口里放入了一百万未缓存输入 Token,就会产生输入费用。

案例 2:一段较长的工程任务

假设多次调用合计使用一千万未缓存输入 Token,并产生两百万输出 Token。

text
Z.ai:     10 × $1.40 + 2 × $4.40 = $22.80
OmniaKey: 10 × $0.70 + 2 × $2.20 = $11.40

这是工作负载成本,不是 Benchmark 估算。完成一个任务实际需要多少 Token,会受客户端、Prompt、代码库、工具、重试和模型行为影响。

案例 3:重复上下文命中缓存

假设一千万 Token 被计为缓存输入,同时模型产生一百万输出 Token。

text
Z.ai:     10 × $0.26 + 1 × $4.40 = $7.00
OmniaKey: 10 × $0.13 + 1 × $2.20 = $3.50

只有供应商确实把这一千万 Token 记录为 cache hit 时,这个案例才成立。Prompt 看起来相同,不保证计费分类也相同。

为什么 OmniaKey 价格与 Z.ai 标价不同

Z.ai 公布的是国际版上游 API 标价,OmniaKey 公布的是通过自身预付网关调用时收取的价格。截至核对日期,OmniaKey 对 GLM-5.2 的未缓存输入、缓存输入和输出统一应用 0.5 的价格比例。

两列价格对应不同的计费关系:

  • 直接使用 Z.ai API 账号时,按 Z.ai 一栏做预算;
  • 请求从 OmniaKey 余额扣费时,按 OmniaKey 一栏计算;
  • 不要把一个平台的输入价格和另一个平台的输出价格混用;
  • 不要假设当前 50% 差额永久有效。

OmniaKey 不会靠改掉请求的模型 ID 来实现这个价差。请求仍使用 glm-5.2;模型不可用时返回错误,而不是悄悄换成另一个模型。

更完整的账单判断标准可参考透明 API 计费应该如何工作

这个价格包含哪些 GLM-5.2 能力

Z.ai 把 GLM-5.2 定位为面向长程任务的旗舰模型。官方模型页列出:

  • 一百万 Token 上下文窗口
  • 最大 128,000 输出 Token
  • thinking 模式和可配置 reasoning effort;
  • 流式输出;
  • function calling 与 MCP 集成;
  • structured output;
  • context caching。

这些是容量和接口事实,不保证每个客户端都暴露全部选项。网关提供兼容 API 路径,也不等于每个编程产品都原生支持该模型。

不能从价格表推出通用质量冠军。Z.ai 在模型页发布了 Benchmark 和产品主张,但本文没有独立复现这些测试。

哪些任务使用 GLM-5.2 更划算

当任务需要下面这些能力时,可以把 GLM-5.2 列入候选:

  • 同时容纳代码、测试、文档和工程约束的项目级上下文;
  • 长链路、多步骤实现或重构;
  • 结构化工具调用和机器可读输出;
  • 能够命中缓存输入计费的重复上下文;
  • 生成大型产物时需要较高输出上限。

对于很小的分类、简短抽取或机械修改,如果更小的模型也能稳定完成,GLM-5.2 可能并不经济。真正重要的是某类任务里最便宜的合格模型,而不是定价页上最大的折扣百分比。

编程模型选择指南解释了为什么应按验收通过的工作做路由,而不是只看一个标价。

按验收任务衡量成本

用 GLM-5.2 对比其它模型时,应固定仓库状态、Prompt、工具、权限和验收测试,并记录:

  1. 未缓存、缓存和输出 Token;
  2. 模型轮数与工具调用次数;
  3. 延迟和失败尝试;
  4. 人工修正时间;
  5. 必要测试与验收标准是否通过;
  6. 最终实际扣费。

Token 单价更低的模型,如果需要额外重试,总成本仍可能更高;费率更高的模型,如果能一次完成困难任务,也可能更经济。Agent 输出具有随机性,同一任务应重复测试。

通过 OmniaKey 调用 GLM-5.2

先在 API Key 面板创建用途明确的 Key,再调用 OpenAI 兼容的 Chat Completions 路径:

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [{"role": "user", "content": "Review this migration plan"}],
    "stream": true
  }'

模型 ID 必须精确写成 glm-5.2API 快速上手记录了端点与鉴权方式。

完成一个有代表性的任务后,把客户端 Token 报告与用量面板核对。余额与用量指南说明了逐次调用记录和 Key 限额。

控制预算,但不要把限额当成节省

Key 支出上限只能限制财务风险,不会减少上限以内的 Token 消耗。本地开发、CI 和共享自动化应使用不同 Key,方便分别归因和撤销。

更实际的顺序是:

  1. 运行一个有代表性的任务;
  2. 检查实际的未缓存、缓存和输出用量;
  3. 去掉可避免的上下文和重试;
  4. 在正常任务波动之上设置 Key 限额;
  5. 提高限额前先复查用量。

上下文层面的优化方法可参考降低 Token 消耗指南。其中命令虽然针对 Claude Code,但优化原则同样适用于其它 Agent。

常见定价错误

把 1M 上下文当成免费额度

上下文窗口是最大容量,放入其中的输入仍按实际计费分类收费。

混淆缓存读取与缓存存储

Z.ai 同时列出按 Token 收费的缓存命中费率和单独的限时存储活动,两者不能互换。

把所有重复 Prompt 都按缓存价计算

只有供应商记录的 cache hit 才适用。应检查真实用量明细。

比价格时忽略输出量

输出单价高于输入。产生过多 reasoning 或反复生成补丁的工作流,可能抵消 Prompt 端的节省。

把今天的折扣当成永久合同

OmniaKey 的 50% 比例截至 2026 年 8 月 9 日有效。发布预算或采购决定前应重查实时目录。

把低费率写成 Benchmark 胜利

价格只说明计费,不代表正确率、延迟、工具可靠性或任务完成率。应测试真实工作负载。

常见问题

GLM-5.2 API 多少钱?

Z.ai 标价是每百万未缓存输入 Token $1.40、每百万缓存输入 Token $0.26、每百万输出 Token $4.40;OmniaKey 当前对应为 $0.70、$0.13 和 $2.20。

通过 OmniaKey 使用 GLM-5.2 更便宜吗?

按 2026 年 8 月 9 日核对结果,是的:OmniaKey 当前费率为 Z.ai 国际标价的 50%。这是当前平台价格,不是 Z.ai 永久调价。

一百万 Token 的 GLM-5.2 Prompt 要多少钱?

一百万未缓存输入 Token 按 Z.ai 标价为 $1.40,按 OmniaKey 当前价格为 $0.70,输出另计。如果这一百万全部被记录为缓存输入,对应读取费用分别是 $0.26 和 $0.13。

GLM-5.2 支持 1M 上下文吗?

支持。Z.ai 标明一百万 Token 上下文窗口和 128,000 最大输出 Token。容量不代表整块窗口免费,也不代表每次任务都需要填满。

GLM-5.2 支持工具调用和结构化输出吗?

Z.ai 模型页列出了 function calling、MCP、structured output、streaming、thinking 模式与 context caching。生产使用前仍需确认具体客户端和 API 路径暴露哪些能力。

来源

事实核对日期:2026 年 8 月 9 日。供应商费率、平台折扣、缓存条款和支持能力都可能变化;正式制定生产预算前,请检查上述第一方文档和 OmniaKey 实时模型目录。