现已支持主流图像模型 · GPT-Image、Nano Banana、Seedream 等
博客
指南

GLM-5.3-FlashX 评测

FlashX 卖点是缩短等待,而不是已经证实的新能力档位;约 2.5 倍溢价只适合真正对延迟敏感的链路。

12 分钟阅读OmniaKey
GLM-5.3-FlashXGLM-5.3-FlashAPI 延迟API 价格模型评测

一篇可信的 GLM-5.3-FlashX 评测,必须把“更快的托管路由”和“更强的模型”分开。Z.ai 宣传 200 tokens/s,但没有公布 Flash 与 FlashX 的同条件质量测试、延迟分布,也没有披露这个数字的测试方法。

实际结论很直接:当用户正在等待长篇流式回复,或交互式工具循环被响应时间阻塞时,值得测试 FlashX。批处理、后台 Agent、离线评测等任务继续用普通 Flash,因为约 2.5 倍 token 单价通常换不来可衡量的业务价值。

核验日期:2026 年 9 月 19 日。 本文基于 Z.ai 模型文档、API 价格、发布报告与开放模型卡,并引用 Artificial Analysis 对普通 GLM-5.3-Flash 的数据。我们没有可计费的 FlashX 凭据,没有运行第一手延迟测试,也不会把 200 tokens/s 写成独立实测结果。

GLM-5.3-FlashX 评测结论

只在交互链路优先测试 FlashX:交互式编程、实时研究、Computer Use、客服助手和长篇流式输出都可能受益。只要能让开发者或客户少等几秒,几美分额外成本就可能合理。

普通 Flash 仍应作为性价比默认项:队列任务、文档抽取、离线审查、合成数据和大规模自动化通常更看重总成本。它提供同样的公开合同:1M 上下文、最大 128K 输出、多模态输入、工具调用和强制 Thinking,价格约为 FlashX 的 40%。

不要只为质量升级。 Z.ai 把两个 ID 放在同一能力页面,没有发布独立 FlashX checkpoint,也没有同条件结果证明 FlashX 回答更好。

FlashX 与普通 Flash 一览

决策项GLM-5.3-FlashXGLM-5.3-Flash
API 模型 IDglm-5.3-flashxglm-5.3-flash
官方定位更快的托管路由更低价的托管路由与开放权重模型
速度证据Z.ai 宣传 200 tokens/s,未披露方法Artificial Analysis 在 Z.ai API 测得中位数 98.6 tokens/s
输入 / 缓存输入 / 输出每 1M token 为 $0.37 / $0.075 / $1.25每 1M token 为 $0.15 / $0.03 / $0.50
上下文 / 最大输出1M / 128K token1M / 128K token
输入模态视频、图片、文字和文件视频、图片、文字和文件
Thinking强制开启,不能关闭强制开启,不能关闭
GLM Coding Plan核验时未包含已包含,额度为 GLM-5.3 的 3 倍
公开权重没有单独 checkpointzai-org/GLM-5.3-Flash,MIT 许可证

共享文档足以证明两条路由采用相同的公开能力合同,但不能证明隐藏的服务细节、输出一致性、工具调用行为和可靠性完全相同。

GLM-5.3-Flash 模型页负责维护 OmniaKey 当前报价与路由状态。本文不会假设 glm-5.3-flashx 已经接入 OmniaKey 或其它网关;改客户端前请查看实时模型目录

200 tokens/s 到底证明了什么?

Z.ai 没有说明 200 tokens/s 是峰值、平均值还是中位数,也没有披露区域、Prompt、输出长度、并发、Reasoning token 统计方式和 p95。页面同样没有首 token 延迟。

text
端到端延迟
  = 排队时间
  + Prompt 处理与首 token 时间
  + 生成 token 数 / 解码吞吐
  + 工具与网络时间

如果能始终保持 200 tokens/s,生成 100 个 token 的纯解码时间是 0.5 秒,1,000 个是 5 秒,4,000 个是 20 秒。这只是算术,不是 FlashX 实测,并且排除了上面的其它时间。短回答可能主要受首 token 影响,超长 Prompt 则可能主要受 Prefill 影响。

真正该问的是:在你的输入长度、输出长度、工具、并发和区域条件下,FlashX 是否降低了端到端 p50 与 p95。

独立数据只覆盖普通 Flash

Artificial Analysis 目前为 Z.ai API 上的普通 GLM-5.3-Flash 报告了以下结果:

指标普通 Flash 结果范围
Intelligence Index41.9独立评估
输出速度中位数98.6 tokens/sZ.ai API 样本
首个数据块时间中位数2.43 秒Z.ai API 样本
Intelligence 评测单任务成本$0.253评测方任务组合

不是 FlashX 测试。用 Z.ai 的 200 宣传值除以第三方的 98.6 中位数,再声称 FlashX “快 2.03 倍”,是在混用不同方法、日期、工作负载和流量条件。

Z.ai 还为底层 Flash 家族报告了 Terminal-Bench 2.1 84.3、DeepSWE v1.1 63.4、NL2Repo 56.3、AutomationBench 48.8。这些是厂商运行的 GLM-5.3-Flash benchmark,不是 FlashX 质量提升的证据。完整代际选型请看 GLM-5.3 与 GLM-5.2 编程对比

GLM-5.3-FlashX API 价格

Z.ai 直连 API 的美元价格如下,单位均为每百万 token:

模型输入缓存输入缓存存储输出
GLM-5.3-Flash$0.15$0.03限时免费$0.50
GLM-5.3-FlashX$0.37$0.075限时免费$1.25
GLM-5.3$1.40$0.26限时免费$4.40

FlashX 非缓存输入价格是普通 Flash 的 2.47 倍,缓存输入与输出都是 2.5 倍,但仍远低于完整版 GLM-5.3。“限时免费”只指当前缓存存储活动,不是永久合同,也不等于免收缓存输入读取费。

成本算例:10 万输入 + 2 万输出

工作量FlashFlashX完整版 GLM-5.3
10 万非缓存输入 + 2 万输出$0.0250$0.0620$0.2280
2 万非缓存 + 8 万缓存输入 + 2 万输出$0.0154$0.0384$0.1368
非缓存算例运行 1,000 次$25.00$62.00$228.00

在非缓存算例中,FlashX 每次多花 $0.037。若综合人工成本为每小时 $30,这相当于约 4.4 秒人工时间。它是有用的盈亏门槛,但不能证明 FlashX 一定为你的任务节省 4.4 秒。

架构与接入边界

底层 GLM-5.3-Flash 有 320B 总参数,每 token 激活 18B 参数,在 45 层中结合稀疏与线性注意力,并使用 30T-token 多模态语料训练。Z.ai 表示,相比 GLM-5.3,注意力计算减少 3.01 倍,KV Cache 占用减少 4.44 倍。这些是 Flash 家族特性,不是 FlashX 独有改动。

普通 Flash 权重以 MIT 许可证开放;在本文核验的来源中,FlashX 只作为托管模型 ID 出现。文档参数与家族一致:Thinking 不能关闭;交互任务建议使用 temperature: 1top_p: 0.95reasoning_effort: maxclear_thinking: falsestream: truetool_stream: true

迁移前要处理四个限制:

  1. 仍发送 thinking.type: "disabled" 的客户端必须先修改。
  2. 即使解码很快,reasoning_effort: max 也可能增加推理 token 与总耗时。
  3. 多模态输入仍需检查尺寸、格式、隐私与保留策略。
  4. 普通 Flash 已加入 GLM Coding Plan;FlashX 在核验时尚未包含。

应该选择哪条路由?

工作负载优先测试原因
交互式编程或排错FlashX人需要等待推理、工具与输出
输出较长的客服助手FlashX,并先测 p95尾延迟直接影响体验
Computer Use 或 Browser UseFlashX,并先测成功率每一步都会阻塞下一轮观察与动作
夜间审查或 CI 分析Flash通常没人逐 token 等待
批量抽取、分类或合成数据Flash没有交互收益时,2.5 倍溢价会不断累积
失败代价很高的难题同时比较 Flash、FlashX 和完整 GLM-5.3单任务验收质量可能比速度与单价更重要
GLM Coding Plan 工作流Flash当前 Plan 不包含 FlashX

生产路由可以同时使用两个 ID:只让交互关键路径走 FlashX;重试、索引、摘要和后处理继续用普通 Flash。

如何正确评测 FlashX

  1. 固定有代表性的短、中、长、工具密集与多模态任务。
  2. 把完全相同且不可变的 Prompt 与工具策略发给两个精确模型 ID。
  3. 随机安排请求顺序,并保持区域与测试时段一致。
  4. 记录首个数据块、解码速度、端到端时间及 p50/p95。
  5. 记录输入、缓存输入、Reasoning、输出 token 与账单成本。
  6. 评估验收结果、工具调用合法性、重试、错误与人工修复。
  7. 在真实并发下重复足够次数,让方差暴露出来。

核心指标应是在满足延迟预算时,每个验收通过任务的总成本。原始 tokens/s 变快,完整工作流仍可能因首 token 慢、推理更长、工具失败或重试而变差。编程 Agent 模型指南解释了为什么模型与 Agent harness 必须一起测试。

最终结论

GLM-5.3-FlashX 最适合被理解为 GLM-5.3-Flash 家族的付费快速通道。200 tokens/s 宣传值很有吸引力,对不少交互请求而言,2.5 倍溢价的绝对金额也很小;但公开证据没有证明它是新的能力档位、保证快 2 倍,或提供端到端延迟 SLA。

只在等待时间有明确价值的地方使用 FlashX,其它场景继续以普通 Flash 作为成本基线;失败代价高时,再单独比较完整 GLM-5.3。

常见问题

FlashX 比 GLM-5.3-Flash 更聪明吗?

现有公开证据没有证明这一点。Z.ai 公布了共享能力和 Flash 家族 benchmark,却没有同条件 FlashX 对 Flash 质量结果,也没有单独的 FlashX checkpoint。

GLM-5.3-FlashX 真的能到 200 tokens/s 吗?

这是 Z.ai 的官方宣传数字。方法、分位数、区域、并发、Prompt 形态与首 token 延迟均未披露,本文也没有独立复现。

FlashX API 多少钱?

Z.ai 列出的价格为每百万非缓存输入 $0.37、缓存输入 $0.075、输出 $1.25,约为普通 Flash 的 2.5 倍。

FlashX 支持 1M 上下文和图片吗?

支持。共享模型页记录了 1M 上下文、最大 128K 输出,以及视频、图片、文字与文件输入。长上下文本身不等于低延迟。

FlashX 在 GLM Coding Plan 中或开放权重了吗?

核验时都没有。普通 Flash 已加入 Plan 并开放 MIT 权重;核验来源只把 FlashX 列为托管路由,没有单独公开 checkpoint。

一手来源

证据与计算于 2026 年 9 月 19 日核验。模型 ID、价格、Plan 权限、延迟与网关可用性都可能变化;迁移生产流量前请重新检查一手来源并运行同条件测试。