主要な画像モデルに対応しました · GPT-Image、Nano Banana、Seedream など
ブログ
ガイド

GLM-5.3-FlashX レビュー

FlashX が提供するのは実証済みの新しい知能段階ではなく待ち時間の短縮です。約2.5倍の料金は、遅延が重要な処理に限って検討すべきです。

読了目安 12分OmniaKey
GLM-5.3-FlashXGLM-5.3-FlashAPI レイテンシAPI 価格モデルレビュー

この GLM-5.3-FlashX レビューでは、「高速なホスト型ルート」と「より賢いモデル」を分けて評価します。Z.ai は 200 tokens/s を掲げていますが、Flash と FlashX を同条件で比べた品質テスト、遅延分布、その数値の測定方法は公開していません。

結論は明快です。長いストリーミング回答や対話型ツールループを人が待つ場面では FlashX を試す価値があります。バッチ、バックグラウンド Agent、オフライン評価では、token 単価が約2.5倍になる通常版 Flash からの切り替えを正当化しにくいでしょう。

ファクトチェック:2026年9月19日。 Z.ai のモデル資料、API 価格、リリース記事、公開モデルカードと、通常版 GLM-5.3-Flash に対する Artificial Analysis のデータを確認しました。有料 FlashX の資格情報はなく、第一手のレイテンシテストは実施していません。200 tokens/s を独立検証済みの結果として扱いません。

先に知るべき結論

  • FlashX を先に試す用途: 対話型コーディング、ライブ調査、Computer Use、顧客向けアシスタント、長いストリーミング出力。
  • 通常版 Flash を維持する用途: キュー処理、文書抽出、夜間レビュー、合成データ、大量自動化。
  • 品質だけを理由に変更しない: Z.ai は FlashX 専用 checkpoint や、同条件で回答品質が上がることを示す比較を公開していません。

FlashX と Flash の主要仕様

判断項目GLM-5.3-FlashXGLM-5.3-Flash
API モデル IDglm-5.3-flashxglm-5.3-flash
位置づけ高速なホスト型ルート低価格なホスト型ルートと公開 weight
速度の根拠Z.ai が 200 tokens/s と表記。方法は非公開Artificial Analysis の中央値は 98.6 tokens/s
入力 / キャッシュ入力 / 出力1M token あたり $0.37 / $0.075 / $1.25$0.15 / $0.03 / $0.50
コンテキスト / 最大出力1M / 128K token1M / 128K token
入力動画、画像、テキスト、ファイル動画、画像、テキスト、ファイル
Thinking常時有効。無効化不可常時有効。無効化不可
GLM Coding Plan確認時点では対象外GLM-5.3 の3倍枠で対象
公開 weight専用 checkpoint の記載なしzai-org/GLM-5.3-Flash、MIT

共有仕様は公開 API 契約が同じであることを示しますが、内部の serving、出力の一貫性、tool call、障害率まで同じだとは証明しません。

OmniaKey の現在価格と利用可否は GLM-5.3-Flash モデルページ最新モデル一覧が基準です。Z.ai に glm-5.3-flashx が存在しても、各 gateway で同じ ID が利用できるとは限りません。

200 tokens/s が示す範囲

Z.ai は 200 が peak、mean、median のどれか、使用地域、prompt と出力長、同時実行数、reasoning token の扱い、p95 を説明していません。Time to First Token も示されていません。

text
エンドツーエンド遅延
  = 待ち行列
  + prompt 処理と最初の token
  + 生成 token 数 / decode throughput
  + tool と network の時間

200 tokens/s が完全に持続すると仮定すれば、100 token の decode は0.5秒、1,000 token は5秒、4,000 token は20秒です。これは計算であり、FlashX の実測ではありません。短い回答は最初の token、長い prompt は prefill が支配する場合があります。

独立データは通常版 Flash のみ

Artificial Analysis が Z.ai API 上の通常版 Flash に対して報告している値は次の通りです。

指標通常版 Flash範囲
Intelligence Index41.9独立評価
出力速度の中央値98.6 tokens/sZ.ai API sample
最初の chunk までの中央値2.43秒Z.ai API sample
Intelligence 評価の1 task あたり費用$0.253評価側の task 構成

これは FlashX テストではありません。Z.ai の 200 と第三者の 98.6 を割って「2.03倍高速」とするのは、方法、日付、負荷、トラフィック条件の異なる数値を混ぜることになります。

Z.ai は基盤モデルについて Terminal-Bench 2.1 で84.3、DeepSWE v1.1 で63.4、NL2Repo で56.3、AutomationBench で48.8を報告しています。これらは vendor-run の GLM-5.3-Flash 結果であり、FlashX の品質向上を示すものではありません。世代間の判断は GLM-5.3 と GLM-5.2 のコーディング比較で扱っています。

API 価格とコスト例

Z.ai 直結 API の価格は、100万 token あたり次の通りです。

モデル入力キャッシュ入力キャッシュ保存出力
GLM-5.3-Flash$0.15$0.03期間限定無料$0.50
GLM-5.3-FlashX$0.37$0.075期間限定無料$1.25
GLM-5.3$1.40$0.26期間限定無料$4.40

FlashX は通常版 Flash に対して未キャッシュ入力が2.47倍、キャッシュ入力と出力が2.5倍です。「期間限定無料」はキャッシュ保存のキャンペーンであり、キャッシュ読み取り料金が無料という意味ではありません。

100K の未キャッシュ入力と20Kの出力では、Flash が $0.0250、FlashX が $0.0620、完全版 GLM-5.3 が $0.2280 です。80Kがキャッシュ済みで20Kだけ未キャッシュなら、それぞれ $0.0154 / $0.0384 / $0.1368 になります。未キャッシュ例を1,000回実行すると $25.00 / $62.00 / $228.00 です。

FlashX の追加費用は1回 $0.037。人件費を1時間 $30 とすると約4.4秒分です。これは有用な損益分岐点ですが、実際に4.4秒短縮できるという測定結果ではありません。

アーキテクチャと統合時の制約

基盤の GLM-5.3-Flash は 総320B、token あたり18Bを有効化する45層モデルです。30T-token のマルチモーダルデータで学習され、sparse attention と linear attention を組み合わせます。Z.ai は GLM-5.3 比で attention 計算を3.01倍、KV Cache を4.44倍削減したと説明します。これは Flash family の性質で、FlashX 専用の変更ではありません。

通常版 Flash の weight は MIT で公開されています。FlashX は確認した資料では hosted model ID のみです。Thinking は無効化できず、対話用途の推奨値は temperature: 1top_p: 0.95reasoning_effort: maxclear_thinking: falsestream: truetool_stream: true です。

thinking.type: "disabled" を送る client は先に変更が必要です。また reasoning_effort: max は reasoning token と全体時間を増やすことがあります。画像などの入力にはサイズ、形式、privacy、保存方針の確認も必要です。

用途別の選び方

Workload最初の候補理由
対話型 coding / debuggingFlashX人が reasoning、tool、出力を待つ
長文の顧客向け assistantp95 測定後に FlashXtail latency が体感を左右する
Computer Use / Browser Use成功率測定後に FlashX各 turn が次の action を止める
夜間 review / CI 分析Flashtoken ごとに待つ人がいない
大量抽出、分類、合成データFlash対話価値なしに2.5倍料金が積み上がる
失敗が高価な難問Flash、FlashX、完全版を比較合格率が速度や単価より重要になり得る
GLM Coding PlanFlashFlashX は現在対象外

本番では両方を使えます。対話の critical path だけ FlashX にし、retry、indexing、summary、後処理は通常版 Flash に残します。

正しく比較する手順

  1. 短文、長文、tool-heavy、multimodal の代表 task と合格条件を固定します。
  2. 同じ prompt と tool policy を2つの正確な ID に送ります。
  3. 順序を randomize し、region と時間帯をそろえます。
  4. First chunk、decode speed、end-to-end、p50/p95 を記録します。
  5. 入力、cache、reasoning、出力 token と請求額を記録します。
  6. 合格率、tool call、retry、error、人手修正を評価します。
  7. 実運用の concurrency で繰り返します。

主要指標は、必要な遅延予算内での合格 task あたり総費用です。Model と Agent harness を一緒に試す理由は coding Agent モデルガイド(英語)で説明しています。

最終評価

GLM-5.3-FlashX は、GLM-5.3-Flash family の有料 fast lane と考えるのが適切です。200 tokens/s は魅力的で、対話リクエスト1件あたりの追加額は小さい場合があります。しかし、新しい知能段階、常に2倍の高速化、end-to-end SLA を示す公開証拠はありません。

待ち時間に明確な価値がある処理だけ FlashX を使い、それ以外は通常版 Flash を費用基準にしてください。

よくある質問

FlashX は通常版 Flash より賢いですか?

それを示す公開証拠はありません。共有仕様と Flash family の benchmark はありますが、同条件の品質比較や FlashX 専用 checkpoint はありません。

本当に 200 tokens/s ですか?

Z.ai の公式表示ですが、方法、percentile、region、concurrency、prompt、最初の token は非公開で、この記事でも再現していません。

FlashX の価格はいくらですか?

100万 token あたり未キャッシュ入力 $0.37、キャッシュ入力 $0.075、出力 $1.25です。通常版 Flash の約2.5倍です。

1M context と画像に対応しますか?

はい。共有ページでは 1M context、最大128K出力、動画、画像、text、file 入力が記載されています。長い context は低遅延の保証ではありません。

一次情報

証拠と計算は2026年9月19日に確認しました。ID、料金、Plan、遅延、gateway の利用可否は変わるため、本番移行前に一次情報と同条件テストを再確認してください。