Ulasan GLM-5.3-FlashX
FlashX menjual waktu tunggu yang lebih singkat, bukan tingkat kecerdasan baru yang sudah terbukti. Harga sekitar 2,5 kali lipat hanya cocok untuk jalur sensitif latensi.
Ulasan GLM-5.3-FlashX ini memisahkan rute hosted yang lebih cepat dari model yang lebih baik. Z.ai mengiklankan 200 tokens/s, tetapi belum menerbitkan uji kualitas Flash versus FlashX dengan kondisi sama, distribusi latensi, atau metode pengukuran angka tersebut.
Kesimpulan praktisnya sederhana: uji FlashX ketika seseorang menunggu jawaban streaming panjang atau loop alat interaktif. Pertahankan Flash untuk batch, agent latar belakang, dan evaluasi offline, karena membayar sekitar 2,5 kali per token jarang menghasilkan nilai terukur di sana.
Fakta diperiksa pada 19 September 2026. Kami memakai dokumentasi model, harga API, laporan peluncuran, dan model card terbuka Z.ai, serta data Artificial Analysis untuk GLM-5.3-Flash reguler. Kami tidak memiliki kredensial FlashX yang dapat ditagih, tidak menjalankan pengujian latensi sendiri, dan tidak menyajikan 200 tokens/s sebagai hasil independen.
Kesimpulan singkat
- Uji FlashX lebih dulu: coding interaktif, riset langsung, Computer Use, asisten pelanggan, dan keluaran streaming panjang.
- Pertahankan Flash sebagai pilihan hemat: antrean, ekstraksi dokumen, review malam, data sintetis, dan otomatisasi bervolume tinggi.
- Jangan pindah hanya demi kualitas: Z.ai tidak menerbitkan checkpoint FlashX terpisah atau hasil berpasangan yang membuktikan jawaban lebih baik.
FlashX dibanding Flash
| Pertimbangan | GLM-5.3-FlashX | GLM-5.3-Flash |
|---|---|---|
| ID model API | glm-5.3-flashx | glm-5.3-flash |
| Peran terdokumentasi | Rute hosted lebih cepat | Rute hemat dan model open-weight |
| Bukti kecepatan | Z.ai mengiklankan 200 tokens/s tanpa metode | Median Artificial Analysis 98.6 tokens/s |
| Input / cache / output | $0.37 / $0.075 / $1.25 per 1M token | $0.15 / $0.03 / $0.50 |
| Konteks / output maksimum | 1M / 128K token | 1M / 128K token |
| Input | Video, gambar, teks, dan file | Video, gambar, teks, dan file |
| Thinking | Wajib; tidak dapat dimatikan | Wajib; tidak dapat dimatikan |
| GLM Coding Plan | Belum termasuk saat diperiksa | Termasuk dengan kuota 3 kali GLM-5.3 |
| Bobot publik | Tidak ada checkpoint khusus | zai-org/GLM-5.3-Flash, MIT |
Dokumentasi bersama mendukung kontrak kemampuan publik yang sama. Itu tidak membuktikan bahwa serving internal, konsistensi keluaran, tool call, atau keandalannya identik.
Halaman model GLM-5.3-Flash memegang harga dan status rute OmniaKey terkini. Adanya glm-5.3-flashx di Z.ai tidak berarti ID yang sama tersedia di setiap gateway; periksa katalog model langsung sebelum mengubah client.
Apa yang benar-benar dibuktikan oleh 200 tokens/s?
Z.ai tidak menjelaskan apakah 200 adalah peak, mean, atau median; wilayah, prompt, panjang output, concurrency, perhitungan reasoning token, dan p95 juga tidak diberikan. Waktu menuju token pertama pun tidak tersedia.
latensi ujung ke ujung
= waktu antre
+ pemrosesan prompt dan token pertama
+ token yang dihasilkan / throughput decode
+ waktu alat dan jaringan
Jika 200 tokens/s bertahan sempurna, 100 token membutuhkan 0.5 detik untuk decode, 1,000 membutuhkan 5 detik, dan 4,000 membutuhkan 20 detik. Ini aritmetika, bukan pengukuran FlashX. Jawaban pendek bisa didominasi token pertama, sedangkan prompt panjang oleh prefill.
Data independen hanya tersedia untuk Flash
Artificial Analysis melaporkan hasil berikut untuk Flash reguler melalui API Z.ai:
| Metrik | Flash reguler | Cakupan |
|---|---|---|
| Intelligence Index | 41.9 | Evaluasi independen |
| Median kecepatan output | 98.6 tokens/s | Sampel API Z.ai |
| Median waktu ke chunk pertama | 2.43 detik | Sampel API Z.ai |
| Biaya per tugas evaluasi | $0.253 | Campuran tugas evaluator |
Ini bukan pengujian FlashX. Membagi angka promosi 200 milik Z.ai dengan median independen 98.6 lalu menyebutnya “2.03 kali lebih cepat” akan mencampur metode, tanggal, workload, dan kondisi lalu lintas yang berbeda.
Z.ai juga melaporkan 84.3 pada Terminal-Bench 2.1, 63.4 pada DeepSWE v1.1, 56.3 pada NL2Repo, dan 48.8 pada AutomationBench untuk keluarga Flash. Hasil vendor-run GLM-5.3-Flash ini bukan bukti peningkatan kualitas FlashX. Perbandingan coding GLM-5.3 dan GLM-5.2 membahas keputusan antargenerasi.
Harga API dan contoh biaya
Z.ai mencantumkan harga API langsung berikut dalam USD per satu juta token:
| Model | Input | Input cache | Penyimpanan cache | Output |
|---|---|---|---|---|
| GLM-5.3-Flash | $0.15 | $0.03 | Gratis untuk waktu terbatas | $0.50 |
| GLM-5.3-FlashX | $0.37 | $0.075 | Gratis untuk waktu terbatas | $1.25 |
| GLM-5.3 | $1.40 | $0.26 | Gratis untuk waktu terbatas | $4.40 |
FlashX berharga 2.47 kali Flash untuk input tanpa cache dan tepat 2.5 kali untuk input cache serta output. Penyimpanan cache gratis bersifat promosi dan tidak menghapus biaya baca input cache.
Untuk 100K input tanpa cache dan 20K output, Flash berbiaya $0.0250, FlashX $0.0620, dan GLM-5.3 penuh $0.2280. Jika 80K sudah di-cache dan 20K tidak, biayanya $0.0154 / $0.0384 / $0.1368. Seribu eksekusi kasus tanpa cache berbiaya $25.00 / $62.00 / $228.00.
FlashX menambah $0.037 per eksekusi. Dengan biaya tenaga kerja $30 per jam, itu setara sekitar 4.4 detik. Ini ambang keputusan, bukan pengukuran bahwa FlashX menghemat 4.4 detik.
Arsitektur dan batas integrasi
GLM-5.3-Flash memiliki 320B parameter total dan 18B aktif per token, 45 layer, serta pelatihan multimodal 30T-token. Model menggabungkan sparse attention dan linear attention. Z.ai menyatakan komputasi attention 3.01 kali lebih rendah dan KV Cache 4.44 kali lebih kecil dibanding GLM-5.3. Ini sifat keluarga Flash, bukan perubahan khusus FlashX.
Bobot Flash reguler tersedia dengan lisensi MIT. Dalam sumber yang diperiksa, FlashX hanya tampil sebagai ID hosted. Thinking tidak dapat dimatikan; Z.ai merekomendasikan temperature: 1, top_p: 0.95, reasoning_effort: max, clear_thinking: false, stream: true, dan tool_stream: true untuk penggunaan interaktif.
Client yang mengirim thinking.type: "disabled" harus diubah lebih dulu. reasoning_effort: max dapat menambah reasoning token dan waktu total walau decode cepat. Input multimodal tetap memerlukan pemeriksaan ukuran, format, privasi, dan retensi.
Rute mana yang dipilih?
| Workload | Mulai dengan | Alasan |
|---|---|---|
| Coding atau debugging interaktif | FlashX | Seseorang menunggu reasoning, alat, dan output |
| Asisten pelanggan dengan jawaban panjang | FlashX setelah uji p95 | Tail latency memengaruhi pengalaman |
| Computer Use atau Browser Use | FlashX setelah uji keberhasilan | Setiap giliran menghambat aksi berikutnya |
| Review malam atau analisis CI | Flash | Biasanya tidak ada orang menunggu tiap token |
| Ekstraksi, klasifikasi, data sintetis massal | Flash | Harga 2.5 kali menumpuk tanpa manfaat interaktif |
| Tugas sulit dengan kegagalan mahal | Bandingkan Flash, FlashX, dan GLM-5.3 | Tingkat penerimaan bisa lebih penting dari kecepatan dan tarif |
| Alur GLM Coding Plan | Flash | FlashX saat ini tidak termasuk |
Router produksi dapat memakai kedua ID: FlashX hanya untuk jalur interaktif kritis, sedangkan retry, indexing, ringkasan, dan pascaproses tetap di Flash.
Cara membandingkan FlashX dengan benar
- Bekukan tugas pendek, panjang, tool-heavy, dan multimodal beserta kriteria penerimaannya.
- Kirim prompt tetap dan kebijakan alat yang sama ke kedua ID persis.
- Acak urutan serta samakan wilayah dan jendela waktu.
- Catat chunk pertama, kecepatan decode, waktu total, serta p50/p95.
- Catat input, cache, reasoning, output, dan biaya tertagih.
- Nilai hasil diterima, tool call, retry, error, dan koreksi manusia.
- Ulangi pada concurrency realistis agar variasi terlihat.
Metrik utama harus biaya per tugas yang diterima dalam anggaran latensi. Panduan model untuk coding agent (bahasa Inggris) menjelaskan mengapa model dan Agent harness harus diuji bersama.
Kesimpulan akhir
GLM-5.3-FlashX paling tepat dipahami sebagai jalur cepat berbayar untuk keluarga Flash. Klaim 200 tokens/s menjanjikan, dan tambahan biaya absolut bisa kecil untuk permintaan interaktif. Bukti publik tidak menunjukkan tingkat kecerdasan baru, kecepatan 2 kali yang dijamin, atau SLA ujung ke ujung.
Gunakan FlashX ketika waktu tunggu punya nilai terukur; pertahankan Flash sebagai dasar biaya di tempat lain.
Pertanyaan umum
Apakah FlashX lebih pintar dari Flash?
Tidak ada bukti publik. Ada kemampuan bersama dan benchmark keluarga, tetapi tidak ada perbandingan kualitas berpasangan atau checkpoint FlashX terpisah.
Benarkah mencapai 200 tokens/s?
Itu klaim resmi Z.ai. Metode, persentil, wilayah, concurrency, bentuk prompt, dan token pertama tidak dipublikasikan; ulasan ini juga tidak mereproduksinya.
Berapa harga FlashX?
$0.37 per juta token input tanpa cache, $0.075 untuk input cache, dan $1.25 untuk output, sekitar 2.5 kali harga Flash.
Apakah mendukung konteks 1M dan gambar?
Ya. Halaman bersama mendokumentasikan konteks 1M, output hingga 128K, serta input video, gambar, teks, dan file. Konteks panjang bukan jaminan latensi rendah.
Sumber utama
- Dokumentasi Z.ai GLM-5.3-Flash dan FlashX (bahasa Inggris)
- Harga API Z.ai (bahasa Inggris)
- Laporan peluncuran GLM-5.3-Flash (bahasa Inggris)
- Model card terbuka GLM-5.3-Flash (bahasa Inggris)
- Hasil Artificial Analysis (bahasa Inggris)
Bukti dan perhitungan diperiksa pada 19 September 2026. ID, harga, akses Plan, latensi, dan ketersediaan gateway dapat berubah; periksa ulang sumber dan jalankan uji berpasangan sebelum memindahkan trafik produksi.