Обзор GLM-5.3-FlashX
FlashX продаёт меньшее ожидание, а не доказанный новый уровень интеллекта. Цена примерно в 2,5 раза выше оправдана только на чувствительных к задержке путях.
Этот обзор GLM-5.3-FlashX отделяет более быстрый хостинговый маршрут от более сильной модели. Z.ai заявляет 200 tokens/s, но не публикует парное сравнение качества Flash и FlashX, распределение задержки или методику измерения этой цифры.
Практический вывод прост: FlashX стоит тестировать, когда человек ждёт длинный потоковый ответ или интерактивный цикл инструментов. Для пакетных заданий, фоновых агентов и офлайн-оценок обычный Flash остаётся разумной базой, поскольку оплата примерно в 2,5 раза больше за token редко создаёт измеримую ценность.
Факты проверены 19 сентября 2026 года. Мы изучили документацию модели, цены API, отчёт о запуске и открытую карточку Z.ai, а также данные Artificial Analysis для обычного GLM-5.3-Flash. У нас не было оплачиваемого доступа к FlashX, мы не проводили собственный тест задержки и не выдаём 200 tokens/s за независимый результат.
Краткий вердикт
- Сначала тестировать FlashX: интерактивная разработка, живой поиск, Computer Use, клиентские ассистенты и длинная потоковая выдача.
- Оставить Flash вариантом по умолчанию: очереди, извлечение документов, ночное ревью, синтетические данные и массовая автоматизация.
- Не переходить только ради качества: Z.ai не показывает отдельный checkpoint FlashX или парное доказательство лучшего ответа.
FlashX и Flash: главное
| Критерий | GLM-5.3-FlashX | GLM-5.3-Flash |
|---|---|---|
| ID модели API | glm-5.3-flashx | glm-5.3-flash |
| Роль в документации | Более быстрый хостинговый маршрут | Более дешёвый маршрут и открытые веса |
| Данные о скорости | Z.ai заявляет 200 tokens/s без методики | Artificial Analysis измерила медиану 98.6 tokens/s |
| Ввод / кэш / вывод | $0.37 / $0.075 / $1.25 за 1M tokens | $0.15 / $0.03 / $0.50 |
| Контекст / максимум вывода | 1M / 128K tokens | 1M / 128K tokens |
| Входные данные | Видео, изображения, текст и файлы | Видео, изображения, текст и файлы |
| Thinking | Обязателен, отключить нельзя | Обязателен, отключить нельзя |
| GLM Coding Plan | Не входил на дату проверки | Входит с квотой в 3 раза больше GLM-5.3 |
| Публичные веса | Отдельный checkpoint не указан | zai-org/GLM-5.3-Flash, MIT |
Общая документация подтверждает одинаковый публичный контракт возможностей. Она не доказывает идентичность внутреннего serving, стабильности ответов, tool calls и надёжности.
Текущую цену и статус в OmniaKey определяют страница GLM-5.3-Flash и живой каталог моделей. Наличие glm-5.3-flashx у Z.ai не означает, что тот же ID уже доступен через любой gateway.
Что на самом деле доказывают 200 tokens/s
Z.ai не сообщает, являются ли 200 пиковым, средним или медианным значением. Не раскрыты регион, prompt, длина вывода, параллелизм, учёт reasoning tokens и p95. Времени до первого token тоже нет.
сквозная задержка
= ожидание в очереди
+ обработка prompt и первый token
+ сгенерированные tokens / скорость декодирования
+ время инструментов и сети
При идеально стабильных 200 tokens/s декодирование 100 tokens занимает 0.5 секунды, 1,000 — 5 секунд, 4,000 — 20 секунд. Это арифметика, а не измерение FlashX. Для коротких ответов решающим может быть первый token, для длинных prompt — prefill.
Независимые данные есть только для Flash
Artificial Analysis приводит для обычного Flash через API Z.ai следующие результаты:
| Метрика | Обычный Flash | Область |
|---|---|---|
| Intelligence Index | 41.9 | Независимая оценка |
| Медианная скорость вывода | 98.6 tokens/s | Выборка API Z.ai |
| Медиана до первого chunk | 2.43 секунды | Выборка API Z.ai |
| Стоимость одной задачи оценки | $0.253 | Набор задач оценщика |
Это не тест FlashX. Делить рекламные 200 Z.ai на независимую медиану 98.6 и заявлять «в 2.03 раза быстрее» нельзя: методики, даты, нагрузки и условия трафика различаются.
Z.ai также сообщает для семейства Flash 84.3 в Terminal-Bench 2.1, 63.4 в DeepSWE v1.1, 56.3 в NL2Repo и 48.8 в AutomationBench. Это vendor-run результаты GLM-5.3-Flash, а не доказательство повышения качества FlashX. Выбор поколения разобран в сравнении GLM-5.3 и GLM-5.2 для программирования.
Цены API и пример расчёта
Z.ai указывает следующие прямые цены в долларах за миллион tokens:
| Модель | Ввод | Кэшированный ввод | Хранение кэша | Вывод |
|---|---|---|---|---|
| GLM-5.3-Flash | $0.15 | $0.03 | Временно бесплатно | $0.50 |
| GLM-5.3-FlashX | $0.37 | $0.075 | Временно бесплатно | $1.25 |
| GLM-5.3 | $1.40 | $0.26 | Временно бесплатно | $4.40 |
Некэшированный ввод FlashX стоит в 2.47 раза дороже, кэшированный ввод и вывод — ровно в 2.5 раза дороже Flash. Временная бесплатность относится к хранению кэша, а не отменяет плату за чтение кэшированного ввода.
100K некэшированных входных tokens и 20K выходных стоят $0.0250 на Flash, $0.0620 на FlashX и $0.2280 на полном GLM-5.3. При 80K кэшированных и 20K некэшированных входных tokens цены равны $0.0154 / $0.0384 / $0.1368. Тысяча запусков первого случая стоит $25.00 / $62.00 / $228.00.
Доплата за FlashX составляет $0.037 за запуск. При полной стоимости труда $30 в час это около 4.4 секунды. Это полезный порог решения, но не измерение экономии 4.4 секунды.
Архитектура и ограничения интеграции
В основе GLM-5.3-Flash — 320B параметров всего и 18B активных на token, 45 слоёв и обучение на мультимодальном корпусе в 30T tokens. Модель объединяет sparse и linear attention. Z.ai заявляет в 3.01 раза меньше вычислений attention и в 4.44 раза меньше KV Cache, чем у GLM-5.3. Это свойства семейства Flash, а не эксклюзивные изменения FlashX.
Веса обычного Flash опубликованы по MIT. В проверенных источниках FlashX встречается только как хостинговый ID. Thinking нельзя отключить; Z.ai рекомендует temperature: 1, top_p: 0.95, reasoning_effort: max, clear_thinking: false, stream: true и tool_stream: true для интерактивной работы.
Клиент с thinking.type: "disabled" нужно сначала изменить. reasoning_effort: max может увеличить reasoning tokens и общее время даже при быстром декодировании. Для мультимодального ввода по-прежнему нужны проверки размера, формата, приватности и хранения.
Какой маршрут выбрать
| Нагрузка | Начать с | Причина |
|---|---|---|
| Интерактивное программирование и отладка | FlashX | Человек ждёт reasoning, инструменты и вывод |
| Клиентский ассистент с длинными ответами | FlashX после теста p95 | Хвостовая задержка влияет на опыт |
| Computer Use или Browser Use | FlashX после теста успеха | Каждый ход блокирует следующее действие |
| Ночное ревью или анализ CI | Flash | Обычно никто не ждёт каждый token |
| Массовое извлечение, классификация, синтетика | Flash | Цена 2.5x копится без интерактивной выгоды |
| Сложная задача с дорогой ошибкой | Сравнить Flash, FlashX и GLM-5.3 | Приёмка может быть важнее скорости и тарифа |
| Работа в GLM Coding Plan | Flash | FlashX сейчас не входит в план |
В production можно использовать оба ID: FlashX только на критическом интерактивном пути, Flash — для retry, индексации, сводок и постобработки.
Как корректно сравнить FlashX
- Зафиксировать короткие, длинные, tool-heavy и мультимодальные задачи с критериями приёмки.
- Отправить одинаковый неизменный prompt и tool policy обоим точным ID.
- Случайно чередовать порядок, сохраняя регион и временные окна.
- Записывать первый chunk, скорость, полное время и p50/p95.
- Записывать ввод, кэш, reasoning, вывод и фактическую стоимость.
- Оценивать приёмку, tool calls, retry, ошибки и правки человека.
- Повторить при реалистичном параллелизме, чтобы увидеть разброс.
Главная метрика — стоимость принятой задачи в пределах требуемой задержки. Почему модель и Agent harness нужно тестировать вместе, объясняет гайд по моделям для coding-агентов.
Итог
GLM-5.3-FlashX лучше всего понимать как платную скоростную полосу семейства Flash. 200 tokens/s выглядят многообещающе, а абсолютная доплата для интерактивного запроса может быть небольшой. Но публичные данные не доказывают новый уровень интеллекта, гарантированное ускорение в 2 раза или сквозной SLA.
Используйте FlashX там, где ожидание имеет измеримую цену, а в остальных задачах оставьте Flash базой по стоимости.
Частые вопросы
FlashX умнее обычного Flash?
Публичных доказательств нет. Есть общие возможности и benchmark семейства, но нет парного сравнения качества или отдельного checkpoint FlashX.
Он действительно выдаёт 200 tokens/s?
Это официальная цифра Z.ai. Методика, процентиль, регион, параллелизм, форма prompt и первый token не раскрыты; этот обзор её не воспроизводил.
Сколько стоит FlashX?
$0.37 за миллион некэшированных входных tokens, $0.075 за кэшированный ввод и $1.25 за вывод — примерно в 2.5 раза дороже Flash.
Поддерживаются контекст 1M и изображения?
Да. Общая страница документирует контекст 1M, до 128K вывода и видео, изображения, текст и файлы на входе. Длинный контекст не гарантирует низкую задержку.
Первичные источники
- Документация Z.ai по GLM-5.3-Flash и FlashX (англ.)
- Цены API Z.ai (англ.)
- Отчёт о запуске GLM-5.3-Flash (англ.)
- Открытая карточка GLM-5.3-Flash (англ.)
- Данные Artificial Analysis (англ.)
Данные и расчёты проверены 19 сентября 2026 года. ID, цены, доступ к Plan, задержка и наличие в gateway могут измениться; перед production перепроверьте первичные источники и проведите парный тест.