Ведущие модели изображений уже доступны · GPT-Image, Nano Banana, Seedream и другие
Блог
Гайд

Обзор GLM-5.3-FlashX

FlashX продаёт меньшее ожидание, а не доказанный новый уровень интеллекта. Цена примерно в 2,5 раза выше оправдана только на чувствительных к задержке путях.

12 мин чтенияOmniaKey
GLM-5.3-FlashXGLM-5.3-Flashзадержка APIцены APIобзор модели

Этот обзор GLM-5.3-FlashX отделяет более быстрый хостинговый маршрут от более сильной модели. Z.ai заявляет 200 tokens/s, но не публикует парное сравнение качества Flash и FlashX, распределение задержки или методику измерения этой цифры.

Практический вывод прост: FlashX стоит тестировать, когда человек ждёт длинный потоковый ответ или интерактивный цикл инструментов. Для пакетных заданий, фоновых агентов и офлайн-оценок обычный Flash остаётся разумной базой, поскольку оплата примерно в 2,5 раза больше за token редко создаёт измеримую ценность.

Факты проверены 19 сентября 2026 года. Мы изучили документацию модели, цены API, отчёт о запуске и открытую карточку Z.ai, а также данные Artificial Analysis для обычного GLM-5.3-Flash. У нас не было оплачиваемого доступа к FlashX, мы не проводили собственный тест задержки и не выдаём 200 tokens/s за независимый результат.

Краткий вердикт

  • Сначала тестировать FlashX: интерактивная разработка, живой поиск, Computer Use, клиентские ассистенты и длинная потоковая выдача.
  • Оставить Flash вариантом по умолчанию: очереди, извлечение документов, ночное ревью, синтетические данные и массовая автоматизация.
  • Не переходить только ради качества: Z.ai не показывает отдельный checkpoint FlashX или парное доказательство лучшего ответа.

FlashX и Flash: главное

КритерийGLM-5.3-FlashXGLM-5.3-Flash
ID модели APIglm-5.3-flashxglm-5.3-flash
Роль в документацииБолее быстрый хостинговый маршрутБолее дешёвый маршрут и открытые веса
Данные о скоростиZ.ai заявляет 200 tokens/s без методикиArtificial Analysis измерила медиану 98.6 tokens/s
Ввод / кэш / вывод$0.37 / $0.075 / $1.25 за 1M tokens$0.15 / $0.03 / $0.50
Контекст / максимум вывода1M / 128K tokens1M / 128K tokens
Входные данныеВидео, изображения, текст и файлыВидео, изображения, текст и файлы
ThinkingОбязателен, отключить нельзяОбязателен, отключить нельзя
GLM Coding PlanНе входил на дату проверкиВходит с квотой в 3 раза больше GLM-5.3
Публичные весаОтдельный checkpoint не указанzai-org/GLM-5.3-Flash, MIT

Общая документация подтверждает одинаковый публичный контракт возможностей. Она не доказывает идентичность внутреннего serving, стабильности ответов, tool calls и надёжности.

Текущую цену и статус в OmniaKey определяют страница GLM-5.3-Flash и живой каталог моделей. Наличие glm-5.3-flashx у Z.ai не означает, что тот же ID уже доступен через любой gateway.

Что на самом деле доказывают 200 tokens/s

Z.ai не сообщает, являются ли 200 пиковым, средним или медианным значением. Не раскрыты регион, prompt, длина вывода, параллелизм, учёт reasoning tokens и p95. Времени до первого token тоже нет.

text
сквозная задержка
  = ожидание в очереди
  + обработка prompt и первый token
  + сгенерированные tokens / скорость декодирования
  + время инструментов и сети

При идеально стабильных 200 tokens/s декодирование 100 tokens занимает 0.5 секунды, 1,000 — 5 секунд, 4,000 — 20 секунд. Это арифметика, а не измерение FlashX. Для коротких ответов решающим может быть первый token, для длинных prompt — prefill.

Независимые данные есть только для Flash

Artificial Analysis приводит для обычного Flash через API Z.ai следующие результаты:

МетрикаОбычный FlashОбласть
Intelligence Index41.9Независимая оценка
Медианная скорость вывода98.6 tokens/sВыборка API Z.ai
Медиана до первого chunk2.43 секундыВыборка API Z.ai
Стоимость одной задачи оценки$0.253Набор задач оценщика

Это не тест FlashX. Делить рекламные 200 Z.ai на независимую медиану 98.6 и заявлять «в 2.03 раза быстрее» нельзя: методики, даты, нагрузки и условия трафика различаются.

Z.ai также сообщает для семейства Flash 84.3 в Terminal-Bench 2.1, 63.4 в DeepSWE v1.1, 56.3 в NL2Repo и 48.8 в AutomationBench. Это vendor-run результаты GLM-5.3-Flash, а не доказательство повышения качества FlashX. Выбор поколения разобран в сравнении GLM-5.3 и GLM-5.2 для программирования.

Цены API и пример расчёта

Z.ai указывает следующие прямые цены в долларах за миллион tokens:

МодельВводКэшированный вводХранение кэшаВывод
GLM-5.3-Flash$0.15$0.03Временно бесплатно$0.50
GLM-5.3-FlashX$0.37$0.075Временно бесплатно$1.25
GLM-5.3$1.40$0.26Временно бесплатно$4.40

Некэшированный ввод FlashX стоит в 2.47 раза дороже, кэшированный ввод и вывод — ровно в 2.5 раза дороже Flash. Временная бесплатность относится к хранению кэша, а не отменяет плату за чтение кэшированного ввода.

100K некэшированных входных tokens и 20K выходных стоят $0.0250 на Flash, $0.0620 на FlashX и $0.2280 на полном GLM-5.3. При 80K кэшированных и 20K некэшированных входных tokens цены равны $0.0154 / $0.0384 / $0.1368. Тысяча запусков первого случая стоит $25.00 / $62.00 / $228.00.

Доплата за FlashX составляет $0.037 за запуск. При полной стоимости труда $30 в час это около 4.4 секунды. Это полезный порог решения, но не измерение экономии 4.4 секунды.

Архитектура и ограничения интеграции

В основе GLM-5.3-Flash — 320B параметров всего и 18B активных на token, 45 слоёв и обучение на мультимодальном корпусе в 30T tokens. Модель объединяет sparse и linear attention. Z.ai заявляет в 3.01 раза меньше вычислений attention и в 4.44 раза меньше KV Cache, чем у GLM-5.3. Это свойства семейства Flash, а не эксклюзивные изменения FlashX.

Веса обычного Flash опубликованы по MIT. В проверенных источниках FlashX встречается только как хостинговый ID. Thinking нельзя отключить; Z.ai рекомендует temperature: 1, top_p: 0.95, reasoning_effort: max, clear_thinking: false, stream: true и tool_stream: true для интерактивной работы.

Клиент с thinking.type: "disabled" нужно сначала изменить. reasoning_effort: max может увеличить reasoning tokens и общее время даже при быстром декодировании. Для мультимодального ввода по-прежнему нужны проверки размера, формата, приватности и хранения.

Какой маршрут выбрать

НагрузкаНачать сПричина
Интерактивное программирование и отладкаFlashXЧеловек ждёт reasoning, инструменты и вывод
Клиентский ассистент с длинными ответамиFlashX после теста p95Хвостовая задержка влияет на опыт
Computer Use или Browser UseFlashX после теста успехаКаждый ход блокирует следующее действие
Ночное ревью или анализ CIFlashОбычно никто не ждёт каждый token
Массовое извлечение, классификация, синтетикаFlashЦена 2.5x копится без интерактивной выгоды
Сложная задача с дорогой ошибкойСравнить Flash, FlashX и GLM-5.3Приёмка может быть важнее скорости и тарифа
Работа в GLM Coding PlanFlashFlashX сейчас не входит в план

В production можно использовать оба ID: FlashX только на критическом интерактивном пути, Flash — для retry, индексации, сводок и постобработки.

Как корректно сравнить FlashX

  1. Зафиксировать короткие, длинные, tool-heavy и мультимодальные задачи с критериями приёмки.
  2. Отправить одинаковый неизменный prompt и tool policy обоим точным ID.
  3. Случайно чередовать порядок, сохраняя регион и временные окна.
  4. Записывать первый chunk, скорость, полное время и p50/p95.
  5. Записывать ввод, кэш, reasoning, вывод и фактическую стоимость.
  6. Оценивать приёмку, tool calls, retry, ошибки и правки человека.
  7. Повторить при реалистичном параллелизме, чтобы увидеть разброс.

Главная метрика — стоимость принятой задачи в пределах требуемой задержки. Почему модель и Agent harness нужно тестировать вместе, объясняет гайд по моделям для coding-агентов.

Итог

GLM-5.3-FlashX лучше всего понимать как платную скоростную полосу семейства Flash. 200 tokens/s выглядят многообещающе, а абсолютная доплата для интерактивного запроса может быть небольшой. Но публичные данные не доказывают новый уровень интеллекта, гарантированное ускорение в 2 раза или сквозной SLA.

Используйте FlashX там, где ожидание имеет измеримую цену, а в остальных задачах оставьте Flash базой по стоимости.

Частые вопросы

FlashX умнее обычного Flash?

Публичных доказательств нет. Есть общие возможности и benchmark семейства, но нет парного сравнения качества или отдельного checkpoint FlashX.

Он действительно выдаёт 200 tokens/s?

Это официальная цифра Z.ai. Методика, процентиль, регион, параллелизм, форма prompt и первый token не раскрыты; этот обзор её не воспроизводил.

Сколько стоит FlashX?

$0.37 за миллион некэшированных входных tokens, $0.075 за кэшированный ввод и $1.25 за вывод — примерно в 2.5 раза дороже Flash.

Поддерживаются контекст 1M и изображения?

Да. Общая страница документирует контекст 1M, до 128K вывода и видео, изображения, текст и файлы на входе. Длинный контекст не гарантирует низкую задержку.

Первичные источники

Данные и расчёты проверены 19 сентября 2026 года. ID, цены, доступ к Plan, задержка и наличие в gateway могут измениться; перед production перепроверьте первичные источники и проведите парный тест.