DeepSeek V4 Flash уже доступна · Наша цена GLM-5.2 снижена до 50% от официальной
Блог
Контроль затрат

Цены API GLM-5.2

Z.ai указывает $1,40 за вход, $0,26 за кешированный вход и $4,40 за выход на миллион токенов GLM-5.2. Текущие тарифы OmniaKey составляют 50% от этих значений.

10 мин чтенияOmniaKey
GLM-5.2API pricingZ.aicost control

Официальные цены API GLM-5.2 составляют $1,40 за миллион входных токенов, $0,26 за миллион кешированных входных токенов и $4,40 за миллион выходных токенов. OmniaKey сейчас указывает для той же модели $0,70 за вход, $0,13 за кешированный вход и $2,20 за выход.

Соотношение простое, но не каждый запрос стоит половину произведения общего числа токенов на входной тариф. В одном запросе могут одновременно учитываться некешированный вход, кешированный вход и сгенерированный выход, каждый по своей ставке.

Цены проверены 9 августа 2026 года. Колонка Z.ai взята с международной страницы тарифов Z.ai. Колонка OmniaKey показывает текущую ставку платформы, а не новую официальную цену Z.ai. Тарифы и акции меняются, поэтому перед утверждением production-бюджета проверьте обе живые страницы.

Обновление GLM-5.3: 14 августа Z.ai открыл GLM-5.3 пользователям Coding Plan, но developer API все еще имеет статус coming soon, а в официальной таблице нет строки 5.3. Для решения об обновлении используйте сравнение GLM-5.3 и GLM-5.2; ставки ниже относятся только к GLM-5.2.

Цены API GLM-5.2 в одной таблице

Все суммы ниже указаны в долларах США за миллион токенов.

Тип использованияОфициальный тариф Z.aiТекущий тариф OmniaKeyТекущая разница
Некешированный вход$1,40$0,70на 50% ниже
Кешированный вход$0,26$0,13на 50% ниже
Выход$4,40$2,20на 50% ниже

На живой странице модели GLM-5.2 указаны текущий тариф OmniaKey, контекст, возможности и пример запроса. Для сравнения с другими моделями используйте каталог моделей.

Общая формула стоимости:

text
стоимость = миллионы_некешированного_входа × тариф_входа
          + миллионы_кешированного_входа × тариф_кеша
          + миллионы_выхода × тариф_выхода

Токены считает биллинговая система, а не количество символов или размер файла. Миллион символов не обязательно равен миллиону токенов.

Что означает каждая цена GLM-5.2

Некешированный вход

Некешированный вход включает содержимое запроса без cache hit: инструкции, историю диалога, файлы, определения инструментов и другой контекст. Миллион таких токенов стоит $1,40 по официальной ставке или $0,70 по текущей ставке OmniaKey ещё до генерации ответа.

Кешированный вход

Кешированный вход — это подходящий повторяющийся контекст, прочитанный по сниженной ставке. Z.ai сейчас указывает $0,26 за миллион кешированных входных токенов, OmniaKey — $0,13.

Наличие кеш-тарифа не гарантирует попадание каждого повторного токена в кеш. Важны структура запроса, срок действия кеша и поведение провайдера. Проверяйте реальные записи использования, а не оценивайте любой повторный Prompt по кеш-ставке.

Хранение кешированного входа

В таблице Z.ai хранение cached input отдельно помечено как “Limited-time Free”. Это не та же позиция, что чтение кеша по $0,26. Срок и условия временно бесплатного хранения могут изменяться независимо, поэтому считать хранение навсегда бесплатным нельзя.

Выход

Выход включает сгенерированные токены ответа и reasoning, отражённые в биллинге. Миллион выходных токенов стоит $4,40 по официальному тарифу или $2,20 в OmniaKey. Это самая дорогая строка таблицы на один токен.

Длинные ответы, многословные циклы инструментов, повторные исправления и высокий лимит выхода могут влиять на счёт сильнее небольшого изменения Prompt. Ограничивайте ответ задачей, а не автоматически запрашивайте максимум.

Три проверяемых примера стоимости

Примеры напрямую применяют опубликованные ставки. Они не включают отдельные платежи за инструменты, налоги, конвертацию валюты и будущие изменения цен.

Пример 1: чтение крупного репозитория

Предположим, задача использует миллион некешированных входных токенов и генерирует 100 000 выходных.

РасчётZ.ai официальноOmniaKey сейчас
Вход1 × $1,40 = $1,401 × $0,70 = $0,70
Выход0,1 × $4,40 = $0,440,1 × $2,20 = $0,22
Итого$1,84$0,92

Контекст в миллион токенов — это ёмкость, а не включённая квота. Заполнение окна некешированным входом создаёт входную стоимость, даже если модель отвечает коротко.

Пример 2: длинная инженерная работа

Предположим, несколько вызовов суммарно используют десять миллионов некешированных входных токенов и два миллиона выходных.

text
Z.ai:      10 × $1,40 + 2 × $4,40 = $22,80
OmniaKey:  10 × $0,70 + 2 × $2,20 = $11,40

Это стоимость нагрузки, а не Benchmark-прогноз. Реальный объём зависит от клиента, Prompt, репозитория, инструментов, повторов и поведения модели.

Пример 3: повторный контекст из кеша

Предположим, десять миллионов токенов тарифицируются как кешированный вход, а модель генерирует миллион выходных токенов.

text
Z.ai:      10 × $0,26 + 1 × $4,40 = $7,00
OmniaKey:  10 × $0,13 + 1 × $2,20 = $3,50

Пример действителен только тогда, когда провайдер действительно записывает эти десять миллионов как cache hit. Внешне одинаковый Prompt не гарантирует одинаковую тарификацию.

Почему цена OmniaKey отличается от прайса Z.ai

Z.ai публикует международные upstream-ставки API. OmniaKey публикует цену вызова через собственный предоплаченный gateway. На дату проверки OmniaKey применяет коэффициент 0,5 к некешированному входу, кешированному входу и выходу GLM-5.2.

Колонки описывают разные отношения биллинга:

  • для прямого аккаунта Z.ai бюджет считайте по колонке Z.ai;
  • для списания с баланса OmniaKey используйте колонку OmniaKey;
  • не соединяйте входную цену одной платформы с выходной ценой другой;
  • не считайте текущую разницу в 50% постоянной.

OmniaKey не меняет запрошенный model id ради этой цены. Запрос по-прежнему называет glm-5.2; недоступность приводит к ошибке, а не к скрытому переключению модели.

Общий стандарт учёта разобран в статье о том, как должен работать прозрачный API-биллинг.

Что GLM-5.2 предлагает за эту цену

Z.ai позиционирует GLM-5.2 как флагман для длинных задач. Официальная страница модели указывает:

  • контекстное окно 1 миллион токенов;
  • до 128 000 выходных токенов;
  • thinking modes и настраиваемый reasoning effort;
  • потоковые ответы;
  • function calling и интеграцию MCP;
  • structured output;
  • context caching.

Это факты о ёмкости и интерфейсе, а не гарантия, что каждый клиент открывает все параметры. Совместимый маршрут gateway тоже не означает нативную поддержку во всех продуктах для программирования.

По таблице цен нельзя объявить универсального победителя качества. Z.ai публикует Benchmark и продуктовые заявления на странице модели, но эта статья независимо их не воспроизводит.

Когда GLM-5.2 может быть экономически оправдана

GLM-5.2 стоит рассмотреть, если задача требует:

  • контекста проекта с кодом, тестами, документацией и ограничениями;
  • долгой многошаговой реализации или рефакторинга;
  • структурированных вызовов инструментов и машиночитаемого выхода;
  • повторяющегося контекста, который может получить кеш-тариф;
  • высокого выходного лимита для больших артефактов.

Для небольшой классификации, короткого извлечения или механической правки модель может быть неэкономичной, если меньшая модель стабильно справляется. Важнее самая дешёвая успешная модель для класса задач, а не максимальный процент скидки.

В руководстве по выбору моделей для кодинг-агентов объясняется, почему маршрутизацию следует строить по принятой работе, а не по одной ставке.

Считайте стоимость принятой задачи

При сравнении GLM-5.2 с другой моделью зафиксируйте состояние репозитория, Prompt, инструменты, разрешения и приемочный тест. Записывайте:

  1. некешированные, кешированные и выходные токены;
  2. число ходов модели и вызовов инструментов;
  3. задержку и неудачные попытки;
  4. время ручного исправления;
  5. прохождение тестов и критериев приёмки;
  6. итоговую списанную сумму.

Модель с низкой ставкой может обойтись дороже из-за повторов. Модель с высокой ставкой может быть выгоднее, если завершает сложную работу за меньшее число попыток. Повторяйте задачи: результаты агентов меняются.

Вызов GLM-5.2 через OmniaKey

Создайте отдельный ключ в панели API Keys, затем используйте OpenAI-совместимый маршрут Chat Completions:

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [{"role": "user", "content": "Review this migration plan"}],
    "stream": true
  }'

Используйте точный id glm-5.2. В быстром старте API описаны endpoint и аутентификация.

После репрезентативной задачи сравните отчёт клиента с дашбордом использования. Руководство по балансу и использованию объясняет записи вызовов и лимиты ключей.

Контролируйте бюджет, не путайте лимит с экономией

Лимит расходов ключа ограничивает финансовый риск, но не уменьшает расход токенов ниже лимита. Используйте разные ключи для локальной работы, CI и общей автоматизации, чтобы разделить атрибуцию и отзыв.

Практический порядок:

  1. выполните одну типичную задачу;
  2. проверьте фактический некешированный, кешированный и выходной расход;
  3. уберите ненужный контекст и повторы;
  4. установите лимит выше нормального разброса задачи;
  5. перед повышением лимита изучите использование.

Для оптимизации контекста откройте руководство по сокращению расхода токенов. Команды там относятся к Claude Code, но принципы применимы и к другим агентам.

Частые ошибки в расчёте

Контекст 1M принимают за бесплатную квоту

Окно — максимальная ёмкость. Вход внутри него всё равно тарифицируется по своей категории.

Путают чтение кеша с его хранением

Z.ai отдельно указывает цену cache hit и временную акцию на storage. Это разные позиции.

Каждый повторный Prompt считают кешированным

Льготный тариф действует только на cache hit, зафиксированный провайдером. Проверяйте детализацию.

Сравнивают цену без объёма выхода

Выход дороже входа. Лишний reasoning и повторная генерация патчей могут съесть экономию на Prompt.

Считают сегодняшнюю скидку постоянным контрактом

Коэффициент OmniaKey 50% актуален на 9 августа 2026 года. Перед бюджетом или закупкой проверьте живой каталог.

Называют низкую ставку победой в Benchmark

Цена описывает биллинг, а не правильность, задержку, надёжность инструментов или завершение задачи. Тестируйте реальную нагрузку.

Частые вопросы

Сколько стоит API GLM-5.2?

Z.ai указывает $1,40 за миллион некешированных входных токенов, $0,26 за миллион кешированных и $4,40 за миллион выходных. Текущие ставки OmniaKey — $0,70, $0,13 и $2,20.

GLM-5.2 дешевле через OmniaKey?

На дату проверки 9 августа 2026 года да: ставки OmniaKey составляют 50% от международных ставок Z.ai. Это текущая цена платформы, а не постоянное изменение прайса Z.ai.

Сколько стоит Prompt GLM-5.2 на миллион токенов?

Миллион некешированных входных токенов стоит $1,40 у Z.ai или $0,70 по текущей ставке OmniaKey, без выхода. Если весь миллион отражён как кешированный вход, чтение стоит $0,26 или $0,13 соответственно.

Есть ли у GLM-5.2 контекст 1M?

Да. Z.ai указывает миллион токенов контекста и максимум 128 000 токенов выхода. Ёмкость не означает, что окно бесплатное или всегда нужно целиком.

Поддерживает ли GLM-5.2 вызов инструментов и structured output?

Страница Z.ai перечисляет function calling, MCP, structured output, streaming, thinking modes и context caching. Перед production проверьте возможности конкретного клиента и API-маршрута.

Источники

Факты проверены 9 августа 2026 года. Ставки провайдера, скидки платформы, условия кеша и поддерживаемые возможности могут измениться. Перед production-бюджетом проверьте первичные источники и живой каталог OmniaKey.