Цены на API Gemini 3.8 Flash и стоимость задачи агента
У Google текущий тариф Standard составляет $0.75 за миллион входных и $3.75 за миллион выходных токенов; OmniaKey указывает $0.45 и $2.25, но итог определяют повторы и доля принятых задач.
Цены на API Gemini 3.8 Flash в платном режиме Google Standard составляют $0.75 за миллион входных токенов и $3.75 за миллион выходных токенов до 31 декабря 2026 года. С 1 января 2027 года Google указывает $1.50 и $7.50. На странице модели OmniaKey сейчас опубликован отдельный тариф шлюза: $0.45 за вход, $2.25 за выход и $0.045 за кэшированный вход.
Прямые тарифы и даты взяты из действующей таблицы цен Gemini API от Google.
Тариф за токен не отвечает на главный вопрос агентного контура. Для бюджета нужна сумма всех успешных и неуспешных попыток, разделённая на число задач, прошедших приёмку. Два дешёвых сбоя могут стоить дороже одной более дорогой успешной попытки.
Проверено 20 сентября 2026 года. Цены, даты, лимиты токенов, уровни thinking, кэш и Batch сверены с актуальной документацией Google. Цифры OmniaKey взяты из действующего каталога и относятся к отдельному договору со шлюзом. Это анализ по источникам: мы не проводили собственный бенчмарк или платный производственный тест и не приписываем модели определённую успешность.
Тарифы Gemini 3.8 Flash в одной таблице
Все суммы указаны в долларах США за миллион токенов. «Кэшированный вход» означает льготное чтение и не включает отдельную плату Google за хранение кэша.
| Путь биллинга | Вход | Кэшированный вход | Выход, включая thinking | Область действия |
|---|---|---|---|---|
| Google Standard до 31.12.2026 | $0.75 | $0.075 | $3.75 | Прямой платный Gemini API |
| Google Batch или Flex до 31.12.2026 | $0.375 | $0.0375 | $1.875 | Прямые задачи, допускающие задержку или гибкую мощность |
| Google Priority до 31.12.2026 | $1.35 | $0.135 | $6.75 | Прямая приоритетная обработка |
| Google Standard с 01.01.2027 | $1.50 | $0.15 | $7.50 | Запланированный прямой тариф Standard |
| Текущий каталог OmniaKey | $0.45 | $0.045 | $2.25 | Текущая ставка Standard у шлюза |
Текущая ставка OmniaKey на 40% ниже действующего Google Standard. Это не обещание, что после 1 января она останется равна 60% тарифа Google. Каждый сервис меняет собственный каталог независимо. Перед утверждением бюджета снова откройте актуальную таблицу цен.
Batch и Flex у Google сейчас дешевле Standard у OmniaKey, но это разные режимы. Batch работает асинхронно, имеет целевой срок выполнения 24 часа и документирован Google для generateContent. Не переносите режимы Batch, Flex или Priority на маршрут шлюза, если тот их явно не описывает.
Хранение кэша, grounding, внешние инструменты, браузер, база данных, инфраструктура, налоги и ручная проверка могут добавить расходы, которых нет в таблице токенов.
Формула стоимости принятой задачи агента
Сначала выберите фактический маршрут:
стоимость модели на попытку
= миллионы входных токенов x входной тариф
+ миллионы кэшированных токенов x тариф кэша
+ миллионы выходных токенов x выходной тариф
полная стоимость попытки
= модель + инструменты + grounding + инфраструктура + проверка
наблюдаемая стоимость принятой задачи
= расходы на все успешные и неуспешные попытки
/ число задач, прошедших приёмку
Если попытки стоят примерно одинаково, а шанс прохождения можно считать независимым:
ожидаемая стоимость принятой задачи = стоимость попытки / доля прохождения
Это приближение. Неудачный запуск может завершиться раньше, зациклиться, вызвать другие инструменты или потребовать ручного исправления. В продакшене используйте в числителе весь наблюдаемый расход.
Заранее определите приёмку: тесты для патча, проверка JSON по schema, совпадение извлечения с размеченными данными или человеческая рубрика. Ответ HTTP 200 не является критерием качества.
Пример: 20K входа, 5K выхода и 70% принятых задач
Предположим, полная попытка использует 20,000 некэшированных входных и 5,000 выходных токенов. В выход уже входят оплачиваемые thinking-токены. Инструменты, хранение, налоги и ручную проверку исключаем, чтобы расчёт можно было повторить.
| Путь биллинга | Стоимость попытки | Ожидаемая стоимость принятой задачи при 70% |
|---|---|---|
| Google Standard в 2026 году | 0.02 x $0.75 + 0.005 x $3.75 = $0.03375 | $0.0482 |
| Google Standard с 2027 года | 0.02 x $1.50 + 0.005 x $7.50 = $0.06750 | $0.0964 |
| Google Batch/Flex в 2026 году | 0.02 x $0.375 + 0.005 x $1.875 = $0.016875 | $0.0241 |
| Текущий каталог OmniaKey | 0.02 x $0.45 + 0.005 x $2.25 = $0.02025 | $0.0289 |
При неизменном количестве токенов прямой Standard удваивается 1 января 2027 года. Строка OmniaKey использует только текущую цену и не прогнозирует будущий тариф шлюза. Строка Batch/Flex показывает, почему режим потребления важен: отложенная прямая задача может иметь меньший токенный счёт, чем интерактивный вызов через шлюз.
При текущем Google Standard попытка за $0.03375 даёт $0.0375 на принятую задачу при 90%, $0.0482 при 70% и $0.0675 при 50%. Рост доли прохождения нередко важнее небольшого сокращения prompt.
Thinking-токены могут стать главной частью счёта
Для gemini-3.8-flash Google поддерживает low, medium и high; по умолчанию используется medium. Режим minimal не поддерживается и возвращает ошибку. Выходной тариф покрывает видимый ответ и thinking-токены.
В документации указаны лимиты 1,048,576 входных и 65,536 выходных токенов. Это пределы вместимости, а не бесплатная квота: оплаченные токены остаются в числителе стоимости задачи.
Практические последствия:
- Короткий ответ на экране может быть дорогим из-за длинного внутреннего рассуждения.
- Слишком маленький
max_output_tokensспособен оборвать рассуждение, вернуть неполный или пустой результат и всё равно списать уже созданные thinking-токены. highвыгоден лишь тогда, когда прирост принятых задач покрывает дополнительный выход и задержку.
Проверяйте low, medium и high на одном наборе задач. Зафиксируйте prompt, инструменты, права, повторы и команды приёмки. Выбирайте самый дешёвый уровень, который достигает нужной надёжности, а не просто возвращает текст.
Кэш, повторы и инструменты в одном бюджете
Google документирует неявное кэширование Gemini 3.8 Flash с минимальным подходящим префиксом 4,096 токенов. Размещайте стабильные инструкции и схемы инструментов перед изменяемыми данными, если клиент сохраняет префикс, а затем проверяйте отчёт о кэше. Похожий текст сам по себе не доказывает попадание в кэш.
Повторам нужны причины: транспортная ошибка, неверные аргументы инструмента, провал приёмки или запрос человека на доработку. Неограниченный цикл улучшает видимую долю прохождения, но незаметно увеличивает расходы.
Для агента с инструментами записывайте:
- запрошенный и возвращённый ID модели;
- вход, кэш, thinking и видимый выход, если протокол их показывает;
- инструменты, их стоимость и число ходов;
- задержку, категорию ошибки и количество повторов;
- результат и точную проверку приёмки;
- окончательную сумму по маршруту.
В нативном Gemini и OpenAI-совместимом протоколах поля usage могут называться по-разному. Сверяйте ответ реального маршрута с панелью использования OmniaKey, а не подставляйте схему другого провайдера.
Когда начинать с Google, а когда с OmniaKey
| Требование | Начните с | Почему |
|---|---|---|
| Минимальная опубликованная цена для отложенного пакета | Google Batch | Сейчас прямой Batch стоит 50% Standard и работает асинхронно |
| Grounding и режимы, специфичные для Google | Google напрямую | Они описаны прямым контрактом Google |
| Один ключ и OpenAI-совместимый маршрут | OmniaKey | Каталог предлагает gemini-3.8-flash по отдельной ставке шлюза |
| Интерактивный агент с жёсткой задержкой | Измерьте оба | Цена токена не доказывает очередь, надёжность или долю прохождения |
| Продакшен после 01.01.2027 | Перепроверьте оба | Google запланировал изменение, будущая цена шлюза неизвестна |
Это не универсальный рейтинг. Политика данных, регион, лимиты запросов, поддержка, прозрачность маршрутизации и протокол клиента могут изменить выбор.
Вызов Gemini 3.8 Flash через OmniaKey
Проверьте gemini-3.8-flash в актуальном каталоге, создайте ограниченный ключ в разделе API-ключи и вызовите OpenAI-совместимый endpoint:
curl https://api.omniakey.com/v1/chat/completions \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"messages": [
{"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
],
"stream": true
}'
Быстрый старт API описывает авторизацию и базовый URL. Настоящий ключ храните в переменной окружения, а не в коде, prompt, логах или снимках экрана.
Частые вопросы
Сколько стоит API Gemini 3.8 Flash?
Google Standard стоит $0.75 за миллион входных и $3.75 за миллион выходных токенов до конца 2026 года. С 1 января 2027 года указаны $1.50 и $7.50. OmniaKey сейчас публикует отдельные $0.45 и $2.25.
Thinking-токены входят в выходной тариф?
Да. Google включает их в выход. Используйте отчёт usage, а не длину видимого ответа.
OmniaKey всегда дешевле прямого Google?
Нет. Текущий Standard OmniaKey ниже Google Standard, однако Google Batch и Flex дешевле для подходящих нагрузок. Доступность, задержка, протокол и будущие цены сравниваются отдельно.
Зачем делить на долю прохождения?
Неудачные попытки расходуют деньги, но не добавляют принятую задачу. При стабильной цене попытки деление на вероятность оценивает расход на один принятый результат. С реальными данными делите общий счёт на число принятых задач.
Какой уровень thinking выбрать агенту?
Для ограниченной проверяемой работы начните с low, затем сравните medium и high, если ошибка дорога. Gemini 3.8 Flash не поддерживает minimal. Нужен самый дешёвый уровень, надёжно проходящий тот же контроль.
Первичные источники
- Цены Gemini API от Google (англ.)
- Документация Gemini 3.8 Flash (англ.)
- Документация Google по thinking (англ.)
- Документация Google по кэшу (англ.)
- Документация Google Batch API (англ.)
Источники и расчёты проверены 20 сентября 2026 года. Цены, лимиты и доступность маршрутов меняются; перед расходами в продакшене снова проверьте первичные документы и каталог OmniaKey.