Сократить расход токенов Claude Code
Главная экономия обычно приходит от уменьшения повторяемого контекста и предотвращения переделок, а не от просьбы сделать финальный ответ короче.
Чтобы сократить расход токенов Claude Code, контролируйте объём материала, который модель обрабатывает на каждом ходе. Даже короткий ответ может стоить дорого, если вместе с запросом снова отправляются длинная история, несколько файлов, вывод команд, правила проекта, определения инструментов и extended thinking.
Полезная цель — не минимум токенов в одном ответе, а минимальная общая стоимость принятого изменения: исследования, правок, тестов, исправлений и человеческой проверки.
Оптимизируйте стоимость принятого изменения, а не число токенов в ответе. Если удалить нужный контекст, текущий ход станет дешевле, но вся задача подорожает, когда Claude начнёт угадывать, изменит не те файлы или потребует три цикла исправлений.
В руководстве используются актуальные команды Claude Code: /usage, /context, /clear, /compact, /model, /effort и /mcp. Советы напрямую относятся к сессиям с оплатой API. Подписки расходуют лимиты тарифного окна, а не выставляют счёт за каждый запрос, но компактный контекст помогает экономнее использовать и такой лимит.
Почему Claude Code расходует много токенов при коротком ответе
Claude Code — программный агент, а не один вопрос и один ответ. Рабочая сессия может включать:
- ваш запрос и все релевантные предыдущие ходы;
- файлы, прочитанные при исследовании репозитория;
- вывод команд, тестов, компилятора и инструментов;
CLAUDE.md, подходящие правила проекта и вызванные skills;- определения и результаты инструментов MCP servers;
- планирование, extended thinking, сгенерированный код и объяснения;
- сводки subagent и последующие исправления.
Контекст накапливается. Если старый лог или обсуждение другой функции остаётся в разговоре, следующие запросы могут обрабатывать его снова. Prompt caching снижает цену повторяющегося содержимого, а Claude Code автоматически сжимает историю возле предела контекста, но это не повод хранить нерелевантные материалы бесконечно.
Практичный порядок оптимизации выглядит так:
- измерить одну типичную задачу;
- убрать несвязанный контекст;
- сократить постоянные инструкции и накладные расходы инструментов;
- ограничить широкое исследование и шумный вывод;
- осознанно выбрать модель и effort;
- снова измерить стоимость завершённой задачи.
Сначала измерьте исходный уровень
Перед оптимизацией выполните /usage. Для пользователей API блок Session показывает расход токенов по моделям и локальную оценку по стандартным ценам. Она может не учитывать скидку gateway или договорную ставку, поэтому финансовым источником истины остаётся реальный счёт провайдера.
Выполните /context, чтобы увидеть, что занимает текущее окно. Большой CLAUDE.md, вызванный skill или инструменты перестанут быть предположением и станут измеримыми статьями.
Если сессия идёт через OmniaKey, сравните локальную диагностику с панелью использования. Она показывает запрошенную модель, входные и выходные токены, данные кеша, задержку и фактическую стоимость каждого вызова. Руководство по балансу и использованию объясняет баланс аккаунта, лимиты ключей и записи запросов.
Выберите одну повторяемую задачу и зафиксируйте до и после:
| Метрика | Зачем она нужна |
|---|---|
| Входные, cache read, cache write и выходные токены | Показывает, где накапливается расход |
| Число ходов модели и вызовов инструментов | Выявляет циклы и повторное исследование |
| Повторы и ручные исправления | Находит дешёвые ходы, создающие дорогую переделку |
| Пройденные тесты и критерии приёмки | Не даёт экономить за счёт корректности |
| Итоговая списанная сумма | Измеряет результат, за который вы платите |
Не сравнивайте несвязанные сессии. Исправление опечатки и незнакомая миграция не могут иметь одинаковую токенную базу.
1. Очищайте контекст между несвязанными задачами
Самая полезная привычка одновременно самая простая: запускайте /clear, если следующей задаче не нужен текущий разговор.
Перед очисткой важной сессии дайте ей имя:
/rename auth-refresh-investigation
/clear
Предыдущая сессия останется доступной через /resume. В текущем Claude Code /clear также сбрасывает показатели Session в /usage, поэтому новую задачу легче измерять отдельно.
Контекст стоит очистить, когда вы:
- переходите от backend-ошибки к несвязанному маркетинговому тексту;
- завершили функцию и начинаете работу в другой части репозитория;
- отказались от подхода с неверными исходными предположениями;
- накопили несколько больших логов, которые больше не влияют на решение.
Не очищайте историю только из-за роста индикатора контекста. Если задача продолжается, сначала сохраните проверенные факты и решения либо осмысленно сожмите разговор.
2. Осмысленно используйте /compact в длинной работе
/compact заменяет старую историю более короткой сводкой. Укажите, что обязательно должно сохраниться:
/compact Сохрани критерии приёмки, изменённые файлы, вывод упавших тестов и нерешённые вопросы.
Для длинной реализации это надёжнее общей сводки без требований. Короткую инструкцию для compact можно добавить в CLAUDE.md, если она полезна для всех задач проекта.
Compaction не сбрасывает лимит подписки, а предупреждение о контексте не является предупреждением о биллинге. Сжатие управляет материалом разговора; оно не добавляет тарифную квоту и не пополняет API-баланс.
Применяйте /compact, когда задача осталась прежней, но путь к текущему состоянию был шумным. Применяйте /clear, когда изменилась сама работа.
3. Сократите то, что загружается до начала работы
Claude Code читает инструкции проекта в начале сессии. Полезные правила предотвращают ошибки, но справочник, загружаемый в каждый разговор, расходует контекст даже в нерелевантных задачах.
Актуальные рекомендации Anthropic советуют держать CLAUDE.md коротким, а специализированные процессы переносить в skills, которые загружаются по запросу. Корневой файл должен в основном содержать:
- команды проверки изменений;
- специфические архитектурные границы репозитория;
- неочевидные ограничения окружения;
- правила проекта, отличающиеся от обычных соглашений языка.
Длинные API-учебники, одноразовые runbooks миграций и справочные материалы лучше хранить отдельно. Дайте ссылку или оформите узкий skill вместо постоянной загрузки.
MCP servers создают похожий компромисс. Выполните /mcp и отключите серверы, которые сейчас не нужны. Claude Code откладывает загрузку полных определений инструментов, но названия и использованные schemas всё равно занимают контекст. Для простой операции специализированный CLI, например gh, aws или sentry-cli, часто эффективнее широкой панели инструментов.
После очистки снова проверьте /context. Если стартовый объём не изменился, найдите реальный крупный источник, прежде чем менять остальную конфигурацию.
4. Ограничьте задачу, чтобы избежать обхода всего репозитория
Запрос «улучши этот репозиторий» провоцирует широкое сканирование. Ограниченная постановка ведёт прямо к доказательствам:
Исправь 401 после обновления токена в src/api/auth.ts.
Сохрани публичную форму ответа.
Добавь регрессионный тест для истёкшего access token и действующего refresh token.
Запусти целевой auth-тест и typecheck.
В запросе названы симптом, вероятный файл, контракт и проверка. Claude всё ещё может читать зависимости, но ему не требуется сначала изучать весь проект.
Для действительно сложной работы сначала исследуйте и планируйте. Короткая фаза плана может предотвратить дорогую реализацию неверной архитектуры. Для однострочного исправления с известным местом план будет лишней нагрузкой. Планируйте при реальной неопределённости.
Исправляйте направление рано. Если Claude решает не ту задачу, остановите ход, не дожидаясь большого патча и нескольких объяснений, почему его нужно удалить. /rewind возвращает разговор и код к предыдущему checkpoint.
Полезен и контракт результата:
- сначала решение;
- только изменённые файлы и результаты проверки;
- без повторения исходного запроса;
- при нехватке данных сначала вопросы, затем реализация;
- ограничение длины только там, где оно не скрывает доказательства.
Короткий текст экономит часть выходных токенов. Предотвращённое исследование и переделка обычно экономят больше.
5. Фильтруйте вывод инструментов и тестов
Большой вывод команд входит в рабочий контекст. Запускайте самый узкий тест, способный доказать изменение:
pnpm vitest run tests/unit/auth.test.ts
rg -n "FAIL|ERROR" test-output.log
git diff --check
Не скрывайте ошибки ради экономии. Сохраните упавшее утверждение, релевантные кадры stack trace, код завершения и достаточное окружение для диагностики. Повторяющиеся progress bars, списки всех успешных тестов и тысячи нерелевантных строк можно убрать.
Стабильную предобработку оформляйте скриптом или hook. В руководстве Anthropic по стоимости приводится пример фильтрации большого тестового лога до чтения Claude. Маленький проверенный фильтр надёжнее, чем повторный поиск шума моделью на каждом запуске.
Исследование с множеством чтений файлов можно передать узкому subagent, чтобы основная сессия получила короткую сводку. Это изоляция контекста, а не гарантия меньшего общего расхода: у subagent есть собственное окно. Делегирование выгодно, когда сводка предотвращает повторное чтение в главной задаче.
6. Подбирайте модель и effort под решение
Модель влияет и на ставку, и на число попыток. Claude Sonnet 5 — практичная отправная точка для повседневной работы, Claude Haiku 4.5 подходит для узких повторяемых задач, а Claude Opus 5 легче оправдать для архитектуры, неоднозначности и дорогих ошибок.
Переключайтесь намеренно через /model. Более полная политика маршрутизации есть в руководстве по моделям Claude Code.
На API-пути токены extended thinking оплачиваются как выходные. Для простой и точной задачи снизьте effort через /effort и проверьте, проходит ли результат. Для незнакомой отладки или сложного планирования слишком низкий effort может создать повторы, которые съедят экономию.
Не отправляйте всё самой дешёвой модели и не называйте это оптимизацией. Сравнивайте стоимость принятого результата вместе с исправлениями и долгом ревью.
7. После оптимизации добавьте финансовую защиту
Лимит расходов не уменьшает число токенов. Он ограничивает ущерб, если цикл, утёкший ключ или неожиданная нагрузка продолжает отправлять запросы.
В OmniaKey создайте отдельные ключи для локальной разработки, автоматизации и общих нагрузок в панели API Keys. Назначьте каждому лимит по назначению и просмотрите использование перед повышением. Несколько ключей упрощают атрибуцию и отзыв по сравнению с одним безлимитным секретом.
Правильная последовательность:
- убрать ненужный контекст и повторы;
- измерить нормальную стоимость задачи;
- установить лимит выше допустимого разброса;
- предупреждать или останавливать нагрузку за границей.
Слишком низкий лимит превращает проблему стоимости в падение посреди задачи. Лимит без анализа сообщает лишь о достижении потолка.
Десятиминутный аудит токенов Claude Code
Проверьте одну реальную сессию:
- Запустите
/usageи запишите расход по моделям. - Запустите
/contextи найдите крупнейший устранимый источник. - Используйте
/clear, если задача не связана с прошлым разговором. - Сократите
CLAUDE.md, специализированные инструкции перенесите в skills. - Отключите неиспользуемые MCP servers через
/mcp. - Замените широкий запрос на файл, симптом, границу и критерий приёмки.
- Запускайте целевые тесты и убирайте повторяющийся вывод, не скрывая ошибки.
- Подберите
/modelи/effortпо сложности. - Повторите задачу того же класса и сравните стоимость готового результата.
- После определения нормального диапазона добавьте лимит ключа.
Меняйте одну-две переменные за раз. Если одновременно очистить сессию, сменить модель, снизить effort и переписать задачу, причина улучшения останется неизвестной.
Частые ошибки
Просить только короткий ответ
Это уменьшает видимый текст, но не историю, чтение файлов, инструменты и thinking. Приём полезен, но редко является главным рычагом.
Удалять контекст, который ещё нужен
Недостающие ограничения ведут к догадкам и переделке. Сохраните проверенные решения до очистки или compact.
Считать cache hit нулевым использованием
Prompt caching может снизить цену повторного ввода, но кешированные токены всё равно видны в учёте. Повторяемый контекст должен оставаться полезным, а сумму нужно сверять со счётом.
Вызывать subagent для каждого мелкого вопроса
У каждого subagent собственный стартовый и рабочий контекст. Делегируйте ограниченное объёмное исследование; маленький локальный вопрос решайте в текущей сессии.
Путать лимит с оптимизацией
Лимит ключа останавливает расход на границе, но не делает запросы до неё эффективнее.
Часто задаваемые вопросы
Почему расход токенов Claude Code высокий при коротком ответе?
Запрос может включать историю, правила проекта, файлы, вывод команд, инструменты и thinking, которые намного длиннее ответа. Проверяйте /context и /usage.
Удаляет ли /clear предыдущую сессию Claude Code?
Команда начинает новую сессию. Сначала назовите важную работу через /rename, а позже вернитесь к сохранённой сессии через /resume.
Всегда ли /compact снижает счёт?
Он уменьшает историю в будущих запросах и может снизить последующий входной расход. Итог зависит от продолжительности сессии и содержимого сводки, поэтому проверяйте /usage и биллинг.
Нужно ли всегда использовать Haiku ради экономии?
Нет. Haiku выгоден для узких задач, но несколько неудачных попыток могут стоить дороже одного успешного хода Sonnet или Opus. Маршрутизируйте по задаче.
Может ли лимит API-ключа сократить расход токенов?
Нет. Он ограничивает деньги после потребления. Совмещайте его с компактным контекстом, точными запросами, подходящим effort и проверкой вызовов.
Источники
- Anthropic: управление стоимостью Claude Code
- Anthropic: окно контекста Claude Code
- Anthropic: лучшие практики Claude Code
- Anthropic: настройка моделей и effort
- Anthropic: Prompt caching
- Документация OmniaKey по балансу и использованию
Факты проверены 8 августа 2026 года. Команды Claude Code, поведение моделей и интерфейсы биллинга меняются; перед производственным бюджетированием сверяйтесь с первичными источниками и своими записями использования.