Reducir el consumo de tokens de Claude Code
El mayor ahorro suele venir de reducir el contexto repetido y evitar retrabajo, no de pedir una respuesta final más corta.
Para reducir el consumo de tokens de Claude Code, controla lo que el modelo debe procesar en cada turno. Una respuesta corta puede seguir siendo cara si la petición arrastra una conversación larga, varios archivos, salida de comandos, instrucciones del proyecto, definiciones de herramientas y extended thinking.
El objetivo útil no es gastar el mínimo en una respuesta. Es minimizar el coste total de un cambio aceptado, incluyendo investigación, edición, pruebas, correcciones y revisión humana.
Optimiza el coste por cambio aceptado, no los tokens por respuesta. Eliminar contexto necesario puede abaratar un turno y encarecer toda la tarea si Claude adivina, modifica archivos equivocados o necesita tres rondas de reparación.
Esta guía usa controles actuales de Claude Code como /usage, /context, /clear, /compact, /model, /effort y /mcp. Se aplica de forma más directa a sesiones facturadas por API. Los planes de suscripción usan ventanas de cuota en lugar de una factura por petición, pero los mismos hábitos ayudan a que esa cuota dure más.
Por qué Claude Code usa más tokens que una respuesta de chat
Claude Code es un agente, no una sola pregunta seguida de una sola respuesta. Una sesión de trabajo puede incluir:
- tu prompt y todos los turnos anteriores que sigan siendo relevantes;
- archivos que Claude lee al explorar el repositorio;
- salida de comandos, pruebas, compiladores y herramientas;
CLAUDE.md, reglas aplicables al proyecto y skills invocadas;- definiciones y resultados de herramientas de MCP servers;
- planificación, extended thinking, código generado y explicaciones;
- resúmenes de subagent y correcciones posteriores.
El contexto es acumulativo. Si un log antiguo o una discusión de diseño no relacionada permanece en la conversación, los turnos siguientes pueden volver a procesarlo. Prompt caching puede reducir el precio del contenido repetido y Claude Code compacta el historial cerca del límite, pero ninguno justifica conservar material irrelevante indefinidamente.
Un orden práctico de optimización es:
- medir una tarea representativa;
- eliminar el contexto no relacionado;
- reducir instrucciones permanentes y sobrecarga de herramientas;
- evitar exploración amplia y salida ruidosa;
- elegir modelo y effort de forma deliberada;
- volver a medir la tarea terminada.
Empieza con una línea base, no con una sensación
Ejecuta /usage antes de optimizar. Para usuarios de API, el bloque Session informa del uso por modelo y calcula localmente un coste con las tarifas estándar. Puede no reflejar una promoción del gateway o una tarifa contratada, así que la factura real del proveedor sigue siendo la fuente financiera de referencia.
Ejecuta /context para ver qué ocupa la ventana actual. Un CLAUDE.md grande, una skill invocada o la sobrecarga de herramientas dejan de ser una suposición y pasan a ser datos visibles.
Si la sesión usa OmniaKey, compara ese diagnóstico con el dashboard de uso. Registra el modelo solicitado, tokens de entrada y salida, metadatos de caché, latencia y coste real por llamada. La guía de saldo y uso explica el saldo, los límites por key y el historial de peticiones.
Elige una tarea repetible y registra antes y después:
| Medida | Por qué importa |
|---|---|
| Tokens de entrada, cache read, cache write y salida | Muestra dónde se acumula el consumo |
| Número de turnos y llamadas a herramientas | Expone bucles y exploración repetida |
| Reintentos o correcciones humanas | Captura turnos baratos que generan retrabajo caro |
| Pruebas y criterios de aceptación superados | Evita optimizar a costa de la corrección |
| Coste final facturado | Mide el resultado que realmente pagas |
No compares sesiones sin relación. Corregir una errata y explorar una migración desconocida no forman un benchmark útil.
1. Limpia el contexto entre tareas no relacionadas
El hábito de mayor impacto es también el más sencillo: usa /clear cuando la siguiente tarea no necesite la conversación actual.
Antes de limpiar una sesión que puedas necesitar después, ponle nombre:
/rename auth-refresh-investigation
/clear
La sesión anterior queda disponible mediante /resume. Claude Code actual también reinicia los totales Session de /usage después de /clear, lo que facilita medir la siguiente tarea por separado.
Conviene limpiar al:
- pasar de un bug de backend a texto de marketing no relacionado;
- terminar una función y empezar en otra zona del repositorio;
- abandonar un enfoque cuyas premisas eran incorrectas;
- acumular varios logs grandes que ya no afectan a la decisión.
No limpies solo porque creció el medidor de contexto. Si la tarea continúa, conserva primero los hechos y decisiones verificados o compacta con instrucciones explícitas.
2. Usa /compact con intención en trabajos largos
/compact resume el historial anterior para que los turnos futuros trabajen con una representación menor. Indica qué debe sobrevivir:
/compact Conserva los criterios de aceptación, archivos modificados, salida de pruebas fallidas y decisiones pendientes.
Es más seguro que un resumen genérico para una implementación larga. También puedes añadir una instrucción breve de compactación a CLAUDE.md si la misma regla sirve para todo el proyecto.
Compactar no reinicia una cuota de suscripción, y una advertencia de contexto no es un aviso de límite de facturación. La compactación gestiona lo que permanece en la conversación; no añade cuota ni recarga saldo de API.
Usa /compact cuando la tarea siga siendo coherente pero el camino hasta el estado actual haya sido ruidoso. Usa /clear cuando haya cambiado el trabajo.
3. Reduce el contexto que se carga antes de empezar
Claude Code lee instrucciones del proyecto al inicio. Las instrucciones útiles previenen errores; un manual cargado en cada sesión consume contexto aunque la tarea no lo necesite.
La guía actual de Anthropic recomienda mantener CLAUDE.md conciso y mover procesos especializados a skills bajo demanda. Un buen archivo raíz contiene principalmente:
- comandos que verifican un cambio;
- límites arquitectónicos propios del repositorio;
- restricciones de entorno no evidentes;
- convenciones que difieren de los valores normales del lenguaje.
Mueve tutoriales extensos de API, runbooks de una sola migración y material de referencia. Enlázalos o conviértelos en una skill enfocada, en vez de incrustarlos en toda sesión.
Los MCP servers presentan el mismo equilibrio. Ejecuta /mcp y desactiva los que no uses. Claude Code difiere las definiciones completas por defecto, pero los nombres y schemas invocados ocupan contexto. Para una operación simple, un CLI específico como gh, aws o sentry-cli puede ser más eficiente que una superficie amplia de herramientas.
Vuelve a consultar /context tras limpiar. Si el tamaño inicial no cambió, identifica el contribuyente real antes de editar más configuración.
4. Delimita la tarea para evitar exploraciones completas
"Mejora este repositorio" invita a escanearlo. Un prompt acotado conduce directamente a la evidencia:
Corrige el 401 tras renovar el token en src/api/auth.ts.
Conserva la forma pública de la respuesta.
Añade una prueba de regresión para un access token caducado con refresh token válido.
Ejecuta la prueba enfocada de auth y el typecheck.
El prompt identifica síntoma, archivo probable, contrato y comprobación. Claude puede seguir dependencias cuando haga falta, pero no tiene motivo para leer primero todo el repositorio.
En tareas realmente complejas, planifica antes de editar. Una fase corta de investigación y plan puede evitar una implementación cara sobre la arquitectura equivocada. En un arreglo de una línea bien localizado, el plan puede ser sobrecarga. Úsalo cuando exista incertidumbre real.
Corrige el rumbo pronto. Si Claude resuelve el problema equivocado, detén el turno en vez de dejar que genere un parche grande y explicar después por qué hay que deshacerlo. /rewind puede restaurar conversación y código a un checkpoint anterior.
También ayuda un contrato de salida:
- empezar por la decisión;
- listar solo archivos modificados y verificación;
- no repetir la pregunta;
- pedir la información que falta antes de implementar;
- limitar longitud solo cuando no oculte pruebas necesarias.
Una prosa más corta ahorra algunos tokens de salida. Evitar exploración y retrabajo suele ahorrar mucho más.
5. Mantén enfocada la salida de herramientas y pruebas
La salida extensa de comandos entra en el contexto. Prefiere el comando más estrecho que pueda demostrar el cambio:
pnpm vitest run tests/unit/auth.test.ts
rg -n "FAIL|ERROR" test-output.log
git diff --check
No ocultes fallos para reducir tokens. Conserva la aserción fallida, stack frames relevantes, estado de salida y contexto suficiente para diagnosticar. Elimina barras repetidas, listas de pruebas correctas y miles de líneas ajenas.
El preprocesamiento estable debe vivir en un script o hook. La guía de costes de Anthropic pone como ejemplo filtrar un log muy grande antes de que Claude lo lea. Un filtro pequeño y revisado es más fiable que pedir al modelo que redescubra el ruido cada vez.
Una investigación que exige muchas lecturas puede delegarse a un subagent acotado para devolver solo un resumen a la conversación principal. Esto aísla contexto; no garantiza menos tokens totales, porque el subagent tiene su propia ventana. Úsalo cuando el resumen evite releer en la tarea principal.
6. Ajusta modelo y effort a la decisión
La elección de modelo cambia la tarifa y el número de intentos. Claude Sonnet 5 es un punto de partida diario, Claude Haiku 4.5 encaja en trabajo estrecho y repetible, y Claude Opus 5 se justifica mejor con arquitectura, ambigüedad o alto coste de error.
Usa /model para cambiar de forma intencionada. La guía de modelos para Claude Code ofrece una política más completa.
En rutas de API, los tokens de extended thinking se facturan como salida. Para una tarea simple y bien especificada, baja el effort con /effort y comprueba si el resultado sigue pasando. En planificación difícil o depuración desconocida, un effort insuficiente puede crear reintentos que anulan el ahorro.
No envíes todo al modelo más barato y lo llames optimización. Compara coste por resultado aceptado, incluidas correcciones y deuda de revisión.
7. Añade un límite financiero después de reducir el uso
Un límite de gasto no reduce tokens. Limita el daño financiero si un bucle, una key filtrada o una carga inesperada continúa enviando peticiones.
Con OmniaKey, crea keys separadas para desarrollo local, automatización y cargas compartidas en el dashboard de API Keys. Asigna a cada una un límite acorde a su función y revisa el uso antes de elevarlo. Separarlas mejora atribución y revocación frente a una sola credencial ilimitada.
El orden importa:
- elimina contexto y reintentos innecesarios;
- mide el coste normal de la tarea;
- fija un límite por encima de la variación legítima;
- alerta o detén la carga al cruzar esa frontera.
Un límite demasiado bajo solo convierte un problema de coste en un fallo a mitad de tarea. Sin revisión de uso, solo informa de que se alcanzó el techo.
Auditoría de tokens de Claude Code en 10 minutos
Aplica esta lista a una sesión real:
- Ejecuta
/usagey registra el uso por modelo. - Ejecuta
/contexte identifica el mayor elemento evitable. - Usa
/clearsi la tarea no depende de la conversación anterior. - Acorta
CLAUDE.mdy mueve instrucciones específicas a skills. - Desactiva MCP servers no utilizados con
/mcp. - Sustituye prompts amplios por archivo, síntoma, límite y aceptación.
- Ejecuta pruebas enfocadas y filtra repeticiones sin ocultar fallos.
- Ajusta
/modely/efforta la dificultad. - Repite la misma clase de tarea y compara el coste terminado.
- Añade un límite por key cuando conozcas el rango normal.
Cambia una o dos variables cada vez. Si limpias, cambias modelo, bajas effort y reescribes la tarea al mismo tiempo, no sabrás qué ayudó.
Errores habituales
Pedir solo respuestas más cortas
Reduce la salida visible, pero deja intactos historial, archivos, herramientas y thinking. Es útil, aunque rara vez sea la mayor palanca.
Eliminar contexto que la tarea necesita
Las restricciones ausentes provocan conjeturas y retrabajo. Conserva decisiones verificadas antes de limpiar o compactar.
Tratar un cache hit como uso cero
Prompt caching puede bajar el precio de entrada repetida, pero los tokens cacheados siguen apareciendo en el registro. Mantén útil el contexto y revisa la factura real.
Usar un subagent para cada pregunta pequeña
Cada subagent tiene contexto inicial y de trabajo propio. Delega investigación acotada y voluminosa; resuelve una pregunta local pequeña en la sesión actual.
Confundir límite con optimización
Un límite de key detiene gasto en una frontera. No vuelve más eficientes las peticiones anteriores.
Preguntas frecuentes
¿Por qué el consumo de Claude Code es alto si la respuesta es corta?
La petición puede incluir historial, reglas del proyecto, archivos, salida de comandos, herramientas y thinking mucho mayores que el texto final. Consulta /context y /usage.
¿/clear elimina mi sesión anterior de Claude Code?
Inicia una sesión nueva. Nombra primero el trabajo importante con /rename y vuelve después mediante /resume.
¿/compact siempre reduce la factura?
Reduce el historial de turnos futuros y puede bajar su entrada. El efecto neto depende de cuánto continúe la sesión y qué preserve el resumen; verifícalo con /usage y el dashboard.
¿Debo usar siempre Haiku para ahorrar tokens?
No. Haiku puede ser económico en trabajo estrecho, pero varios intentos fallidos pueden costar más que un turno correcto de Sonnet u Opus. Enruta por tarea.
¿Un límite de gasto de API key reduce tokens?
No. Limita dinero después del consumo. Combínalo con contexto menor, prompts enfocados, effort deliberado y revisión por llamada.
Fuentes
- Anthropic: gestionar los costes de Claude Code
- Anthropic: explorar la ventana de contexto
- Anthropic: prácticas recomendadas de Claude Code
- Anthropic: configurar modelos y effort
- Anthropic: Prompt caching
- Documentación de saldo y uso de OmniaKey
Datos verificados el 8 de agosto de 2026. Los comandos, modelos y superficies de facturación de Claude Code cambian; comprueba la documentación oficial y tus registros reales antes de fijar un presupuesto de producción.