DeepSeek V4 Flash ya está disponible · Nuestro precio de GLM-5.2 baja al 50% del oficial
Blog
Control de costos

Reducir el consumo de tokens de Claude Code

El mayor ahorro suele venir de reducir el contexto repetido y evitar retrabajo, no de pedir una respuesta final más corta.

12 min de lecturaOmniaKey
Claude Codetoken usagecontextcost control

Para reducir el consumo de tokens de Claude Code, controla lo que el modelo debe procesar en cada turno. Una respuesta corta puede seguir siendo cara si la petición arrastra una conversación larga, varios archivos, salida de comandos, instrucciones del proyecto, definiciones de herramientas y extended thinking.

El objetivo útil no es gastar el mínimo en una respuesta. Es minimizar el coste total de un cambio aceptado, incluyendo investigación, edición, pruebas, correcciones y revisión humana.

Optimiza el coste por cambio aceptado, no los tokens por respuesta. Eliminar contexto necesario puede abaratar un turno y encarecer toda la tarea si Claude adivina, modifica archivos equivocados o necesita tres rondas de reparación.

Esta guía usa controles actuales de Claude Code como /usage, /context, /clear, /compact, /model, /effort y /mcp. Se aplica de forma más directa a sesiones facturadas por API. Los planes de suscripción usan ventanas de cuota en lugar de una factura por petición, pero los mismos hábitos ayudan a que esa cuota dure más.

Por qué Claude Code usa más tokens que una respuesta de chat

Claude Code es un agente, no una sola pregunta seguida de una sola respuesta. Una sesión de trabajo puede incluir:

  • tu prompt y todos los turnos anteriores que sigan siendo relevantes;
  • archivos que Claude lee al explorar el repositorio;
  • salida de comandos, pruebas, compiladores y herramientas;
  • CLAUDE.md, reglas aplicables al proyecto y skills invocadas;
  • definiciones y resultados de herramientas de MCP servers;
  • planificación, extended thinking, código generado y explicaciones;
  • resúmenes de subagent y correcciones posteriores.

El contexto es acumulativo. Si un log antiguo o una discusión de diseño no relacionada permanece en la conversación, los turnos siguientes pueden volver a procesarlo. Prompt caching puede reducir el precio del contenido repetido y Claude Code compacta el historial cerca del límite, pero ninguno justifica conservar material irrelevante indefinidamente.

Un orden práctico de optimización es:

  1. medir una tarea representativa;
  2. eliminar el contexto no relacionado;
  3. reducir instrucciones permanentes y sobrecarga de herramientas;
  4. evitar exploración amplia y salida ruidosa;
  5. elegir modelo y effort de forma deliberada;
  6. volver a medir la tarea terminada.

Empieza con una línea base, no con una sensación

Ejecuta /usage antes de optimizar. Para usuarios de API, el bloque Session informa del uso por modelo y calcula localmente un coste con las tarifas estándar. Puede no reflejar una promoción del gateway o una tarifa contratada, así que la factura real del proveedor sigue siendo la fuente financiera de referencia.

Ejecuta /context para ver qué ocupa la ventana actual. Un CLAUDE.md grande, una skill invocada o la sobrecarga de herramientas dejan de ser una suposición y pasan a ser datos visibles.

Si la sesión usa OmniaKey, compara ese diagnóstico con el dashboard de uso. Registra el modelo solicitado, tokens de entrada y salida, metadatos de caché, latencia y coste real por llamada. La guía de saldo y uso explica el saldo, los límites por key y el historial de peticiones.

Elige una tarea repetible y registra antes y después:

MedidaPor qué importa
Tokens de entrada, cache read, cache write y salidaMuestra dónde se acumula el consumo
Número de turnos y llamadas a herramientasExpone bucles y exploración repetida
Reintentos o correcciones humanasCaptura turnos baratos que generan retrabajo caro
Pruebas y criterios de aceptación superadosEvita optimizar a costa de la corrección
Coste final facturadoMide el resultado que realmente pagas

No compares sesiones sin relación. Corregir una errata y explorar una migración desconocida no forman un benchmark útil.

1. Limpia el contexto entre tareas no relacionadas

El hábito de mayor impacto es también el más sencillo: usa /clear cuando la siguiente tarea no necesite la conversación actual.

Antes de limpiar una sesión que puedas necesitar después, ponle nombre:

text
/rename auth-refresh-investigation
/clear

La sesión anterior queda disponible mediante /resume. Claude Code actual también reinicia los totales Session de /usage después de /clear, lo que facilita medir la siguiente tarea por separado.

Conviene limpiar al:

  • pasar de un bug de backend a texto de marketing no relacionado;
  • terminar una función y empezar en otra zona del repositorio;
  • abandonar un enfoque cuyas premisas eran incorrectas;
  • acumular varios logs grandes que ya no afectan a la decisión.

No limpies solo porque creció el medidor de contexto. Si la tarea continúa, conserva primero los hechos y decisiones verificados o compacta con instrucciones explícitas.

2. Usa /compact con intención en trabajos largos

/compact resume el historial anterior para que los turnos futuros trabajen con una representación menor. Indica qué debe sobrevivir:

text
/compact Conserva los criterios de aceptación, archivos modificados, salida de pruebas fallidas y decisiones pendientes.

Es más seguro que un resumen genérico para una implementación larga. También puedes añadir una instrucción breve de compactación a CLAUDE.md si la misma regla sirve para todo el proyecto.

Compactar no reinicia una cuota de suscripción, y una advertencia de contexto no es un aviso de límite de facturación. La compactación gestiona lo que permanece en la conversación; no añade cuota ni recarga saldo de API.

Usa /compact cuando la tarea siga siendo coherente pero el camino hasta el estado actual haya sido ruidoso. Usa /clear cuando haya cambiado el trabajo.

3. Reduce el contexto que se carga antes de empezar

Claude Code lee instrucciones del proyecto al inicio. Las instrucciones útiles previenen errores; un manual cargado en cada sesión consume contexto aunque la tarea no lo necesite.

La guía actual de Anthropic recomienda mantener CLAUDE.md conciso y mover procesos especializados a skills bajo demanda. Un buen archivo raíz contiene principalmente:

  • comandos que verifican un cambio;
  • límites arquitectónicos propios del repositorio;
  • restricciones de entorno no evidentes;
  • convenciones que difieren de los valores normales del lenguaje.

Mueve tutoriales extensos de API, runbooks de una sola migración y material de referencia. Enlázalos o conviértelos en una skill enfocada, en vez de incrustarlos en toda sesión.

Los MCP servers presentan el mismo equilibrio. Ejecuta /mcp y desactiva los que no uses. Claude Code difiere las definiciones completas por defecto, pero los nombres y schemas invocados ocupan contexto. Para una operación simple, un CLI específico como gh, aws o sentry-cli puede ser más eficiente que una superficie amplia de herramientas.

Vuelve a consultar /context tras limpiar. Si el tamaño inicial no cambió, identifica el contribuyente real antes de editar más configuración.

4. Delimita la tarea para evitar exploraciones completas

"Mejora este repositorio" invita a escanearlo. Un prompt acotado conduce directamente a la evidencia:

text
Corrige el 401 tras renovar el token en src/api/auth.ts.
Conserva la forma pública de la respuesta.
Añade una prueba de regresión para un access token caducado con refresh token válido.
Ejecuta la prueba enfocada de auth y el typecheck.

El prompt identifica síntoma, archivo probable, contrato y comprobación. Claude puede seguir dependencias cuando haga falta, pero no tiene motivo para leer primero todo el repositorio.

En tareas realmente complejas, planifica antes de editar. Una fase corta de investigación y plan puede evitar una implementación cara sobre la arquitectura equivocada. En un arreglo de una línea bien localizado, el plan puede ser sobrecarga. Úsalo cuando exista incertidumbre real.

Corrige el rumbo pronto. Si Claude resuelve el problema equivocado, detén el turno en vez de dejar que genere un parche grande y explicar después por qué hay que deshacerlo. /rewind puede restaurar conversación y código a un checkpoint anterior.

También ayuda un contrato de salida:

  • empezar por la decisión;
  • listar solo archivos modificados y verificación;
  • no repetir la pregunta;
  • pedir la información que falta antes de implementar;
  • limitar longitud solo cuando no oculte pruebas necesarias.

Una prosa más corta ahorra algunos tokens de salida. Evitar exploración y retrabajo suele ahorrar mucho más.

5. Mantén enfocada la salida de herramientas y pruebas

La salida extensa de comandos entra en el contexto. Prefiere el comando más estrecho que pueda demostrar el cambio:

bash
pnpm vitest run tests/unit/auth.test.ts
rg -n "FAIL|ERROR" test-output.log
git diff --check

No ocultes fallos para reducir tokens. Conserva la aserción fallida, stack frames relevantes, estado de salida y contexto suficiente para diagnosticar. Elimina barras repetidas, listas de pruebas correctas y miles de líneas ajenas.

El preprocesamiento estable debe vivir en un script o hook. La guía de costes de Anthropic pone como ejemplo filtrar un log muy grande antes de que Claude lo lea. Un filtro pequeño y revisado es más fiable que pedir al modelo que redescubra el ruido cada vez.

Una investigación que exige muchas lecturas puede delegarse a un subagent acotado para devolver solo un resumen a la conversación principal. Esto aísla contexto; no garantiza menos tokens totales, porque el subagent tiene su propia ventana. Úsalo cuando el resumen evite releer en la tarea principal.

6. Ajusta modelo y effort a la decisión

La elección de modelo cambia la tarifa y el número de intentos. Claude Sonnet 5 es un punto de partida diario, Claude Haiku 4.5 encaja en trabajo estrecho y repetible, y Claude Opus 5 se justifica mejor con arquitectura, ambigüedad o alto coste de error.

Usa /model para cambiar de forma intencionada. La guía de modelos para Claude Code ofrece una política más completa.

En rutas de API, los tokens de extended thinking se facturan como salida. Para una tarea simple y bien especificada, baja el effort con /effort y comprueba si el resultado sigue pasando. En planificación difícil o depuración desconocida, un effort insuficiente puede crear reintentos que anulan el ahorro.

No envíes todo al modelo más barato y lo llames optimización. Compara coste por resultado aceptado, incluidas correcciones y deuda de revisión.

7. Añade un límite financiero después de reducir el uso

Un límite de gasto no reduce tokens. Limita el daño financiero si un bucle, una key filtrada o una carga inesperada continúa enviando peticiones.

Con OmniaKey, crea keys separadas para desarrollo local, automatización y cargas compartidas en el dashboard de API Keys. Asigna a cada una un límite acorde a su función y revisa el uso antes de elevarlo. Separarlas mejora atribución y revocación frente a una sola credencial ilimitada.

El orden importa:

  1. elimina contexto y reintentos innecesarios;
  2. mide el coste normal de la tarea;
  3. fija un límite por encima de la variación legítima;
  4. alerta o detén la carga al cruzar esa frontera.

Un límite demasiado bajo solo convierte un problema de coste en un fallo a mitad de tarea. Sin revisión de uso, solo informa de que se alcanzó el techo.

Auditoría de tokens de Claude Code en 10 minutos

Aplica esta lista a una sesión real:

  1. Ejecuta /usage y registra el uso por modelo.
  2. Ejecuta /context e identifica el mayor elemento evitable.
  3. Usa /clear si la tarea no depende de la conversación anterior.
  4. Acorta CLAUDE.md y mueve instrucciones específicas a skills.
  5. Desactiva MCP servers no utilizados con /mcp.
  6. Sustituye prompts amplios por archivo, síntoma, límite y aceptación.
  7. Ejecuta pruebas enfocadas y filtra repeticiones sin ocultar fallos.
  8. Ajusta /model y /effort a la dificultad.
  9. Repite la misma clase de tarea y compara el coste terminado.
  10. Añade un límite por key cuando conozcas el rango normal.

Cambia una o dos variables cada vez. Si limpias, cambias modelo, bajas effort y reescribes la tarea al mismo tiempo, no sabrás qué ayudó.

Errores habituales

Pedir solo respuestas más cortas

Reduce la salida visible, pero deja intactos historial, archivos, herramientas y thinking. Es útil, aunque rara vez sea la mayor palanca.

Eliminar contexto que la tarea necesita

Las restricciones ausentes provocan conjeturas y retrabajo. Conserva decisiones verificadas antes de limpiar o compactar.

Tratar un cache hit como uso cero

Prompt caching puede bajar el precio de entrada repetida, pero los tokens cacheados siguen apareciendo en el registro. Mantén útil el contexto y revisa la factura real.

Usar un subagent para cada pregunta pequeña

Cada subagent tiene contexto inicial y de trabajo propio. Delega investigación acotada y voluminosa; resuelve una pregunta local pequeña en la sesión actual.

Confundir límite con optimización

Un límite de key detiene gasto en una frontera. No vuelve más eficientes las peticiones anteriores.

Preguntas frecuentes

¿Por qué el consumo de Claude Code es alto si la respuesta es corta?

La petición puede incluir historial, reglas del proyecto, archivos, salida de comandos, herramientas y thinking mucho mayores que el texto final. Consulta /context y /usage.

¿/clear elimina mi sesión anterior de Claude Code?

Inicia una sesión nueva. Nombra primero el trabajo importante con /rename y vuelve después mediante /resume.

¿/compact siempre reduce la factura?

Reduce el historial de turnos futuros y puede bajar su entrada. El efecto neto depende de cuánto continúe la sesión y qué preserve el resumen; verifícalo con /usage y el dashboard.

¿Debo usar siempre Haiku para ahorrar tokens?

No. Haiku puede ser económico en trabajo estrecho, pero varios intentos fallidos pueden costar más que un turno correcto de Sonnet u Opus. Enruta por tarea.

¿Un límite de gasto de API key reduce tokens?

No. Limita dinero después del consumo. Combínalo con contexto menor, prompts enfocados, effort deliberado y revisión por llamada.

Fuentes

Datos verificados el 8 de agosto de 2026. Los comandos, modelos y superficies de facturación de Claude Code cambian; comprueba la documentación oficial y tus registros reales antes de fijar un presupuesto de producción.