Ahorrar tokens en Claude Code se ha convertido en una obsesión para miles de desarrolladores que pagan suscripciones de hasta 180 dólares al mes. Muchos se quedan sin límite de uso antes del mediodía. Si programas con inteligencia artificial, seguro sabes de qué hablo.
Empiezas una sesión fluida, el agente responde rápido y todo funciona como magia. Sin embargo, de repente las respuestas se hacen más lentas y los errores se acumulan. Entonces recibes ese mensaje frustrante que te dice que has alcanzado tu cuota.
En realidad, no es que la herramienta sea mala. El problema es que, por defecto, no sabe contenerse cuando lee tu proyecto.
Tu código no necesita caber entero en cada respuesta
Cuando le pides a Claude Code que modifique una función específica, la herramienta no solo lee esa función. Por el contrario, en muchos casos el agente ejecuta comandos grep sin restricciones y vuelca miles de líneas de resultados en la ventana de chat.
Además, en otros escenarios usa la herramienta Read para cargar archivos completos de más de 2.000 líneas. Lo peor es que solo necesita modificar tres o cuatro líneas de ese archivo.
Cada una de esas líneas se convierte en tokens que se acumulan en el contexto de la conversación. Como los modelos de lenguaje reenvían todo el historial en cada turno, ese peso se multiplica. Un error cometido en el mensaje número tres se paga una y otra vez en los turnos cuarto, quinto y sexto.
Este comportamiento no es una teoría. Es un problema documentado a nivel oficial. Según DevClass en su publicación del 1 de abril de 2026, Anthropic reconoció que los usuarios de Claude Code estaban agotando sus límites de uso mucho más rápido de lo esperado.
Por si fuera poco, un usuario en Reddit reportó haber consumido 85.000 de sus 100.000 tokens disponibles en una única sesión de refactoring. Lo más grave es que el sistema no le advirtió del gasto desmedido.
La acumulación de contexto innecesario no solo quema tu cuota. También degrada la calidad de las respuestas, porque el modelo debe procesar más ruido antes de llegar a la información relevante. Por lo tanto, ahorrar tokens en Claude Code no es solo una cuestión de dinero, sino de calidad.
Reducir tokens en Claude Code: el script que frena el despilfarro
Un desarrollador publicó en Hacker Noon a finales de julio de 2026 la solución que él mismo construyó después de semanas de frustración. El script se conoce como enforce-limits.sh y funciona como un filtro previo.
Básicamente, revisa cada comando que el agente de IA está a punto de ejecutar. Si detecta un patrón problemático, como un grep sin límite de resultados o una lectura de archivo completo, lo reescribe automáticamente con una sintaxis más eficiente. Luego se la devuelve al modelo como sugerencia.
El resultado es que el agente nunca ejecuta el comando despilfarrador. En su lugar, trabaja con una versión acotada del mismo comando.
La integración se hace a través de un archivo de manifiesto JSON que registra el script como un plugin de Claude Code. Esto significa que las reglas se aplican de forma automática en cualquier proyecto sin configuración adicional.
Según las primeras mediciones compartidas por el autor, la reducción del consumo de tokens en tareas de edición intensiva oscila entre el 75% y el 80%. Un desarrollador que antes agotaba su límite diario en tres o cuatro horas ahora puede trabajar una jornada completa sin interrupciones.
Además, el agente responde con mayor velocidad porque no necesita procesar bloques gigantescos de resultados del terminal.
La diferencia clave frente a otras soluciones es notable. Añadir reglas al archivo CLAUDE.md no funciona bien en sesiones largas, ya que los modelos tienden a perder el hilo de las directivas y vuelven a sus patrones por defecto.
En cambio, este filtro actúa a nivel de sistema. No importa si el modelo olvida la regla, porque el comando problemático simplemente nunca se ejecuta. Si quieres ahorrar tokens en Claude Code de forma consistente, esta capa intermedia marca la diferencia.
Lo que la investigación técnica dice sobre el desperdicio de contexto
El problema del consumo excesivo no es un capricho. Tiene raíces profundas en la arquitectura de los asistentes de código basados en modelos de lenguaje grande.
Un artículo de investigación publicado en arXiv en agosto de 2025, titulado “Context Engineering for Multi-Agent LLM Code Assistants”, demostró algo muy claro. La gestión ineficiente del contexto es una de las principales causas de degradación en la precisión de los agentes de código.
Los autores probaron métodos de compresión selectiva del contexto y encontraron mejoras significativas en la fiabilidad. Esto ocurrió cuando se reducía el ruido en la ventana de contexto, lo cual valida exactamente lo que el script enforce-limits.sh hace a nivel práctico.
Por su parte, Anthropic abordó el problema desde su propio laboratorio. En un artículo técnico publicado el 29 de septiembre de 2025 bajo el título “Effective Context Engineering for AI Agents”, la compañía detalló su enfoque.
El modelo recibe el historial de mensajes y lo resume para conservar solo los detalles críticos antes de cada nueva generación. Este principio, reducir lo que el modelo necesita procesar, es precisamente la filosofía detrás del plugin.
El coste medio de operar estas herramientas no es baladí. Según datos de la consultora getDX publicados en junio de 2026, un desarrollador que combina herramientas en línea y agentes de IA gasta entre 200 y 600 dólares al mes solo en tokens y licencias.
En ese contexto, ahorrar tokens en Claude Code deja de ser un lujo y se convierte en una necesidad económica para cualquier equipo de desarrollo.
Optimización oficial: Anthropic recortó el 80% del system prompt
Mientras la comunidad desarrollaba soluciones externas, Anthropic trabajaba en su propia optimización. A finales de julio de 2026, la compañía confirmó que había eliminado más del 80% del system prompt original que alimentaba Claude Code para sus modelos Claude 5.
Lo más relevante es que esta reducción no afectó negativamente los resultados en evaluaciones de programación. Según el reporte de TechStrong.ai publicado el 26 de julio de 2026, la decisión se basa en un principio poderoso: los modelos más recientes tienen mejor criterio propio y ya no necesitan reglas explícitas tan extensas.
Este recorte importa mucho porque el system prompt se incluye en cada llamada al modelo. Es decir, esos tokens se consumen en cada turno sin que el usuario los haya generado. Al reducir esa carga en más del 80%, el ahorro se traduce directamente en más tokens disponibles para el trabajo real.
Además, la compañía añadió instrucciones para reducir la verbosidad del agente. Este cambio se implementó el 16 de abril de 2026 según su propio postmortem, y se suma a las optimizaciones de contexto que venían trabajando desde finales de 2025.
La lección es clara. Reducir tokens en Claude Code no depende solo de lo que haga el usuario, sino también de cómo la empresa diseña la experiencia por defecto.
Ahorrar tokens en Claude Code: qué puedes hacer tú mismo
Más allá del script y de las mejoras de Anthropic, hay prácticas concretas que puedes aplicar desde tu próxima sesión. Lo primero es ser específico en tus instrucciones.
En lugar de decirle al agente “arregla este archivo”, dile exactamente qué función necesitas modificar y en qué archivo se encuentra. La plataforma MindStudio recopiló en abril de 2026 un listado de 18 técnicas de gestión de tokens que incluyen desde usar el plugin /schedule para acotar el alcance de las sesiones hasta evitar que el agente lea archivos irrelevantes.
Otro consejo que funciona sorprendentemente bien es reiniciar la sesión cuando notes que las respuestas se vuelven más lentas o genéricas. En sesiones prolongadas, la acumulación de contexto alcanza un punto donde el modelo pierde precisión.
Lo que te ahorras en tiempo al no reiniciar, lo pierdes en correcciones manuales. Branch8, una consultora de desarrollo, documentó en abril de 2026 cómo su estrategia de scripts de enrutamiento les permitió reducir el coste medio de 13 dólares por desarrollador al día a apenas 4 dólares.
Esta reducción del 70% demuestra que la gestión activa del consumo marca la diferencia entre una herramienta rentable y una que te vacía la billetera.
En conclusión, ahorrar tokens en Claude Code no requiere ser un experto en prompts ni entender la arquitectura interna de los modelos de lenguaje. Se trata de ser consciente de que cada línea que el agente lee tiene un coste que se multiplica con cada interacción.
Con el filtro adecuado y hábitos mínimos de higiene de contexto, tu suscripción puede rendir el doble o el triple sin sacrificar calidad.
