Cómo ahorrar tokens al programar con IA sin perder calidad

alvaro_moya_autor
Hasta un 60% menos de tokens al programar con IA: las 4 claves de contexto y modelo, 5 herramientas open source verificadas y el estado de los modelos locales en 2026.
4 claves para ahorrar tokens en desarrollo de software

Tabla de contenidos

Si usas agentes IA a diario, ya lo has notado: la ventana de uso se agota más rápido que antes y ahorrar tokens es la gran preocupación para no disparar tu factura cada mes. Es ahí cuando empiezas a preguntarte: ¿de verdad tu suscripción cubre lo que cuesta de verdad ejecutar esto o está subvencionada mientras el mercado se asienta?

No tenemos la respuesta a esa pregunta macro. 

Pero sí sabemos qué es lo que más token consume en el día a día de un developer y cómo reducirlo sin tocar la calidad del output.

En mi propio uso con Claude Code, aplicando lo que viene a continuación, he llegado a ahorrar hasta un 60% de tokens. No es una medición de laboratorio, es lo que veo en mis sesiones diarias y en las de los mentores de LIDR. Pero no hace falta creerme a mí: las cifras públicas de las herramientas que uso para conseguirlo, más abajo, sí están documentadas.


Descubre el método de trabajo que te ayudará a ahorrar tokens en desarrollo de software cada día con AI4Devs. QUIERO SABER MÁS >>


Las 4 claves para ahorrar hasta un 60 de tokens en desarrollo

El instinto cuando la factura de IA sube es mirar el modelo, pero rara vez ahí está el problema.

Una sesión de 30 minutos con Claude Code en un proyecto TypeScript o Rust puede quemar más de 118.000 tokens solo en comandos de terminal como git status, npm install o cargo test. 

El agente lee toda la salida. Tú pagas toda la salida. Y la mayoría es ruido que no cambia ninguna decisión.

Antes de cualquier herramienta, hay cuatro decisiones de workflow que ya defendemos en Spec-Driven Development y que mueven más la aguja que cualquier plugin:

como ahorrar tokens en desarrollo de software

Clave 1. Documenta el contexto técnico en el repositorio.

Si no le das a la IA una carpeta de documentación con tus estándares, arquitectura y convenciones, hace lo único que puede hacer: leer todo el código para intentar deducirlos. Eso consume tokens en cada tarea, y además es inconsistente, hoy analiza una clase con cierta nomenclatura, mañana otra, y no hay forma de saber cuál usará como referencia.

Documentar el contexto técnico no va solo de ahorrar tokens, también da consistencia a todo lo que recoge.

# Contexto del proyecto
Stack: TypeScript + Node.js + PostgreSQL
Framework: NestJS (módulos domain-driven)
Tests: Jest, cobertura mínima 80%
# Convenciones
- Commits en inglés, conventional commits
- Sin comentarios inline salvo lógica no obvia
# Restricciones
- No modificar el esquema sin migración
- No instalar dependencias sin aprobación en PR

Clave 2. Usa los modelos más avanzados solo para planificar.

Los modelos de razonamiento profundo (Claude Opus, nivel de esfuerzo alto en Gemini o ChatGPT) son para la fase de spec: entender el problema, definir criterios, dividir el trabajo en tareas atómicas. 

Si esa planificación es exhaustiva, ejecutarla es un guiaburros que puede seguir un modelo más rápido como Claude Sonnet o nivel de esfuerzo medio sin pérdida de calidad, porque ya no está decidiendo, solo está aplicando. Cambiar de modelo entre fases es donde más se nota el ahorro acumulado a lo largo del día.

 hay una palanca adicional: el prompt caching. Los tokens en caché cuestan el 10% del precio base según la documentación técnica de Anthropic. Si diseñas tu CLAUDE.md para que el contenido estático aparezca primero y el dinámico al final, aplicas ese descuento del 90% a la mayor parte del contexto en cada llamada.

Clave 3. Instala plugins que comprimen lo que ve el modelo.

rtk, codegraph, Headroom, caveman y ponytail actúan en capas distintas: salida de terminal, exploración de código, contexto acumulado, respuestas del agente y código generado. Cada uno resuelve un tipo de ruido diferente. Los cubrimos en detalle en la siguiente sección.

5 bibliotecas open source para ahorrar tokens en Claude Code y agentes IA 

Todas son de código abierto, puedes revisar tú mismo la metodología antes de confiar en la cifra:

HerramientaQué haceCifra publicada (del propio repo)
rtk
github.com/rtk-ai/rtk 
Proxy que comprime la salida de terminal antes de que llegue al modelo (git status, npm install…)60-90% menos tokens en comandos habituales
codegraph  github.com/colbymchenry/codegraph Grafo de conocimiento del código (100% local). El agente consulta el grafo en vez de explorar archivo a archivo~57% menos tokens, ~35% menos coste, ~70% menos tool calls (mediana sobre 7 repos)
caveman
https://github.com/JuliusBrussee/caveman 
Fuerza al agente a responder de forma comprimida, sin relleno~65% menos tokens de salida
ponytail  github.com/DietrichGebert/ponytail Reduce cuánto código escribe el agente y evita sobre-ingeniería80-94% menos código en casos de sobreconstrucción, según su benchmark corregido tras revisión de la comunidad
Headroom https://github.com/headroomlabs-ai/headroom Proxy que comprime el contexto (logs, resultados de tests, salidas de herramientas) antes de contarlo como input60-95%, según su documentación

Son cifras de los propios proyectos, no auditorías externas. El caso de ponytail es un buen ejemplo de por qué eso importa. Su primer benchmark fue cuestionado por la comunidad (la línea base no era comparable) y el autor lo rehízo públicamente.

rtk y codegraph son los más fáciles de adoptar.

# rtk — comprime salida de terminal (macOS/Linux)
brew install rtk

# codegraph — grafo de conocimiento del código
npx @colbymchenry/codegraph

# caveman — respuestas del agente sin relleno (Claude Code)
claude plugin marketplace add JuliusBrussee/caveman \
  && claude plugin install caveman@caveman

No cambian cómo trabajas, solo lo que ve el modelo. caveman y ponytail son más invasivos (cambian el estilo del output y el código generado) y conviene probarlos en un proyecto no crítico primero.

rtk benchmark
Fuente: https://www.rtk-ai.app/benchmarks/
github benchmark
Fuente: https://github.com/colbymchenry/codegraph/blob/main/README.md 

Si antes de reducir quieres saber exactamente dónde se van los tokens, hay dos herramientas de monitorización: claude-usage (dashboard local en el navegador con gráficos de consumo por sesión) y claude-usage-monitor (terminal con predicciones de cuándo agotarás la sesión basadas en tus últimos 8 días de uso). Ninguna requiere configuración, solo instala y abre.

# claude-usage (dashboard en localhost:8080)
git clone https://github.com/phuryn/claude-usage && cd claude-usage && python3 cli.py dashboard

# claude-usage-monitor (terminal en tiempo real)
pip install claude-monitor

Clave 4. Activa el enrutamiento automático.

Cursor y GitHub Copilot ya incluyen un modo Auto que selecciona el modelo según la complejidad de la tarea. Para más control por API, OpenRouter (enrutamiento automático) o LiteLLM (reglas manuales) hacen lo mismo a nivel de gateway.

El CEO de Factory AI, una de las empresas que ofrece este tipo de router, resumía así la tendencia que está viendo: los modelos abiertos ya son suficientes en rendimiento para alrededor del 60% del trabajo de codificación medido en gasto de tokens. No es una cifra auditada, pero apunta a la misma dirección que el resto de este artículo: no todo necesita el modelo más caro.

Modelos open source para ejecutar código y ahorrar tokens

La lógica de las cuatro claves tiene un siguiente paso natural: ejecutar con modelos locales o de bajo coste.

Los datos de 2026 hacen que este argumento sea mucho más concreto que hace un año. 

Kimi K2.6 (Moonshot AI, Modified MIT) alcanza el 80,2% en SWE-Bench Verified. Claude Opus 4.6, el mejor modelo cerrado de pago en ese benchmark, obtiene el 80,8%. 

La diferencia es de 0,6 puntos. 

Y Kimi K2.6 sostuvo más de 4.000 llamadas de herramienta en una sesión de 13 horas ininterrumpidas. Este es el mejor resultado entre modelos abiertos para tareas de agente autónomo de larga duración.

Qwen 3.6 Plus (Alibaba) es el único de este grupo con ventana de contexto de 1M tokens, útil para codebases grandes. GLM-5.2 (Z.ai) lidera en GPQA Diamond (91,2%) y Code Arena para desarrollo frontend.

El Stanford AI Index 2025 cuantifica el cambio: la brecha entre el modelo en primera posición y el décimo cayó del 11,9% al 5,4% en un año.

Hay un dato que convierte esta sección en argumento directo de harness engineering: las puntuaciones en SWE-bench dependen enormemente del scaffold. Claude Opus 4.6 con Claude Code difiere significativamente de Claude Opus 4.6 con un scaffold personalizado. No puedes comparar modelos sin especificar el entorno de ejecución.

Los tokens son el diagnóstico de tu arquitectura

Si el agente consume más de lo esperado, te está diciendo algo: el contexto es ruido, las tools son demasiadas, la spec no es suficientemente clara. Ese número, antes de ser un coste, es una señal de diseño.

El ahorro de tokens no viene de ejecutar menos IA. Viene de darle mejor contexto.

Descubre el método de trabajo que te ayudará a ahorrar tokens en desarrollo de software cada día.

Compartir