
Para equipos de aplicaciones, plataformas y programacion asistida por IA.
Ahorrar tokens no consiste ante todo en acortar prompts, sino en evitar trabajo inutil del modelo. Las lecturas repetidas, el contexto irrelevante, las respuestas largas y el retrabajo tras fallos forman parte del coste.
El objetivo es reducir el coste total por tarea aceptada sin incumplir calidad, seguridad ni latencia. Esta guia se centra en APIs con pago por uso; las suscripciones y planes de IDE requieren analizar sus propias cuotas.
Como usar esta guia
No es un manual de parametros, sino experiencia practica obtenida con Agents, Skills, MCP, programacion con IA e ingenieria de APIs. La forma mas directa de usarla es entregar a una IA esta guia junto con la informacion del sistema y pedirle una auditoria basada en estos principios. Empieza por el desperdicio evidente: contexto duplicado, resultados de herramientas enormes, reintentos inutiles, modelos demasiado caros, respuestas largas y una cache inestable.
Navegacion
| Problema | Seccion |
|---|---|
| Medir el ahorro y priorizar | Coste por tarea · Despliegue |
| El historial crece demasiado | Contexto · Cache |
| Demasiadas herramientas o llamadas | Herramientas y Skills · Control |
| Modelo y razonamiento demasiado caros | Modelo y salida · Otras opciones |
1. Calcula el coste por tarea, no solo el total de tokens
Clave 1 | Separa tokens, dinero y tiempo. Reducir entradas, salidas y llamadas ahorra tokens; descuentos de cache, seleccion de modelo y Batch cambian sobre todo el precio; streaming y concurrencia mejoran principalmente la espera. Define el objetivo antes de llamar «barato» a lo que solo es mas rapido.
Clave 2 | Incluye fallos y reintentos. El coste total abarca todos los intentos, subagents, revisiones de modelo y ejecuciones de herramientas, no solo la llamada final correcta.
Atencion | Un coste menor no debe ocultar peor calidad. Mide tasa de exito, latencia P95 y casos de riesgo. Si ninguna tarea supera la aceptacion, el coste por tarea aprobada es indefinido, no cero.
2. Quita material irrelevante, no evidencia esencial
Procesa los datos antes del modelo: extrae el texto de una web, pliega logs repetidos, filtra y agrega tablas, y busca antes de leer codigo. Conserva fuentes, valores, unidades, letra pequena y precision espacial cuando importen.
Monta RAG con un presupuesto de evidencia: filtra permisos y version, recupera, deduplica, ordena y llena el presupuesto. Conserva ubicaciones; si falta evidencia, amplia la busqueda en vez de forzar una respuesta.
En tareas largas, guarda el material original por separado y limita el contexto de trabajo a objetivo, restricciones, hechos confirmados, ubicacion de artefactos, preguntas abiertas y siguiente paso. Resume o compacta al cerrar una fase o acercarte al limite, no en cada turno.
previous_response_id continua el estado, pero el historial sigue teniendo coste. Si usas continuacion del servidor, no adjuntes manualmente el mismo historial completo. Tampoco uses un resumen como unica memoria: permisos, restricciones y evidencia original deben persistir aparte; el resumen de negocio y la Compaction de una API no son lo mismo.
3. La cache depende de prefijos estables y reutilizables
Coloca primero reglas estables, herramientas y contrato de salida; deja al final la entrada dinamica. No insertes marcas de tiempo ni IDs aleatorios en el prefijo. Mantener orden y schemas deterministas tambien evita que middleware duplique contenido.
Prompt Cache reutiliza el calculo del prefijo, no una respuesta, y normalmente no reduce la cifra de tokens de entrada. Cuenta la creacion inicial, lecturas posteriores, caducidad y reconstruccion, y confirma con el proveedor el precio de escritura.
Disena por separado la cache de resultados de herramientas y la de respuestas. Las claves deben incluir tenant, permisos, version de datos y consulta, con invalidacion explicita. La similitud semantica no autoriza reutilizar datos entre usuarios. Y un resumen mas corto puede ser mas caro si obliga a resumir y reconstruir una cache que ya acertaba.
4. Carga menos herramientas y devuelve menos datos
Mantiene disponible un conjunto pequeno y frecuente; descubre catalogos grandes bajo demanda con mecanismos como Tool Search. Presenta primero el nombre y proposito de una Skill y carga sus reglas tras seleccionarla. La carga diferida anade pasos y defer_loading no es universal en clientes MCP.
Recorta en la herramienta: snippets en busquedas, campos necesarios en consultas y estado mas resumen de fallos en tests. El programa debe imponer limites de numero y tamano, con marcador de truncado o cursor.
Deja en codigo filtros, ordenacion, sumas, joins y conversiones. El modelo debe entender la intencion, tratar excepciones y explicar. Limita tambien permisos, tiempo y volumen de respuesta.
Evita: 100.000 pedidos → el modelo lee y suma fila a fila → total
Prefiere: la base filtra y agrega → total y anomalias → el modelo explica
5. Optimiza por separado modelo, razonamiento y salida
Selecciona el modelo mediante evaluaciones. Prueba modelos baratos para clasificar, extraer y dar formato; reserva los que alcanzan la calidad necesaria para razonamiento complejo y cambios de riesgo. La ruta «modelo pequeno → validacion → escalado» debe evaluarse por su coste completo.
Controla por separado esfuerzo de razonamiento y longitud visible. Un trabajo simple puede usar esfuerzo bajo y elevarlo en fases complejas, vigilando errores y retrabajo. Pedir «solo la conclusion» no elimina el razonamiento oculto; un limite de salida demasiado bajo puede impedir una respuesta completa.
Especifica el entregable: conclusion o analisis, archivo o diff, evidencia textual o IDs. Las salidas estructuradas tambien necesitan validacion semantica y deben admitir valores ausentes o inciertos.
6. Ejecuta las condiciones de parada del Agent en codigo
Define cuatro paradas: terminar al aprobar la aceptacion; guardar estado al alcanzar presupuesto de coste, turnos o tiempo; interrumpir fallos repetidos sin evidencia nueva; y pedir decision humana cuando faltan permisos o una aprobacion de riesgo. Escribir «gasta pocos tokens» en el prompt no lo aplica.
Clasifica reintentos: backoff limitado para red, corregir parametros antes de repetir y detenerse ante permisos. Tras un timeout, comprueba si la accion remota termino. Haz escrituras idempotentes o deduplicadas, conserva checkpoints y reanuda sin repetir todo.
Multi-Agent es una decision de capacidad, no un interruptor de ahorro. Divide solo tareas independientes y medibles. Da al subagent objetivo, evidencia y presupuesto necesarios, y pide resultado con fuentes sin copiar toda la conversacion. El presupuesto agotado tampoco significa tarea terminada: entrega lo hecho, lo pendiente y los bloqueos.
7. En programacion con IA, lee y cambia solo lo necesario
Localiza, despues lee y finalmente aplica un parche acotado. Proporciona modulos relevantes y criterios de aceptacion; busca simbolos, llamadas y tests antes de abrir archivos grandes. Omite dependencias y artefactos generados. Si falla un parche, vuelve a leer la zona relevante; convierte flujos estables en scripts.
Evita verificaciones repetidas sin eliminar pruebas necesarias. Un cambio de texto no merece el mismo alcance que permisos, pagos o migraciones. Detente tras checks correctos si no hubo nuevos cambios, fallos ni dudas; repite cuando cambien codigo o entorno.
8. Elige otras formas de ahorro segun el caso
Para clasificacion o evaluacion no interactiva, considera Batch o servicios de menor prioridad. Usa alternativas tipo Flex solo si aceptas mas espera y falta de capacidad. Repite solo elementos fallidos y calcula el coste de degradacion: estas opciones cambian precio y latencia, no los tokens de la tarea.
En tareas frecuentes y estables, con aceptacion clara y buenos ejemplos, evalua fine-tuning o destilacion incluyendo entrenamiento, mantenimiento y evaluacion continua. Si el conocimiento cambia a menudo, manten primero las fuentes de recuperacion.
No sacrifiques legibilidad por compresion no demostrada. Campos de una letra, traduccion total, Base64 o «JSON siempre ahorra» deben compararse con tokens reales, precision y retrabajo.
9. Orden de implantacion recomendado
- Establece una linea base de coste y calidad por tarea.
- Recorta contexto irrelevante y respuestas de herramientas grandes.
- Elimina llamadas duplicadas, reintentos inutiles y repeticiones completas.
- Estabiliza prefijos y verifica el ahorro de cache.
- Selecciona modelo, razonamiento y formato mediante evaluaciones.
- Solo despues evalua Batch, Flex, fine-tuning o destilacion.
Cambia una variable principal cada vez y registra tasa de exito, coste por tarea aceptada y P95.