La Misma Memoria de IA, Menos Tokens: Cómo un Nuevo Enfoque Supera a un Sistema de Agentes Líder a una Fracción del Costo
Dos sistemas de IA enseñan a los agentes a aprender de sus propios errores. Uno envía cada lección cada vez. El otro envía solo lo que cada modelo realmente puede usar. La diferencia se ve en la factura.

Puntos clave
- ALTK-Evolve igualó o superó al sistema de memoria de agentes ACE en una prueba de 168 tareas mientras utilizaba apenas una séptima parte de los tokens computacionales por tarea.
- En DeepSeek-V3.2, un modelo de IA potente, ALTK-Evolve logró un 89,3% de finalización de tareas frente al 80,4% de ACE, con aproximadamente el 40% del costo de tokens de ACE.
- En un modelo más débil, gpt-oss-120b, la precisión fue casi idéntica entre los dos sistemas, pero ALTK-Evolve utilizó aproximadamente 116.000 tokens por tarea en comparación con los 777.000 de ACE.
- Ambos sistemas evitan comprimir las lecciones aprendidas de un agente en un resumen corto, pero difieren significativamente en cómo esas lecciones llegan al modelo en el momento de la decisión.
- El equipo de ALTK-Evolve compartió el trabajo en Hugging Face.
Imagina entrenar a un nuevo empleado no a través de un manual, sino permitiéndole cometer errores y mostrándole exactamente qué salió mal. Así es, aproximadamente, como funcionan ambos sistemas de IA. La diferencia es si le entregas al empleado cada nota jamás escrita, o solo las relevantes para el trabajo de hoy.
¿Qué problema están resolviendo estos sistemas?
Los agentes de IA, software que realiza tareas de múltiples pasos por sí solo, fallan de manera reveladora. Generalmente conocen las reglas. Solo las aplican de manera poco confiable.
Dale a un agente de IA una tarea como dividir una factura entre varias aplicaciones simuladas, y podría llamar a la función incorrecta, extraer el registro de la persona equivocada o devolver una respuesta cuando no se pidió respuesta. El agente tiene el conocimiento. Aún no ha aprendido cómo aplicarlo correctamente.
Tanto ACE (Ingeniería de Contexto de Agentes) como ALTK-Evolve lo solucionan extrayendo lecciones de los intentos anteriores del agente, luego alimentando esas lecciones al agente la próxima vez que funcione. Sin etiquetas humanas. Sin reentrenar el modelo subyacente. Solo memoria, utilizada en el momento de la decisión.
¿En qué difieren los dos sistemas?
Difieren en la entrega, y es de donde proviene la diferencia de costo.
ACE mantiene un único manual grande y cuidadosamente mantenido e inyecta el conjunto completo en el contexto del agente, el bloque de texto que el modelo lee antes de actuar, en cada paso único. Esto es exhaustivo. También es costoso.
ALTK-Evolve trata la entrega como ajustable. Para un modelo potente con mucho margen de maniobra, puede enviar el conjunto completo de lecciones. Para un modelo más débil, selecciona solo las lecciones más relevantes para la tarea actual, mantiene un núcleo fijo de directrices de alta confianza y deja el resto en almacenamiento. Las mismas lecciones existen en ambos casos. Menos de ellas llegan al modelo.
Los resultados en la prueba AppWorld, una evaluación de 168 tareas realistas de múltiples aplicaciones, se muestran a continuación.
| Modelo | Sistema | Finalización de tareas | Tokens por tarea |
|---|---|---|---|
| DeepSeek-V3.2 (potente) | ACE | 80,4% | 634.000 |
| DeepSeek-V3.2 (potente) | ALTK-Evolve | 89,3% | 263.000 |
| gpt-oss-120b (más débil) | ACE | 54,8% | 777.000 |
| gpt-oss-120b (más débil) | ALTK-Evolve | 56,0% | 116.000 |
Los tokens son las unidades de texto que un modelo de IA lee y escribe. Más tokens significan más tiempo de computación y mayor costo.
¿Por qué enviar menos lecciones a veces funciona mejor?
Para tareas más difíciles, el agente necesita elegir la lección correcta, no abrirse paso a través de todas. En tareas fáciles con un modelo más débil, un manual integral da una pequeña ventaja, porque la respuesta está cerca de la superficie y más contexto ayuda. En tareas difíciles, ese mismo flujo de contexto se interpone.
Un modelo más potente absorbe más contexto sin perder el hilo. Un modelo más débil puede ahogarse en él.
Ambos sistemas están de acuerdo en un principio importante: no comprimas las lecciones en un resumen corto. Una lección que apareció en cinco tareas separadas es significativamente diferente de una que apareció una vez. Fusionarlas juntas pierde esa distinción. ALTK-Evolve realiza un seguimiento de cuántos episodios independientes produjeron cada lección. ACE mantiene un recuento útil versus perjudicial por elemento. Etiquetas diferentes, la misma lógica subyacente.
¿Qué sucede ahora?
El equipo de ALTK-Evolve dice que la pregunta de exactamente cuántas lecciones enviar, y cómo se escala en modelos de diferentes fortalezas, es el tema de su próximo artículo. La biblioteca técnica y un informe completo ya son públicos para investigadores que deseen probar el enfoque.
Para cualquiera que construya o pague por sistemas de agentes de IA, el punto práctico es claro: lo que se le dice a un modelo en el momento de la decisión forma tanto la precisión como el costo, y estas dos cosas no tienen que enfrentarse entre sí.
Preguntas frecuentes
¿Significa esto que ACE es un sistema malo?
No. ACE y ALTK-Evolve resuelven el mismo problema y están de acuerdo en las partes difíciles. La propia historia de eficiencia de ACE se centra en lo económicamente que construye su tienda de memoria. La ganancia de eficiencia de ALTK-Evolve proviene de servir menos lecciones por paso, que es un eje completamente diferente.
¿Esto afecta a los usuarios ordinarios directamente?
No aún en un producto que puedas descargar. El trabajo está en la etapa de investigación, probado en una prueba de tareas simuladas. Pero los ahorros de costos que señala importan para cualquier empresa que ejecute agentes de IA a escala, y los costos de ejecución más bajos típicamente se traducen en precios más bajos con el tiempo.



