La Misma Memoria de IA, Menos Tokens: Cómo un Nuevo Enfoque Supera a un Sistema de Agentes Líder a una Fracción del Costo
Dos sistemas de IA enseñan a los agentes a aprender de sus propios errores. Uno envía cada lección cada vez. El otro envía solo lo que cada modelo puede realmente usar. La diferencia se ve en la factura.

Puntos clave
- ALTK-Evolve igualó o superó al sistema de memoria de agentes ACE en un benchmark de 168 tareas mientras utilizaba apenas una séptima parte de los tokens de computación por tarea.
- En DeepSeek-V3.2, un modelo de IA fuerte, ALTK-Evolve obtuvo una tasa de finalización de tareas del 89,3 % frente al 80,4 % de ACE, a aproximadamente el 40 % del costo de tokens de ACE.
- En el modelo más débil gpt-oss-120b, la precisión fue casi idéntica, pero ALTK-Evolve utilizó aproximadamente una séptima parte de tokens por tarea.
- Ambos sistemas se niegan a comprimir las lecciones aprendidas de un agente en un resumen breve, pero difieren marcadamente en cómo esas lecciones llegan al modelo en el momento de la decisión.
- El equipo de ALTK-Evolve compartió el trabajo en Hugging Face.
Imagina entrenar a un nuevo empleado no a través de un manual, sino dejándolo cometer errores y luego mostrándole exactamente qué salió mal. Así es aproximadamente como funcionan ambos sistemas de IA. La verdadera pregunta es si le das al empleado todas las notas jamás escritas, o solo las que aplican hoy.
¿Qué problema resuelven estos sistemas?
Los agentes de IA, software que realiza tareas de múltiples pasos por su cuenta, fallan de manera característica. Por lo general conocen las reglas pero no han aprendido a aplicarlas correctamente.
Dale a un agente de IA una tarea como dividir una factura entre varias aplicaciones simuladas, y podría llamar a la función equivocada, acceder al registro de la persona equivocada, o devolver una respuesta cuando no se pidió respuesta alguna.
Tanto ACE (Agentic Context Engineering) como ALTK-Evolve lo resuelven extrayendo lecciones de los intentos anteriores del propio agente, y luego alimentando esas lecciones la próxima vez que funciona. Sin etiquetas humanas, sin reentrenar el modelo subyacente. Solo memoria, utilizada en el momento de la decisión.
¿En qué difieren los dos sistemas?
Difieren en la entrega, y de ahí es de donde viene la diferencia de costo.
ACE mantiene un manual cuidadosamente elaborado e lo inyecta en el contexto del agente, el bloque de texto que el modelo lee antes de actuar, en cada paso. Exhaustivo, pero costoso.
ALTK-Evolve trata la entrega como una variable ajustable en lugar de una constante. Para un modelo fuerte con amplio margen, puede enviar el conjunto completo de lecciones. Para un modelo más débil, selecciona solo las lecciones más relevantes para la tarea actual, mantiene un núcleo fijo de directrices de alta confianza, y deja el resto en almacenamiento. Las mismas lecciones existen en ambos casos; menos de ellas viajan al modelo.
Los resultados en el benchmark AppWorld, una prueba de 168 tareas realistas entre múltiples aplicaciones, se muestran a continuación.
| Modelo | Sistema | Finalización de tareas | Tokens por tarea |
|---|---|---|---|
| DeepSeek-V3.2 (fuerte) | ACE | 80,4 % | 634K |
| DeepSeek-V3.2 (fuerte) | ALTK-Evolve | 89,3 % | 263K |
| gpt-oss-120b (más débil) | ACE | 54,8 % | 777K |
| gpt-oss-120b (más débil) | ALTK-Evolve | 56,0 % | 116K |
Los tokens son las unidades de texto que un modelo de IA lee y escribe. Más tokens significan más tiempo de computación y mayor costo.
¿Por qué enviar menos lecciones a veces funciona mejor?
En tareas difíciles, el agente necesita elegir la lección correcta, no navegar por todas. En tareas fáciles con un modelo más débil, un manual completo proporciona una pequeña ventaja porque la respuesta está cerca de la superficie. Ese mismo flujo de contexto se interpone cuando la tarea es más difícil.
Un modelo más fuerte absorbe más contexto sin perder el hilo. Uno más débil puede ahogarse en él.
Ambos sistemas están de acuerdo en un principio importante: no comprimas lecciones en un resumen breve. Una lección que apareció en cinco tareas separadas es significativamente diferente de una que apareció una sola vez. ALTK-Evolve rastrea cuántos episodios independientes produjeron cada lección. ACE mantiene un recuento favorable versus perjudicial por elemento. Etiquetas diferentes, lógica subyacente similar. Nuestro artículo anterior sobre cómo Asana construyó memoria de agentes compartida en toda la empresa, publicado el 6 de agosto, muestra cómo la pregunta de qué recuerdan y olvidan los agentes se está convirtiendo en un problema de diseño en toda la industria.
¿Qué sucede a continuación?
El equipo de ALTK-Evolve dice que la pregunta de cuántas lecciones enviar exactamente, y cómo eso se escala en modelos de diferentes fortalezas, es el tema de su próximo artículo. Un informe completo ya está disponible públicamente para investigadores que deseen probar el enfoque.
Para cualquiera que construya o pague sistemas de agentes de IA, lo que más importa es esto: la precisión y el costo no tienen que ser un compromiso. Lo que se le dice al modelo en el momento de la decisión moldea ambos, y la cantidad correcta no es la misma para cada modelo. Ese es el aspecto que la mayoría de los diseñadores de sistemas de agentes aún tratan como una configuración fija en lugar de una variable que vale la pena ajustar.
Preguntas comunes
¿Significa esto que ACE es un sistema deficiente?
No. ACE y ALTK-Evolve resuelven el mismo problema y están de acuerdo en las partes difíciles. La propia historia de eficiencia de ACE se enfoca en lo barato que construye su almacén de memoria. La ganancia de ALTK-Evolve proviene de servir menos lecciones por paso, que es un eje completamente diferente.
¿Esto afecta directamente a los usuarios ordinarios?
No aún en un producto que puedas descargar. El trabajo está en fase de investigación, probado en un benchmark de tareas simuladas. Pero los ahorros de costos que señala importan para cualquier empresa que ejecute agentes de IA a escala, y los costos de funcionamiento más bajos típicamente se traducen en precios más bajos con el tiempo.



