Mesma Memória IA, Menos Tokens: Como uma Nova Abordagem Supera um Sistema de Agente Líder a uma Fração do Custo
Dois sistemas de IA ensinam agentes a aprender com os seus próprios erros. Um envia cada lição sempre. O outro envia apenas aquilo que cada modelo pode realmente usar. A diferença aparece na fatura.

Pontos principais
- ALTK-Evolve iguala ou supera o sistema de memória de agente ACE num teste de 168 tarefas, enquanto usa tão pouco quanto um sétimo dos tokens de computação por tarefa.
- No DeepSeek-V3.2, um modelo de IA forte, ALTK-Evolve obteve 89,3% de conclusão de tarefas versus 80,4% do ACE, a aproximadamente 40% do custo em tokens do ACE.
- Num modelo mais fraco, gpt-oss-120b, a precisão foi quase idêntica entre os dois sistemas, mas ALTK-Evolve usou cerca de 116.000 tokens por tarefa comparado aos 777.000 do ACE.
- Ambos os sistemas evitam comprimir as lições aprendidas de um agente numa pequena síntese, mas diferem bastante em como essas lições chegam ao modelo no momento da decisão.
- O trabalho foi partilhado pela equipa ALTK-Evolve no Hugging Face.
Imagine ensinar um novo funcionário não através de um manual, mas deixando-o cometer erros e mostrando-lhe depois exatamente o que correu mal. É, aproximadamente, o que ambos estes sistemas de IA fazem. A diferença é se entrega ao funcionário todas as notas já escritas, ou apenas as relevantes para o trabalho de hoje.
Que problema é que estes sistemas resolvem?
Agentes de IA, software que executa tarefas de múltiplos passos por conta própria, falham de uma forma reveladora. Normalmente conhecem as regras. Simplesmente aplicam-nas de forma pouco fiável.
Dê a um agente de IA uma tarefa como dividir uma conta entre várias aplicações simuladas, e pode chamar a função errada, puxar o registo da pessoa errada, ou devolver uma resposta quando nenhuma resposta foi pedida. O agente tem o conhecimento. Ainda não aprendeu como aplicá-lo de forma limpa.
Tanto ACE (Agentic Context Engineering) como ALTK-Evolve resolvem isto extraindo lições das tentativas passadas do próprio agente, depois alimentando essas lições de volta ao agente quando volta a trabalhar. Sem etiquetas humanas. Sem retreinar o modelo subjacente. Apenas memória, usada no momento da decisão.
Em que é que os dois sistemas divergem?
Divergem na entrega, e é aí que vem a diferença de custo.
ACE mantém um grande manual cuidadosamente mantido e injeta tudo no contexto do agente, o bloco de texto que o modelo lê antes de agir, em cada passo. É completo. É também caro.
ALTK-Evolve trata a entrega como ajustável. Para um modelo forte com muito espaço de manobra, pode enviar o conjunto completo de lições. Para um modelo mais fraco, seleciona apenas as lições mais relevantes para a tarefa atual, mantém um núcleo fixo de orientações de alta confiança, e deixa o resto no armazenamento. As mesmas lições existem em ambos os casos. Menos delas viajam para o modelo.
Os resultados no teste AppWorld, um teste de 168 tarefas realistas de múltiplas aplicações, são apresentados abaixo.
| Modelo | Sistema | Conclusão de tarefas | Tokens por tarefa |
|---|---|---|---|
| DeepSeek-V3.2 (forte) | ACE | 80,4% | 634.000 |
| DeepSeek-V3.2 (forte) | ALTK-Evolve | 89,3% | 263.000 |
| gpt-oss-120b (mais fraco) | ACE | 54,8% | 777.000 |
| gpt-oss-120b (mais fraco) | ALTK-Evolve | 56,0% | 116.000 |
Tokens são as unidades de texto que um modelo de IA lê e escreve. Mais tokens significam mais tempo de computação e custo mais elevado.
Por que é que enviar menos lições às vezes funciona melhor?
Para tarefas mais difíceis, o agente precisa de escolher a lição certa, não se afogar em todas elas. Em tarefas fáceis com um modelo mais fraco, um manual abrangente dá uma pequena vantagem, porque a resposta está próxima da superfície e mais contexto ajuda. Em tarefas difíceis, essa mesma avalanche de contexto fica no caminho.
Um modelo mais forte absorve mais contexto sem perder o fio. Um modelo mais fraco pode afogar-se nele.
Ambos os sistemas concordam num princípio importante: não comprima lições numa síntese breve. Uma lição que apareceu em cinco tarefas separadas é significativamente diferente de uma que apareceu uma vez. Comprimi-las juntas perde essa distinção. ALTK-Evolve rastreia quantos episódios independentes produziram cada lição. ACE mantém uma contagem de útil-versus-prejudicial por item. Etiquetas diferentes, mesma lógica subjacente.
O que vem a seguir?
A equipa ALTK-Evolve diz que a questão de exatamente quantas lições enviar, e como isso se expande em modelos de diferentes capacidades, é o tema do próximo artigo deles. A biblioteca técnica e um relatório completo já são públicos para investigadores que queiram testar a abordagem.
Para qualquer pessoa a construir ou pagar por sistemas de agente IA, o ponto prático é direto: aquilo que um modelo é informado no momento da decisão molda tanto a precisão como o custo, e estas duas coisas não precisam de ser uma troca.
Questões frequentes
Isto significa que ACE é um sistema fraco?
Não. ACE e ALTK-Evolve resolvem o mesmo problema e concordam nas partes difíceis. A própria história de eficiência do ACE centra-se na forma como constrói barato o seu armazenamento de memória. O ganho de eficiência do ALTK-Evolve vem de servir menos lições por passo, que é um eixo completamente diferente.
Isto afeta utilizadores comuns diretamente?
Ainda não num produto que possa descarregar. O trabalho está no estágio de investigação, testado num teste de tarefas simuladas. Mas as economias de custo que aponta importam para qualquer empresa a executar agentes de IA em larga escala, e custos de execução mais baixos tipicamente traduzem-se em preços mais baixos ao longo do tempo.



