Même mémoire IA, Moins de jetons : Comment une nouvelle approche surpasse un système d'agent leader à une fraction du coût

Deux systèmes IA enseignent tous deux aux agents à apprendre de leurs propres erreurs. L'un envoie chaque leçon à chaque fois. L'autre n'envoie que ce que chaque modèle peut réellement utiliser. La différence se voit sur la facture.

AI2Day Newsdesk4 min read
A sleek, modern corporate security operations room photographed from a low angle looking toward a large curved desk with multiple dark monitors displaying abstr
Share

Points clés

  • ALTK-Evolve a égalé ou surpassé le système de mémoire d'agent ACE sur un benchmark de 168 tâches tout en utilisant aussi peu que un septième des jetons informatiques par tâche.
  • Sur DeepSeek-V3.2, un modèle IA puissant, ALTK-Evolve a obtenu 89,3 % d'achèvement de tâche contre 80,4 % pour ACE, à environ 40 % du coût en jetons d'ACE.
  • Sur un modèle plus faible, gpt-oss-120b, la précision était quasi identique entre les deux systèmes, mais ALTK-Evolve a utilisé environ 116 000 jetons par tâche contre 777 000 pour ACE.
  • Les deux systèmes évitent de compresser les leçons apprises d'un agent en un court résumé, mais ils diffèrent considérablement sur la façon dont ces leçons atteignent le modèle au moment de la décision.
  • Le travail a été partagé par l'équipe ALTK-Evolve sur Hugging Face.

Imaginez former un nouvel employé non par un manuel, mais en le laissant faire des erreurs puis en lui montrant exactement ce qui s'est mal passé. C'est à peu près ce que font ces deux systèmes IA. La différence est de savoir si vous remettez à l'employé chaque note jamais écrite, ou seulement celles pertinentes pour le travail du jour.

Quel problème ces systèmes résolvent-ils ?

Les agents IA, des logiciels qui exécutent des tâches en plusieurs étapes de manière autonome, échouent d'une manière révélatrice. Ils connaissent généralement les règles. Ils les appliquent simplement de manière peu fiable.

Donnez à un agent IA une tâche comme diviser une facture entre plusieurs applications simulées, et il pourrait appeler la mauvaise fonction, extraire le dossier de la mauvaise personne ou renvoyer une réponse alors qu'aucune réponse n'était demandée. L'agent a les connaissances. Il n'a pas encore appris à les appliquer correctement.

ACE (Agentic Context Engineering) et ALTK-Evolve résolvent cela en exploitant les tentatives passées de l'agent pour en tirer des leçons, puis en renvoyant ces leçons à l'agent la prochaine fois qu'il fonctionne. Pas d'étiquettes humaines. Pas de réentraînement du modèle sous-jacent. Juste la mémoire, utilisée au moment de la décision.

Sur quoi les deux systèmes sont-ils en désaccord ?

Ils sont en désaccord sur la livraison, et c'est là que vient la différence de coût.

ACE maintient un grand playbook soigneusement entretenu et injecte le tout dans le contexte de l'agent, le bloc de texte que le modèle lit avant d'agir, à chaque étape. C'est complet. C'est aussi coûteux.

ALTK-Evolve traite la livraison comme ajustable. Pour un modèle puissant avec beaucoup de marge de manœuvre, il peut envoyer l'ensemble complet des leçons. Pour un modèle plus faible, il sélectionne uniquement les leçons les plus pertinentes pour la tâche en cours, maintient un noyau fixe de directives hautement fiables et laisse le reste en stockage. Les mêmes leçons existent dans les deux cas. Moins d'entre elles atteignent le modèle.

Les résultats sur le benchmark AppWorld, un test de 168 tâches réalistes multi-applications, sont présentés ci-dessous.

Modèle Système Achèvement de tâche Jetons par tâche
DeepSeek-V3.2 (puissant) ACE 80,4 % 634 000
DeepSeek-V3.2 (puissant) ALTK-Evolve 89,3 % 263 000
gpt-oss-120b (plus faible) ACE 54,8 % 777 000
gpt-oss-120b (plus faible) ALTK-Evolve 56,0 % 116 000

Les jetons sont les unités de texte qu'un modèle IA lit et écrit. Plus de jetons signifie plus de temps de calcul et des coûts plus élevés.

Pourquoi envoyer moins de leçons fonctionne-t-il parfois mieux ?

Pour les tâches plus difficiles, l'agent doit choisir la bonne leçon, pas se frayer un chemin à travers toutes. Sur les tâches faciles avec un modèle plus faible, un playbook complet donne un léger avantage, car la réponse est proche de la surface et plus de contexte aide. Sur les tâches difficiles, ce même flot de contexte gêne.

Un modèle plus puissant absorbe plus de contexte sans perdre le fil. Un modèle plus faible peut s'y noyer.

Les deux systèmes s'accordent sur un principe important : ne pas compresser les leçons en un court résumé. Une leçon qui est apparue dans cinq tâches distinctes est significativement différente d'une qui n'est apparue qu'une fois. Les fusionner ensemble perd cette distinction. ALTK-Evolve suit le nombre d'épisodes indépendants qui ont produit chaque leçon. ACE maintient un compte utile-versus-nuisible par élément. Des étiquettes différentes, la même logique sous-jacente.

Que se passe-t-il ensuite ?

L'équipe ALTK-Evolve dit que la question du nombre exact de leçons à envoyer, et comment cela s'adapte à travers les modèles de forces différentes, sera le sujet de leur prochain article. La bibliothèque technique et un rapport complet sont déjà publics pour les chercheurs qui souhaitent tester l'approche.

Pour quiconque construit ou paie pour des systèmes d'agents IA, le point pratique est simple : ce qu'on dit à un modèle au moment de la décision façonne à la fois la précision et le coût, et ces deux choses n'ont pas à faire de compromis.

Questions courantes

Cela signifie-t-il qu'ACE est un mauvais système ?

Non. ACE et ALTK-Evolve résolvent le même problème et s'accordent sur les parties difficiles. L'histoire propre d'efficacité d'ACE se concentre sur la construction bon marché de son magasin de mémoire. Le gain d'efficacité d'ALTK-Evolve provient de la fourniture de moins de leçons par étape, ce qui est un axe entièrement différent.

Cela affecte-t-il directement les utilisateurs ordinaires ?

Pas encore dans un produit que vous pouvez télécharger. Le travail en est au stade de la recherche, testé sur un benchmark de tâches simulées. Mais les économies de coûts qu'il signale sont importantes pour toute entreprise exploitant des agents IA à grande échelle, et des coûts d'exploitation réduits se traduisent généralement par des prix plus bas au fil du temps.

© 2026 AI2Day