Одна й та ж пам'ять AI, менше токенів: як новий підхід перемагає провідну систему агентів за частину вартості
Дві системи AI вчать агентів навчатися на своїх помилках. Одна надсилає кожен урок щоразу. Інша надсилає лише те, що може насправді використати кожна модель. Різниця видна в рахунку.

Ключові моменти
- ALTK-Evolve дорівнювала або перевищувала систему пам'яті агента ACE на еталонному тесті з 168 завдань, використовуючи лише одну сьому від кількості обчислювальних токенів на завдання.
- На DeepSeek-V3.2, потужній моделі AI, ALTK-Evolve досягла 89,3% виконання завдань порівняно з 80,4% ACE при приблизно 40% вартості токенів ACE.
- На слабшій моделі gpt-oss-120b точність була майже однаковою між обома системами, але ALTK-Evolve використовувала близько 116 000 токенів на завдання порівняно з 777 000 ACE.
- Обидві системи уникають стиснення вивчених уроків агента в короткий резюме, але різко відрізняються тим, як ці уроки досягають моделі під час прийняття рішень.
- Робота була поділена командою ALTK-Evolve на Hugging Face.
Уявіть, що ви навчаєте нового співробітника не через інструкцію, а дозволяючи йому робити помилки, а потім показуючи йому, що саме пішло не так. Саме так, грубо кажучи, обидві системи AI працюють. Різниця в тому, чи ви даєте співробітнику кожну коли-небудь написану записку, чи лише ті, що релевантні для сьогоднішньої роботи.
Яку проблему вирішують ці системи?
AI-агенти, програмне забезпечення, яке самостійно виконує багатокрокові завдання, відмовляють характерним чином. Вони звичайно знають правила. Вони просто застосовують їх ненадійно.
Дайте AI-агенту завдання, наприклад розділити рахунок між кількома імітованими додатками, і він може викликати неправильну функцію, витягнути запис неправильної особи або вернути відповідь, коли відповідь не була потрібна. Агент має знання. Він ще не навчився застосовувати його чисто.
Як ACE (Agentic Context Engineering), так і ALTK-Evolve розв'язують це, видобуваючи уроки з попередніх спроб агента, а потім подаючи ці уроки назад агенту наступного разу, коли він працює. Без людських міток. Без переналаштування основної моделі. Лише пам'ять, використана в момент прийняття рішення.
У чому розходяться дві системи?
Вони розходяться в доставці, і саме звідси походить різниця в вартості.
ACE зберігає один великий, ретельно підтримуваний збірник і вводить всю річ у контекст агента, блок тексту, який модель читає перед дією, на кожному окремому кроці. Це ґрунтовно. Це також дорого.
ALTK-Evolve розглядає доставку як гнучку. Для потужної моделі з великим запасом вона може надіслати повний набір уроків. Для слабшої моделі вона вибирає лише уроки, найбільш релевантні для поточного завдання, зберігає фіксоване ядро з рекомендаціями високої впевненості та залишає решту в сховищі. Одні й ті ж уроки існують в обох випадках. До моделі потрапляє менше їх.
Результати еталонного тесту AppWorld, який тестує 168 реалістичних багатоапаратних завдань, показані нижче.
| Модель | Система | Виконання завдання | Токени на завдання |
|---|---|---|---|
| DeepSeek-V3.2 (потужна) | ACE | 80,4% | 634 000 |
| DeepSeek-V3.2 (потужна) | ALTK-Evolve | 89,3% | 263 000 |
| gpt-oss-120b (слабша) | ACE | 54,8% | 777 000 |
| gpt-oss-120b (слабша) | ALTK-Evolve | 56,0% | 116 000 |
Токени — це одиниці тексту, який модель AI читає та пише. Більше токенів означає більше часу обчислення та вищу вартість.
Чому надсилання менше уроків іноді працює краще?
Для складніших завдань агент повинен вибрати правильний урок, а не ворушитися через усі з них. На простих завданнях зі слабшою моделлю комплексний збірник дає невелику перевагу, тому що відповідь близька до поверхні, а більше контексту допомагає. На складних завданнях той же потік контексту заважає.
Потужніша модель засвоює більше контексту, не втрачаючи нитки. Слабша модель може в ньому захлинутися.
Обидві системи погоджуються з однією важливою принципом: не стискайте уроки в коротке резюме. Урок, який з'явився в п'яти окремих завданнях, істотно відрізняється від того, що з'явився один раз. Стиснення їх разом втрачає цю різницю. ALTK-Evolve відстежує, скільки незалежних епізодів створило кожний урок. ACE зберігає корисне проти шкідливого підрахунку на елемент. Різні мітки, одна й та ж основна логіка.
Що далі?
Команда ALTK-Evolve каже, що питання про те, саме скільки уроків надсилати і як це масштабується на моделях різної потужності, є предметом їхнього наступного допису. Технічна бібліотека та повний звіт вже є відкритими для дослідників, які хочуть перевірити підхід.
Для будь-кого, хто розробляє або платить за системи AI-агентів, практична точка проста: те, що моделі розповідають під час прийняття рішення, формує як точність, так і вартість, і ці дві речі не повинні піти на компроміс одна з одною.
Поширені питання
Це означає, що ACE — погана система?
Ні. ACE та ALTK-Evolve розв'язують одну й ту ж проблему і погоджуються щодо складних частин. Власна історія ефективності ACE зосереджена на тому, наскільки дешево вона будує свій магазин пам'яті. Прибуток ефективності ALTK-Evolve походить від обслуговування менше уроків за крок, що є зовсім іншою віссю.
Це впливає на звичайних користувачів безпосередньо?
Ще не в продукті, який ви можете завантажити. Робота перебуває на стадії дослідження, протестована на еталонному тесті імітованих завдань. Але економія витрат, на яку вона вказує, важлива для будь-якої компанії, яка запускає AI-агентів у масштабі, а нижчі витрати на експлуатацію зазвичай з часом призводять до нижчих цін.



