Одна и та же память AI, меньше токенов: как новый подход побеждает ведущую систему агентов при небольшой доле стоимости

Две системы AI учат агентов извлекать уроки из собственных ошибок. Одна отправляет каждый урок каждый раз. Другая отправляет только то, что может использовать каждая модель. Разница видна в счёте.

AI2Day Newsdesk4 min read
A sleek, modern corporate security operations room photographed from a low angle looking toward a large curved desk with multiple dark monitors displaying abstr
Share

Ключевые моменты

  • ALTK-Evolve сравнялась или превзошла систему памяти агента ACE на эталоне из 168 задач, используя при этом всего одну седьмую вычислительных токенов на задачу.
  • На DeepSeek-V3.2, сильной модели AI, ALTK-Evolve набрала 89,3% завершения задач против 80,4% у ACE, примерно при 40% стоимости ACE в токенах.
  • На более слабой модели gpt-oss-120b точность была почти идентична в обеих системах, но ALTK-Evolve использовала около 116 000 токенов на задачу против 777 000 у ACE.
  • Обе системы избегают сжатия выученных уроков агента в краткое резюме, но резко отличаются в том, как эти уроки попадают к модели в момент принятия решения.
  • Работа была опубликована командой ALTK-Evolve на Hugging Face.

Представьте, что вы обучаете нового сотрудника не через инструкцию, а позволяя ему совершать ошибки, а затем показывая ему ровно то, что пошло не так. Примерно это делают обе эти системы AI. Разница в том, передаёте ли вы сотруднику все когда-либо написанные заметки или только те, что имеют отношение к сегодняшней работе.

Какую проблему решают эти системы?

AI агенты, программное обеспечение, которое выполняет многоэтапные задачи самостоятельно, терпят неудачу определённым образом. Обычно они знают правила. Они просто применяют их ненадёжно.

Дайте AI агенту задачу вроде разделения счёта между несколькими имитируемыми приложениями, и он может вызвать неправильную функцию, извлечь запись неправильного человека или вернуть ответ, когда ответ не требуется. Агент обладает знанием. Он ещё не научился применять его чистым образом.

ACE (Agentic Context Engineering) и ALTK-Evolve решают это путём анализа собственных прошлых попыток агента для извлечения уроков, а затем подачи этих уроков агенту в следующий раз, когда он работает. Никаких человеческих меток. Никакого переобучения основной модели. Только память, используемая в момент принятия решения.

В чём расходятся две системы?

Они расходятся в доставке, и именно отсюда берётся разница в стоимости.

ACE хранит одну крупную, тщательно поддерживаемую сборку знаний и вводит всё целиком в контекст агента, блок текста, который модель читает перед действием, на каждом отдельном шаге. Это тщательно. Это также дорого.

ALTK-Evolve рассматривает доставку как настраиваемую. Для мощной модели с большим запасом она может отправить полный набор уроков. Для более слабой модели она выбирает только уроки, наиболее релевантные текущей задаче, сохраняет фиксированный набор высокоуверенных рекомендаций и оставляет остальное в хранилище. Те же уроки существуют в обоих случаях. К модели попадает меньше из них.

Результаты на эталоне AppWorld, тесте 168 реалистичных многоприложенческих задач, показаны ниже.

Модель Система Завершение задач Токены на задачу
DeepSeek-V3.2 (мощная) ACE 80,4% 634 000
DeepSeek-V3.2 (мощная) ALTK-Evolve 89,3% 263 000
gpt-oss-120b (более слабая) ACE 54,8% 777 000
gpt-oss-120b (более слабая) ALTK-Evolve 56,0% 116 000

Токены — это единицы текста, который читает и пишет модель AI. Больше токенов означает больше времени вычислений и более высокую стоимость.

Почему отправка меньшего количества уроков иногда работает лучше?

Для более сложных задач агенту нужно выбрать правильный урок, а не пробираться через все. На простых задачах со слабой моделью всеобъемлющая сборка даёт небольшое преимущество, потому что ответ близко к поверхности и больше контекста помогает. На сложных задачах этот же поток контекста встаёт на дороге.

Более мощная модель усваивает больше контекста без потери нити. Более слабая модель может захлебнуться в нём.

Обе системы согласны с одним важным принципом: не сжимайте уроки в краткое резюме. Урок, появившийся в пяти отдельных задачах, принципиально отличается от того, который появился один раз. Сжатие их вместе теряет это различие. ALTK-Evolve отслеживает, сколько независимых эпизодов произвели каждый урок. ACE ведёт полезное-против-вредного подсчёт для каждого элемента. Разные метки, одна и та же лежащая в основе логика.

Что дальше?

Команда ALTK-Evolve говорит, что вопрос о том, ровно сколько уроков отправлять и как это масштабируется на модели разной мощности, является предметом их следующего поста. Техническая библиотека и полный отчёт уже доступны для исследователей, которые хотят протестировать подход.

Для всех, кто создаёт или платит за системы AI агентов, практический вывод понятен: то, что модели сказано в момент принятия решения, формирует как точность, так и стоимость, и эти две вещи не обязательно должны конфликтовать.

Частые вопросы

Значит ли это, что ACE — плохая система?

Нет. ACE и ALTK-Evolve решают одну и ту же проблему и согласны по сложным частям. История эффективности ACE сосредоточена на том, как дешево она строит своё хранилище памяти. Прирост эффективности ALTK-Evolve происходит от подачи меньшего количества уроков на шаг, что совершенно другой аспект.

Это прямо влияет на обычных пользователей?

Пока нет в продукте, который вы можете скачать. Работа находится на стадии исследования, протестирована на эталоне имитируемых задач. Но экономия затрат, на которую она указывает, имеет значение для любой компании, запускающей AI агентов в масштабе, и более низкие операционные затраты обычно со временем приводят к снижению цен.

© 2026 AI2Day