ИИ учится планировать собственный бюджет слов перед тем, как начать писать

Новая методология исследований учит модели ИИ учитывать стоимость каждого генерируемого токена, сокращая лишние вычисления без ущерба для качества.

AI2Day Newsdesk· 3 min read
A sleek, modern corporate security operations room photographed from a low angle looking toward a large curved desk with multiple dark monitors displaying abstr
Share

Ключевые моменты

  • Исследовательская группа Apple ML Research опубликовала Length Value Model (LenVM) — фреймворк, который предсказывает, сколько токенов ИИ всё ещё потребуется сгенерировать на каждом этапе формирования ответа.
  • Метод рассматривает каждый сгенерированный токен (наименьшую единицу текста, которую обрабатывает ИИ, примерно три четверти слова) как имеющий небольшую отрицательную стоимость, побуждая модель быть лаконичнее.
  • Существующие системы ИИ управляют длиной вывода только на грубом уровне целой последовательности; LenVM работает токен за токеном, обеспечивая намного более точный контроль.
  • Исследователи рассматривают контроль длины как задачу оценки стоимости, заимствуя методологию из обучения с подкреплением — подхода, который награждает или наказывает ИИ за его поведение.

Каждый раз, когда чат-бот отвечает на ваш вопрос, он генерирует текст небольшими порциями. Каждая порция называется токеном. Больше токенов означает больше времени, больше электроэнергии и более высокие расходы для того, кто управляет сервисом. Для пользователей это часто просто означает более длительное ожидание ответа, который мог бы быть короче.

Исследователи давно знают о существовании этой проблемы. Их решения до сих пор были грубыми. Они могли сказать модели «держи свой ответ в пределах 200 слов» и надеяться на лучшее. Модель не имела реального представления о том, сколько слов у неё осталось или сколько она «тратит» с каждым добавленным словом.

LenVM меняет это. Система, опубликованная Apple ML Research, предоставляет модели текущее представление об оставшейся длине генерации на каждом этапе декодирования — в момент выбора каждого нового токена. Это похоже на счётчик такси, который увеличивается с каждой десятой долей мили, а не на фиксированную тариф, названный в начале поездки.

Трюк заключается в том, как они учат модель это учитывать. Исследователи назначили небольшой постоянный штраф за каждый сгенерированный токен. Поскольку модель обучена максимизировать свою награду, она самостоятельно обучается тому, что ненужные слова имеют стоимость. Фактически модель начинает редактировать себя сама.

Это заимствует метод из раздела обучения ИИ, называемого обучением с подкреплением, где модель получает очки за хорошее поведение и теряет их за плохое. Здесь «плохое» просто означает многословность.

Всегда ли короче означает хуже?

Нет, и в этом суть. Результаты исследования показывают, что модель сокращает длину на задачах, которые не требуют длинных ответов, сохраняя при этом качество на задачах, которые действительно требуют глубины. Цель состоит не в том, чтобы получить более короткий ответ любой ценой, а в том, чтобы получить ответ правильной длины.

Для обычных пользователей это важно двумя способами. Во-первых, более быстрые ответы в повседневных чат-инструментах. Во-вторых, снижение затрат на запуск, которые провайдеры могли бы передать пользователям, а не поглотить сами.

Для индустрии ИИ это открывает путь к созданию моделей, которые самостоятельно планируют собственные вычисления, вместо того чтобы быть искусственно ограниченными инженером, устанавливающим жёсткий лимит.

© 2026 AI2Day