ШІ навчається планувати свої слова, перш ніж почати писати
Нова методика дослідження вчить моделі ШІ розраховувати вартість кожного токена, який вони генерують, скорочуючи марнування обчислювальних ресурсів без зниження якості.

Ключові моменти
- Apple ML Research опублікували Length Value Model (LenVM) — структуру, яка передбачає, скільки токенів ШІ все ще потребує згенерувати на кожному етапі свого виходу.
- Методика розглядає кожний генерований токен (токен — це найменша частина тексту, яку обробляє ШІ, приблизно три чверті слова) як такий, що несе невеликий негативний збиток, спонукаючи модель до стислості.
- Сучасні системи ШІ керують довжиною виходу лише на грубому рівні всієї послідовності; LenVM працює токен за токеном, забезпечуючи набагато більш тонкий контроль.
- Дослідники представляють контроль довжини як задачу оцінки вартості, запозичуючи метод з машинного навчання з підкріпленням, навчання, яке винагороджує або карає ШІ за його поведінку.
Кожного разу, коли чатбот відповідає на ваше запитання, він генерує текст по одному невеликому фрагменту за раз. Кожен фрагмент називається токеном. Більше токенів означає більше часу, більше електроенергії та вищі витрати для того, хто керує сервісом. Для користувачів це часто просто означає більш тривалу очікування відповіді, яка могла бути коротшою.
Дослідники знали, що це проблема. Їхні рішення до цього моменту були грубими. Вони могли сказати моделі «дайте відповідь менше ніж 200 слів» та сподіватися на краще. Модель не має справжнього розуміння, скільки слів їй залишилося, або скільки вона «витрачає» з кожним словом, яке додає.
LenVM це змінює. Система, опублікована Apple ML Research, дає моделі постійне відчуття залишкової довжини генерації на кожному етапі декодування, у момент вибору кожного нового токена. Подумайте про це як про лічильник таксі, який тикає з кожною десятою частиною милі, а не фіксована плата, назвавши на початку поїздки.
Хитрість полягає в тому, як вони вчать модель дбати про це. Дослідники призначили невелику постійну штраф за кожен генерований токен. Оскільки модель навчена максимізувати свою винагороду, вона самостійно навчається, що непотрібні слова коштують дорого. Вона стає, по суті, самореденсною.
Це запозичено з розділу навчання ШІ, яка називається машинним навчанням з підкріпленням, де модель отримує бали за хорошу поведінку і втрачає їх за погану. Тут «погана» просто означає багатослівну.
Чи завжди коротше означає гірше?
Ні, і в цьому суть. Результати команди показують, що модель скорочує довжину у завданнях, які не потребують довгих відповідей, зберігаючи якість у завданнях, які справді вимагають глибини. Мета полягає не в тому, щоб дати коротшу відповідь будь-якою ціною; це правильна за довжиною відповідь.
Для звичайних користувачів це має значення двома способами. По-перше, більш живі відповіді в повсякденних чат-інструментах. По-друге, менші витрати на утримання, які провайдери могли б передати замість того, щоб поглинати.
Для індустрії ШІ це відкриває шлях до моделей, які самостійно планують свої обчислення, а не вручну обмежуються інженером, який встановлює жорстке обмеження.



