Новий прийом зменшує вартість стиснення гігантських AI моделей

Дослідники знайшли спосіб навчання менших і дешевших AI моделей на основі гігантських, використовуючи лише частину пам'яті, необхідної раніше, що відкриває двері для експериментів, які раніше вимагали складу обладнання.

AI2Day Newsdesk5 min read
Full-frame edge-to-edge photoreal overhead view of a modern security operations center at night, rows of empty analyst desks lit by the cool blue glow of multip
Share

Ключові моменти

  • Дистиляція знань, копіювання поведінки великої AI моделі в меншу, зазвичай вимагає сотень спеціалізованих чипів та ретельної координації.
  • В новій роботі кешуються виходи великої моделі один раз на початку, так що вона ніколи не повинна запускатися під час навчання, значно скорочуючи використання пам'яті.
  • Другий метод, який називається fused chunked KL loss, обробляє дані навчання невеликими ломтиками замість того, щоб робити це все одразу, утримуючи пікову пам'ять майже плоскою навіть при дуже довгих вводах.
  • При 32 000 токенів контексту пікова пам'ять падає з 85,2 гігабайтів до 5,45 гігабайтів, що становить зменшення в 15,6 разів.
  • Повний код функції стиснення пам'яті доступний на GitHub.

Найбільші AI моделі у світі мають майже неможливо великий розмір. Kimi-K3, випущена на початку цього року, має 2,8 трильйона параметрів (параметри можна розглядати як мільйони невеликих рег'юляторів всередину моделі, які налаштовуються під час навчання) і потребує приблизно трьох терабайтів спеціалізованої пам'яті лише для завантаження. Це більше місця, ніж надає двадцять високопродуктивних графічних карток для споживачів.

Оскільки запуск моделей такого розміру дорогий, дослідники постійно стискають їх у менші версії, які коштують дешевше в експлуатації. Стандартний метод називається дистиляція знань: ви запускаєте велику модель-«вчитель» на купі тексту, записуєте, як вона буде відповідати, потім навчаєте меншу модель-«студента» копіювати ці відповіді якомога точніше. Студент виходить набагато дешевшим у запуску, зберігаючи більшість якості вчителя.

Чому це так важко робити дешево?

Витрати походять із двох місць. По-перше, стандартний підхід тримає як вчителя, так і студента в пам'яті одночасно. По-друге, порівняння їхніх виходів вимагає побудови величезної матриці: по одному рядку для кожного слова у словнику моделі (часто більше 100 000 слів), по одному стовпцю для кожної позиції у вводі. Помножте це разом на довгий текст і ви швидко заповните кожен мікросхему, яка у вас є.

Як конкретний приклад: одна популярна відкрита модель gpt-oss-120b має словник з 201 088 слів. При довжині послідовності 32 000 токенів (приблизно обсяг короткого роману) та скромному розміру пакету в чотири приклади одночасно, сам тензор виходу вчителя займає близько 50 гігабайтів. Додайте модель студента, градієнти та все інше, що потребує процес навчання, і один крок навчання може досягти приблизно 250 гігабайтів, більше ніж може вмістити H200, один із найпотужніших AI чипів, доступних сьогодні.

Що змінили дослідники?

Дві речі, які працюють разом. Обидва описані в роботі, опублікованій командою CompactifAI, спочатку розміщеній на Hugging Face.

Перша зміна — це автономна дистиляція. Замість повторного запуску вчителя на кожному кроці навчання, дослідники запускають його один раз і зберігають лише його 100 найвірогідніших прогнозів слів на позицію. Цей кеш записується на диск. Вчитель потім повністю вимикається, а студент навчається на основі збереженого кешу. Оскільки кеш можна повторно використовувати в багатьох різних експериментах, дорогий запуск вчителя стає одноразовою вартістю.

Друга зміна — це fused chunked KL loss. KL дивергенція — це математична міра того, наскільки різні два розподіли ймовірностей, тобто наскільки різні прогнози слів студента від прогнозів вчителя. Стандартний спосіб обчислення створює цю повну матрицю словник-на-послідовність одразу і тримає її всю в пам'яті. Новий метод розбиває послідовність на малі ломтики, обчислює та відкидає кожен ломтик перед переходом до наступного й перевичислює те, що їм потрібно під час зворотного проходу, замість того щоб його зберігати.

Метод Пікова пам'ять (8K контексту) Час ітерації
Онлайн дистиляція 102,8 GB 25,9 s
Автономна, щільна KL 78,3 GB 18,5 s
Автономна, forward-chunked KL 61,8 GB 18,4 s
Автономна, fused chunked KL 58,3 GB 20,2 s

Усі чотири методи дають майже однакові результати навчання, це означає, що втрата якості від використання збережених прогнозів топ-100 замість повного розподілу вчителя незначна.

Це має значення для довших документів?

Так, і розрив зростає швидко. Перевага пам'яті підходу fused chunked скромна при 8 000 токенів, але драматична при більших довжинах. При 32 000 токенів пікова пам'ять падає з 85,2 гігабайтів зі стандартним підходом до 5,45 гігабайтів з новим. Щільна функція втрат повністю виходить з ладу при 64 000 токенів. При 256 000 токенів метод fused chunked використовує 11,6 гігабайтів проти 134,2 гігабайтів для наступного найкращого альтернативного варіанту.

Простими словами: експерименти, які раніше вимагали стійки сотень мікросхем, тепер можуть запускатися на одній високопродуктивній карті. Це робить реалістичним для менших дослідницьких команд і компаній будувати стиснені моделі на основі найбільших доступних відкритих AI систем.

Часті питання

Чи менша модель виявиться гіршою за оригіналом?

У наведених тестах втрата навчання моделі студента була майже ідентичною для всіх чотирьох методів, включаючи новий дешевий підхід. Якість утримувалась, незважаючи на використання лише 100 прогнозів слів на позицію замість повного виходу вчителя.

Чи може будь-хто використовувати цей метод?

Код chunked loss є відкритим кодом і публічно розміщений на GitHub CompactifAI. Будь-хто з одним сучасним AI чипом і копією великої відкритої моделі може, в принципі, запустити свої експерименти дистиляції за допомогою цього.

Хто найперший отримає користь?

Малі команди AI дослідження та компанії, які хочуть стиснути великі відкриті моделі для дешевшого розгортання, відчують різницю найшвидше. Кінцеві користувачі можуть отримати користь пізніше, коли більше доступних стиснених моделей потраплять до продуктів та послуг.

© 2026 AI2Day