Дослідники Apple знайшли спосіб заблокувати AI-моделі, щоб ніхто не міг їх змінювати
Відкриті AI-моделі є потужними, легко ділитися ними, але все важче їх контролювати. Нова методика від Apple ML Research спрямована на захист попередньо навчених параметрів від перекручування під час небезпечних використань, без втрати корисних властивостей відкритих моделей.

Ключові моменти
- Apple ML Research опублікували новий метод для захисту внутрішніх параметрів AI-моделей з відкритими вагами від несанкціонованого додаткового навчання.
- Моделі з відкритими вагами — AI-системи, чиї внутрішні налаштування доступні для публічного завантаження — значно покращилися в якості за останні роки.
- Методика використовує глибоку низькорангову залишкову дистиляцію, щоб заблокувати базову поведінку моделі, залишаючи її функціональною для законних користувачів.
- Захист від неправомірного використання відкритих AI-моделей складний, оскільки після публікації ваг будь-хто може модифікувати їх на своєму обладнанні.
- Дослідження торкається зростаючої напруги: відкритість прискорює прогрес, але також полегшує зброєння AI-інструментів.
Уявіть підручник, який ви можете завантажити, скопіювати й позначити. Відкриті AI-моделі працюють так само. «Ваги» — це мільйони числових налаштувань, засвоєних під час навчання, які визначають, як модель думає й відповідає. Якщо поділитися цими налаштуваннями публічно, дослідники по всьому світу можуть будувати на них, тестувати їх, запускати на дешевому обладнанні й адаптувати до конкретних завдань.
Ця свобода значно прискорила прогрес AI. Вона також створила проблему.
Яка реальна загроза?
Коли ваги стають публічними, будь-хто може перетренувати або відкоригувати модель для шкідливих цілей, а оригінальні розробники не мають способу їх зупинити. Фільтр безпеки, вбудований у модель, можна тихо видалити. Поведінку, яка була навмисно обмежена, можна розблокувати.
Захист від цього справді складний. Визначений користувач, який працює на своєму комп'ютері, офлайн, поза умовами обслуговування будь-якої платформи, не стикається з технічним бар'єром для модифікації. Звичайні захисти, політика контенту та обмеження API просто не застосовуються до завантажених ваг.
Що насправді створили дослідники Apple?
Методика називається глибока низькорангова залишкова дистиляція. Назва громіздка, тому ось що вона означає на практиці.
«Дистиляція» — це процес стиснення знань моделі в нову форму. «Низькорангова» означає, що зміни структуровані математично мінімальним способом, малі коригування покладені глибоко всередину моделі. Результат — модель, яка поводиться нормально для передбачених використань, але опирається тому, щоб бути спрямованою в інші сторони через додаткове навчання, стандартний метод, який використовують зловмисники для зміни її поведінки.
Уявіть це як замок, вбудований у хребет підручника. Ви можете прочитати кожну сторінку. Ви не можете переписати розділи.
Apple ML Research, яка опублікувала цю роботу, представляє її як прямої відповіді на напругу між відкритістю й безпекою. Потужніші відкриті моделі означають більше можливостей у більшій кількості рук, що здебільшого добре. Це також означає, що інструменти для завдання шкоди стають більш доступними, що погано.
Чи це впливає на звичайних людей?
Не безпосередньо, не зараз. Це науковий доповідь, не продукт, що випускається сьогодні.
Але основна проблема торкається кожного, хто використовує AI-інструменти, побудовані на відкритих моделях — від помічників для написання тексту до генераторів зображень до чат-ботів служби підтримки клієнтів. Якщо ці моделі можуть бути тихо модифіковані до того, як вони потраплять до продукту, робота з безпеки, проведена оригінальними розробниками, не матиме значення.
Дослідження, подібні до цього, — це спроба зробити екосистему відкритих моделей безпечнішою на структурному рівні, щоб переваги ділення AI, дешевші, швидші, прозоріші, не поставалися з легкими шляхами до неправомірного використання.
Чи витримає методика проти визначених супротивників у масштабі — це наступне запитання. Незалежні дослідники тепер будуть її тестувати. Це, мабуть, саме те, як має працювати відкрита наука.



