Исследователи Apple нашли способ заблокировать модели AI, чтобы никто не мог их изменить
Открытые модели AI мощны, легко распространяются и становятся все труднее контролировать. Новая техника от Apple ML Research призвана защитить предварительно обученные веса от использования в опасных целях, не теряя при этом того, что делает открытые модели полезными.

Ключевые моменты
- Apple ML Research опубликовала новый метод защиты внутренних параметров открытых моделей AI от несанкционированной тонкой настройки.
- Открытые модели, системы AI с публично доступными и загружаемыми внутренними параметрами, резко улучшились в качестве за последние несколько лет.
- Техника использует глубокую остаточную дистилляцию низкого ранга для блокировки основного поведения модели при сохранении её функциональности для законных пользователей.
- Защита от злоупотреблений открытыми моделями AI затруднена тем, что после обнародования весов любой может изменить их на своём оборудовании.
- Исследование затрагивает растущее противоречие: открытость способствует прогрессу, но также облегчает использование AI в качестве оружия.
Представьте учебник, который можно скачать, скопировать и писать на нём пометки. Открытые модели AI работают так же. "Веса" — это миллионы числовых параметров, усвоенные во время обучения, которые определяют, как модель думает и отвечает. Если поделиться этими параметрами публично, исследователи по всему миру смогут развивать их, тестировать, запускать на дешёвом оборудовании и адаптировать для конкретных задач.
Эта свобода огромно ускорила прогресс AI. Она также создала проблему.
В чём именно риск?
Когда веса становятся общедоступными, любой может переобучить или адаптировать модель для достижения опасных целей, и разработчики оригинальной модели не могут этому помешать. Встроенный в модель фильтр безопасности может быть незаметно удалён. Поведение, которое было намеренно ограничено, может быть разблокировано.
Защита от этого действительно сложна. Решительный пользователь, работающий на своём компьютере в автономном режиме, вне условий обслуживания какой-либо платформы, не встречает технических препятствий для внесения изменений. Обычные ограждения, политики в области контента и ограничения API просто не применяются к загруженным весам.
Что именно построили исследователи Apple?
Техника называется глубокая остаточная дистилляция низкого ранга. Название звучит замысловато, поэтому вот что это значит на практике.
"Дистилляция" — это процесс сжатия знаний модели в новую форму. "Низкий ранг" означает, что изменения структурированы математически минимальным образом, небольшие корректировки встроены глубоко внутрь модели. В результате модель ведёт себя нормально при предполагаемых применениях, но противостоит попыткам переориентировать её на другие цели через тонкую настройку — стандартный метод, который атакующие использовали бы для изменения её поведения.
Думайте об этом как о замке, встроенном в позвоночник учебника. Вы можете прочитать каждую страницу. Но вы не можете переписать главы.
Apple ML Research, опубликовавшая эту работу, позиционирует её как прямой ответ на противоречие между открытостью и безопасностью. Более мощные открытые модели означают больше возможностей в большем количестве рук, что в основном хорошо. Это также означает, что инструменты для причинения вреда становятся более доступными, что не хорошо.
Влияет ли это на обычных людей?
Не напрямую, не сейчас. Это исследовательская работа, а не продукт, выпущенный сегодня.
Но основная проблема касается каждого, кто использует AI-инструменты, построенные на открытых моделях, от помощников по написанию текстов до генераторов изображений и ботов обслуживания клиентов. Если эти модели могут быть незаметно изменены перед поступлением в продукт, вся работа над безопасностью, проделанная разработчиками оригинальной модели, теряет смысл.
Исследования подобного рода — это попытка повысить безопасность экосистемы открытых моделей на структурном уровне, чтобы преимущества открытого AI, дешевизна, скорость, прозрачность, не поставлялись в комплекте с лёгкими путями злоупотребления.
Устояет ли техника перед лицом решительных противников в масштабе — вот следующий вопрос. Независимые исследователи теперь её протестируют. Это, пожалуй, именно то, как должна работать открытая наука.



