Исследователи Apple нашли способ заблокировать модели AI, чтобы никто не мог их изменить

Открытые модели AI мощны, легко распространяются и становятся все труднее контролировать. Новая техника от Apple ML Research призвана защитить предварительно обученные веса от использования в опасных целях, не теряя при этом того, что делает открытые модели полезными.

AI2Day Newsdesk3 min read
Photoreal news-editorial 16:9 image of a server room bathed in cold blue light, cables and rack units sharply in focus in the foreground, a faint red glow emana
Share

Ключевые моменты

  • Apple ML Research опубликовала новый метод защиты внутренних параметров открытых моделей AI от несанкционированной тонкой настройки.
  • Открытые модели, системы AI с публично доступными и загружаемыми внутренними параметрами, резко улучшились в качестве за последние несколько лет.
  • Техника использует глубокую остаточную дистилляцию низкого ранга для блокировки основного поведения модели при сохранении её функциональности для законных пользователей.
  • Защита от злоупотреблений открытыми моделями AI затруднена тем, что после обнародования весов любой может изменить их на своём оборудовании.
  • Исследование затрагивает растущее противоречие: открытость способствует прогрессу, но также облегчает использование AI в качестве оружия.

Представьте учебник, который можно скачать, скопировать и писать на нём пометки. Открытые модели AI работают так же. "Веса" — это миллионы числовых параметров, усвоенные во время обучения, которые определяют, как модель думает и отвечает. Если поделиться этими параметрами публично, исследователи по всему миру смогут развивать их, тестировать, запускать на дешёвом оборудовании и адаптировать для конкретных задач.

Эта свобода огромно ускорила прогресс AI. Она также создала проблему.

В чём именно риск?

Когда веса становятся общедоступными, любой может переобучить или адаптировать модель для достижения опасных целей, и разработчики оригинальной модели не могут этому помешать. Встроенный в модель фильтр безопасности может быть незаметно удалён. Поведение, которое было намеренно ограничено, может быть разблокировано.

Защита от этого действительно сложна. Решительный пользователь, работающий на своём компьютере в автономном режиме, вне условий обслуживания какой-либо платформы, не встречает технических препятствий для внесения изменений. Обычные ограждения, политики в области контента и ограничения API просто не применяются к загруженным весам.

Что именно построили исследователи Apple?

Техника называется глубокая остаточная дистилляция низкого ранга. Название звучит замысловато, поэтому вот что это значит на практике.

"Дистилляция" — это процесс сжатия знаний модели в новую форму. "Низкий ранг" означает, что изменения структурированы математически минимальным образом, небольшие корректировки встроены глубоко внутрь модели. В результате модель ведёт себя нормально при предполагаемых применениях, но противостоит попыткам переориентировать её на другие цели через тонкую настройку — стандартный метод, который атакующие использовали бы для изменения её поведения.

Думайте об этом как о замке, встроенном в позвоночник учебника. Вы можете прочитать каждую страницу. Но вы не можете переписать главы.

Apple ML Research, опубликовавшая эту работу, позиционирует её как прямой ответ на противоречие между открытостью и безопасностью. Более мощные открытые модели означают больше возможностей в большем количестве рук, что в основном хорошо. Это также означает, что инструменты для причинения вреда становятся более доступными, что не хорошо.

Влияет ли это на обычных людей?

Не напрямую, не сейчас. Это исследовательская работа, а не продукт, выпущенный сегодня.

Но основная проблема касается каждого, кто использует AI-инструменты, построенные на открытых моделях, от помощников по написанию текстов до генераторов изображений и ботов обслуживания клиентов. Если эти модели могут быть незаметно изменены перед поступлением в продукт, вся работа над безопасностью, проделанная разработчиками оригинальной модели, теряет смысл.

Исследования подобного рода — это попытка повысить безопасность экосистемы открытых моделей на структурном уровне, чтобы преимущества открытого AI, дешевизна, скорость, прозрачность, не поставлялись в комплекте с лёгкими путями злоупотребления.

Устояет ли техника перед лицом решительных противников в масштабе — вот следующий вопрос. Независимые исследователи теперь её протестируют. Это, пожалуй, именно то, как должна работать открытая наука.

© 2026 AI2Day