Модели ИИ могут не забывать всё подряд: случай в пользу умного разучивания
Новое исследование Apple ML Research показывает, что некоторые обучающие данные имеют столь минимальный эффект на модель ИИ, что их удаление — пустая трата времени и денег.

Ключевые моменты
- Apple ML Research опубликовала исследование, обнаружившее, что некоторые точки обучающих данных оказывают незначительное влияние на выходные данные модели ИИ.
- Современные методы разучивания рассматривают каждую точку данных как одинаково важную, что, по мнению исследователей, является расходом вычислительных ресурсов.
- Полученные результаты могут снизить затраты на обеспечение соответствия требованиям конфиденциальности для компаний, использующих ИИ, обученный на персональных данных.
- В исследовании использовались функции влияния как для задач распознавания языка, так и для задач распознавания изображений, чтобы определить данные с низким воздействием.
Что такое разучивание ИИ и почему это важно?
Разучивание ИИ — это процесс удаления конкретной информации из уже обученной модели без необходимости перестраивать модель с нуля. Это похоже на попытку заставить кого-то забыть один номер телефона, не стирая всю его память.
Это важно, потому что законы о конфиденциальности во многих странах теперь дают людям право на удаление их персональных данных. Если ваша информация была использована для обучения системы ИИ, компания может быть обязана её удалить. Переобучение большой модели с нуля дорого. Очень дорого. Поэтому исследователи разработали «разучивающие» ярлыки, чтобы выполнить эту задачу быстрее.
Стандартный подход сегодня стирает каждую отмеченную точку данных с одинаковыми усилиями, независимо от того, насколько она на самом деле повлияла на модель. Фотография вас, которая едва затронула модель во время обучения, проходит тот же дорогостоящий процесс удаления, что и фотография, которую модель глубоко запомнила.
Что именно обнаружили исследователи?
Они обнаружили, что не все точки данных оставляют одинаковый след. Многие практически ничего не оставляют.
Команда использовала инструмент, называемый функциями влияния — математический метод, оценивающий, насколько каждый отдельный пример обучения изменил финальное поведение модели. Применённый как для текстовых, так и для визуальных задач, анализ последовательно выявлял подмножество примеров обучения, чей показатель влияния был настолько близок к нулю, что их удаление не оказало измеримого влияния на выходные данные модели.
Вывод: эти точки фактически «уже забыты». Обращение с ними так же, как с высокозначимыми данными, расходует вычислительное время и, следовательно, деньги.
Что это означает для бизнеса и обычных пользователей?
Для компаний практическое следствие — снижение затрат на соответствие. Если поступит запрос о конфиденциальности и окажется, что отмеченные данные имеют низкое влияние, модели может вообще не потребоваться дорогостоящий процесс разучивания.
Для людей, которые попросили компанию удалить их данные из системы ИИ, это исследование не означает, что их запрос будет проигнорирован. Это означает, что инженеры в один прекрасный день смогут использовать более умные инструменты для проверки того, что данные действительно не имели эффекта, вместо запуска комплексного процесса удаления.
Стоит честно сказать о том, чего мы ещё не знаем. Исследование представляет собой сравнительный анализ, а не готовый продукт или развёрнутую систему. Нормативные акты о конфиденциальности в настоящее время не содержат исключения для «незначительного влияния», и регулирующие органы могут не принять математический показатель в качестве доказательства того, что данные были действительно удалены. Эти вопросы остаются открытыми.
Что происходит дальше?
Эффективное разучивание — это быстро развивающаяся область исследований, и эта работа добавляет к ней практический подход: перед тем как потратить деньги на удаление данных, проверьте, имели ли вообще данные значение. Такая постановка проблемы может изменить, как вся область подходит к решению.
Одно честное выводить: если ваш бизнес хранит персональные данные, которые питают модель ИИ, начните проверку того, что вы на самом деле собираете. Чем меньше ненужных данных вы используете для обучения, тем меньше проблем с разучиванием позже.



