Защита AI от хакеров теперь блокирует людей, пытающихся остановить хакеров

Исследователи в области безопасности говорят, что фильтры безопасности в ведущих AI-инструментах непоследовательны, вызывают разочарование и подталкивают легальных защитников к использованию нерегулируемых иностранных моделей.

AI2Day Newsdesk4 min read
A sleek server room bathed in cool blue light, rows of black server racks stretching into the distance, a single amber warning light glowing on one unit in the
Share

Ключевые моменты

  • AI-модели Mythos и Fable компании Anthropic столкнулись с американскими экспортными контролями в июне, ограничивая доступ к ним за границей.
  • Как Anthropic, так и OpenAI управляют проверенными программами, которые дают одобренным исследователям в области кибербезопасности немного более свободный доступ к их AI-инструментам.
  • Несколько исследователей в области наступательной безопасности утверждают, что фильтры по-прежнему блокируют важную работу и дают непредсказуемые результаты даже в рамках этих программ.
  • Некоторые исследователи говорят, что ограничения подталкивают их к использованию китайских моделей AI с открытым исходным кодом, таких как GLM, которые вообще не имеют фильтров или проверки.
  • Один исследователь из производителя компонентов для смартфонов сказал, что AI-инструменты его команды стали практически бесполезны для работы в области безопасности, потому что никто не подал заявку на участие в проверенной программе.

Кибербезопасность всегда была двусторонней игрой. Знание, которое позволяет защитнику закрыть уязвимость, позволяет атакующему через неё пробраться. Теперь AI-инструменты оказались в центре этого противоречия, и встроенные в них фильтры безопасности начинают разочаровывать людей, которых они должны были защищать.

Что именно идёт не так?

Компании AI устанавливают на свои модели защиту — автоматические правила, которые препятствуют тому, чтобы программное обеспечение отвечало на вопросы, которые они считают опасными, чтобы преступники не использовали их для создания вредоноса или планирования атак. Проблема в том, что эти же правила блокируют легальных исследователей в области безопасности от выполнения своей работы.

Крис Энли, главный учёный консультационной фирмы по безопасности NCC Group, привёл наглядный пример. Когда он просит AI-модель попытаться использовать программную ошибку, он проверяет, является ли ошибка реальной и достаточно опасной для исправления. Защита, которая отказывает в этом запросе, никого не защищает. Она просто оставляет недостаток неподтверждённым и потенциально открытым для реального атакующего.

«Исправить этот код — это одновременно и существенный механизм защиты, и дорожная карта для поиска критических уязвимостей», — сказал Энли. «Один и тот же инструмент может быть и наступательным инструментом, и оборонительным инструментом, и их действительно невозможно разделить».

Его аналогия: это как молоток. Вы не можете построить дом без него, но он также может разбить окно.

Насколько серьёзна непоследовательность?

Она достаточно фрагментарна, чтобы впустую потратить много времени. Крис Томпсон, генеральный директор фирмы кибербезопасности RemoteThreat и основатель конференции Offensive AI Con, посвящённой безопасности и AI, рассказал TechCrunch, что даже в одобренных программах исследователей Anthropic и OpenAI защита срабатывает по-разному от дня к дню.

«Вы тратите много времени на переговоры с моделью вместо работы над основной программой безопасности», — сказал Томпсон. «Вместо анализа уязвимости вы пытаетесь понять, почему модели чрезмерно очищают выходные данные».

Один безымянный исследователь из производителя компонентов для смартфонов выразил это просто: «Если модель почувствует, что мы занимаемся чем-то, связанным с безопасностью, она просто останавливается и становится бесполезной».

К кому это подталкивает людей?

К моделям с открытым исходным кодом без каких-либо фильтров, многие из которых разработаны в Китае. Томпсон сказал, что ответственные исследователи отталкиваются от систем, подлежащих американскому контролю, к иностранным инструментам, не имеющим никакой ответственности.

«У вас есть эти ответственные исследователи, которых отталкивают от американских систем к иностранным системам», — сказал он. «Я думаю, что наличие таких защит более вредно, чем полезно».

Не все исследователи чувствуют себя заблокированными. Джузеппе Кали, который находит и разрабатывает zero-days (ранее неизвестные ошибки в программном обеспечении, для которых ещё не существует патча), сказал, что он держит AI подальше от фактического поиска уязвимостей, потому что хочет, чтобы это открытие осталось его собственным. Для вспомогательных задач, таких как понимание незнакомого кода, он находит инструменты достаточно полезными.

«Я ревнив к своим ошибкам», — сказал Кали, «и мне нравится эта игра слишком сильно, чтобы позволить моделям играть в неё для меня».

Решение Томпсона состоит не в том, чтобы полностью снять защиту. Он хочет, чтобы лаборатории AI расширили доступ для проверенных исследователей, применяли согласованные правила и привлекали плохих субъектов к ответственности при совершении нарушений. Без этого баланса, утверждает он, защитники будут отставать от атакующих, которые не сталкиваются с такими ограничениями.

Часто задаваемые вопросы

Влияют ли эти ограничения на обычных пользователей компьютеров?

Нет, не напрямую. Трения, описанные здесь, касаются профессиональных исследователей в области безопасности, а не обычных людей, использующих AI для письма или рабочих задач. Общие защиты остаются в силе для всех.

Почему AI-компании вообще ограничивают вопросы кибербезопасности?

Они опасаются, что подробное пошаговое руководство по атакам может помочь преступникам создавать вредонос или взламывать системы. Сложность в том, что то же руководство — это именно то, что нужно легальным защитникам для первого тестирования и усиления этих систем.

Что такое AI-модель с открытым исходным кодом и почему у неё нет защиты?

AI-модель с открытым исходным кодом — это модель, исходный код которой опубликован бесплатно для скачивания и запуска на собственном компьютере любым человеком. Поскольку она работает локально, между ней и пользователем нет компании, которая бы применяла правила, поэтому исследователи используют их для чувствительной работы, но в то же время они несут собственные риски.

© 2026 AI2Day