Исследователи нашли сотни способов нарушить правила безопасности ИИ всего за $58

Некоммерческая организация по безопасности ИИ протестировала автоматизированный инструмент на семи ведущих моделях. Две потерпели крах. Стоимость заставить их нарушать правила? Всего $58.

AI2Day Newsdesk4 min read
Photoreal editorial shot of a darkened developer workstation, two large monitors glowing, one showing lines of colourful code, the other a blurred chat interfac
Share

Ключевые моменты

  • FAR.AI, калифорнийская организация по безопасности ИИ, обнаружила 448 обходов защиты Grok и 249 в Gemini при автоматизированном тестировании в 2025 году.
  • Обход правил безопасности Grok стоил примерно $58; обход Gemini стоил примерно $278, при использовании другого ИИ для генерации атакующих запросов.
  • Модели Claude, Fable и GPT устояли перед всеми автоматизированными атаками в этом тесте, хотя исследователи говорят, что более сложные атаки все еще могут сработать.
  • Исследователи из Кембриджского университета обнаружили доказательства того, что члены «Боко Харам» использовали основные чат-боты с ИИ для планирования насильственных атак.
  • В США пока нет федерального закона, требующего от компаний ИИ соблюдать определенные стандарты безопасности, хотя несколько штатов начали принимать собственные правила.

Представьте слесаря, который строит машину, чтобы опробовать тысячи разных ключей на замок, снова и снова, пока не подойдет один. FAR.AI, организация по безопасности ИИ, базирующаяся в Калифорнии, создала что-то подобное, но для чат-ботов с ИИ.

Инструмент генерирует более тысячи вариаций вредоносного вопроса и направляет их на модель ИИ одну за другой, ища комбинацию, которая пройдет мимо фильтров безопасности модели. Эти фильтры — встроенные ограничения, правила, запрограммированные в модели и предназначенные для предотвращения помощи в создании оружия или планировании атаки.

Насколько плохи были результаты?

Достаточно плохи, чтобы вызвать тревогу. FAR.AI протестировала семь моделей четырех компаний: Claude Opus 4.8 и Fable 5 от Anthropic; GPT 5.5 и 5.6 от OpenAI; Gemini 3.1 Pro от Google; и Grok 4.3 и 4.5 от SpaceXAI. Инструмент пытался заставить каждую модель производить такие вещи, как пошаговые планы кибератак и информацию о химическом или биологическом оружии.

Grok потерпел наибольший крах с 448 зафиксированными успешными обходами. Gemini следует за ним с 249. Claude, Fable и модели GPT блокировали каждую попытку.

Колонка стоимости вот что поражает. Используя вторую модель ИИ для автоматического написания атакующих запросов, FAR.AI подсчитала, что обход безопасности Grok стоит примерно $58, а Gemini — примерно $278. Меньше чем еженедельные покупки продуктов.

Модель Найденные обходы Предполагаемая стоимость
Grok 4.3 / 4.5 448 ~$58
Gemini 3.1 Pro 249 ~$278
Claude Opus 4.8 / Fable 5 0 N/A
GPT 5.5 / 5.6 0 N/A

«Модели ИИ прямо сейчас менее регулируются, чем рестораны», — сказал Адам Глив, генеральный директор FAR.AI, в беседе с Wired AI, которая первой сообщила об этих результатах.

Должны ли обычные люди беспокоиться?

Да, в разумных пределах. Эти атаки требуют определенных технических усилий, но стоимость и барьер по навыкам снижаются. Исследование Кембриджского университета обнаружило доказательства того, что члены «Боко Харам» на северо-востоке Нигерии использовали ChatGPT, Claude, Gemini, Grok, Meta AI и DeepSeek для планирования насильственных атак. Это не теоретический риск.

Стивен Каспер, компьютерный ученый из Гарвардского университета, выразился ясно: исследовательское сообщество ИИ в целом ожидает серьезного инцидента злоупотребления с биологическим, кибер- или химическим вредом в течение месяцев, а не лет.

Робин Шах, директор по безопасности и выравниванию в Google DeepMind, сказал, что результаты «не должны интерпретироваться как полная оценка безопасности Gemini», отметив, что не все обходы несут одинаковую опасность. Представитель Anthropic сказал изданию, что результаты отражают инвестиции в защиту, которую компания постоянно обновляет. OpenAI и SpaceXAI не прокомментировали.

Что дальше?

Некоторые штаты движутся вперед. Калифорния и Нью-Йорк теперь требуют от компаний ИИ публиковать отчеты о безопасности. Иллинойс вскоре потребует, чтобы независимые аудиторы проверяли их практику. Федеральные правила пока не существуют.

Компьютерный ученый из Стэнфорда Анка Реуэл четко сформулировал основной вопрос: «Некоторые компании явно знают, как защищаться как минимум от подмножества атак, протестированных в этом отчете. Вопрос в том, почему одни компании их используют, а другие — нет».

По мнению Глива, есть причина для осторожного оптимизма. Если Claude и GPT могут блокировать эти атаки, то сценарий существует. Проблема в том, что его следование остается опциональным.

На что обратить внимание: Если вы используете чат-бот с ИИ на работе или дома, имейте в виду, что не все модели построены по одному стандарту безопасности. Придерживайтесь платформ компаний, которые публикуют четкие политики безопасности, и сообщайте обо всем, что производит чат-бот и кажется предназначенным для причинения вреда.

© 2026 AI2Day