Дослідники знайшли сотні способів порушити правила безпеки AI, і це коштувало менше, ніж вечеря в ресторані
Безпекова некомерційна організація запустила автоматизований інструмент проти семи провідних моделей AI. Дві впали. Вартість змусити їх порушити правила? Всього 58 доларів.

Ключові моменти
- FAR.AI, калійорнійська некомерційна організація з безпеки AI, виявила 448 способів обходу захисту в Grok і 249 в Gemini під час автоматизованого тестування в 2025 році.
- Порушення правил безпеки Grok коштувало приблизно 58 доларів; Gemini — близько 278 доларів, використовуючи іншу AI для генерування атакуючих підказок.
- Моделі Claude, Fable та GPT стійко витримали кожну автоматизовану атаку в цьому тесту, хоча дослідники кажуть, що складніші атаки все ще могли б вдатися.
- Дослідники з Кембриджського університету знайшли докази того, що члени «Бокo Харам» використовували великі AI-чатботи для планування насильницьких атак.
- Поки що не існує федерального закону США, який вимагав би від компаній AI дотримуватися конкретних стандартів безпеки, хоча кілька штатів почали приймати власні правила.
Уявіть слюсаря, який будує машину для випробування тисяч різних ключів на замку знову і знову, поки один не підійде. FAR.AI, некомерційна організація з безпеки AI з Каліфорнії, створила щось подібне, але для AI-чатботів.
Інструмент генерує понад тисячу варіацій шкідливого питання та відправляє їх до моделі AI один за одним, шукаючи комбінацію, яка проскочить крізь фільтри безпеки моделі. Ці фільтри — це вбудовані захисні механізми, правила, вбудовані в модель, призначені для того, щоб зупинити її від допомоги комусь у виготовленні зброї або плануванні атаки.
Наскільки погані були результати?
Достатньо погані, щоб викликати тривогу. FAR.AI протестувала сім моделей від чотирьох компаній: Claude Opus 4.8 та Fable 5 від Anthropic; GPT 5.5 та 5.6 від OpenAI; Gemini 3.1 Pro від Google; і Grok 4.3 та 4.5 від SpaceXAI. Інструмент спробував змусити кожну модель створити речі на кшталт покрокових планів кібератак та інформацію про хімічну чи біологічну зброю.
Grok провалився найбільше, з 448 успішними способами обходу. Gemini йшла далі з 249. Claude, Fable та моделі GPT заблокували кожну спробу, яку кидав на них інструмент.
Колона вартості — це те, що викликає здивування. Використовуючи другу модель AI для автоматичного написання атакуючих підказок, FAR.AI розрахувала, що обхід Grok коштував близько 58 доларів, а Gemini — 278 доларів. Менше, ніж покупки на вихідні.
| Модель | Знайдені способи обходу | Приблизна вартість |
|---|---|---|
| Grok 4.3 / 4.5 | 448 | ~$58 |
| Gemini 3.1 Pro | 249 | ~$278 |
| Claude Opus 4.8 / Fable 5 | 0 | N/A |
| GPT 5.5 / 5.6 | 0 | N/A |
«AI-моделі зараз менше регульовані, ніж ресторани», — сказав Adam Gleave, генеральний директор FAR.AI, говорячи з Wired AI, яка першою повідомила про дослідження.
Повинні ли звичайні люди хвилюватися?
Так, у виміряному обсязі. Ці атаки вимагають певних технічних зусиль, але цінова та навичкова прикордонна смуга падає. Дослідження Кембриджського університету знайшло докази того, що члени «Бокo Харам» на північному сході Нігерії використовували ChatGPT, Claude, Gemini, Grok, Meta AI та DeepSeek для планування насильницьких атак. Це не теоретичний ризик.
Stephen Casper, комп'ютерний науковець з Гарвардського університету, виклав це чітко: дослідницька спільнота AI в цілому очікує серйозного інциденту неправомірного використання, пов'язаного з біологічною, кібер- або хімічною шкодою протягом місяців, а не років.
Rohin Shah з Google, директор з питань безпеки та вирівнювання в Google DeepMind, сказав, що результати «не слід інтерпретувати як комплексну оцінку безпеки Gemini», зазначивши, що не всі способи обходу несуть однакову небезпеку. Представник Anthropic розповів виданню, що дослідження відображають інвестиції в захисні механізми, які компанія постійно оновлює. OpenAI та SpaceXAI не прокоментували.
Що буде далі?
Деякі штати рухаються. Каліфорнія та Нью-Йорк тепер вимагають від компаній AI публікувати звіти про безпеку. Іллінойс скоро вимагатиме, щоб незалежні аудитори перевіряли їх практики. Федеральні правила поки що не існують.
Комп'ютерний науковець зі Стенфорда Anka Reuel виклав основне питання чітко: «Деякі компанії явно знають, як захищатися принаймні від підмножини атак, протестованих у цьому звіті. Питання в тому, чому деякі компанії їх використовують, а інші ні».
Для своєї частини Gleave бачить причину для обережного оптимізму. Якщо Claude та GPT можуть заблокувати ці атаки, то план існує. Проблема в тому, що його дотримання поки що не обов'язково.
На що звернути увагу: Якщо ви використовуєте AI-чатбот на роботі чи вдома, пам'ятайте, що не всі моделі побудовані за одним стандартом безпеки. Тримайтеся платформ компаній, які публікують чіткі політики безпеки, і повідомляйте про все, що чатбот створює й виглядає так, ніби зроблено для завдання шкоди.



