Кожна третя небезпечна команда AI для кодування проходить повз людських рецензентів, показують дані гри
Браузерна гра, яка імітує реальні запити агентів AI для кодування, виявила, що гравці схвалили приблизно третину шкідливих команд навіть у понад 40 000 запусків. Дані вказують на проблему, яка виходить далеко за межі гри.

Ключові моменти
- Гравці схвалили приблизно одну з трьох шкідливих запитів агентів AI для кодування у понад 40 000 запусків гри та 409 000 загальних перевірених команд.
- Найчастіше пропущена небезпечна команда "npm run analyze" була схвалена в майже 65% випадків, незважаючи на видиме попередження в журналі історії гри.
- Власна телеметрія Anthropic показує, що реальні користувачі схвалюють близько 93% запитів дозволу від Claude Code, їхнього інструменту AI для кодування.
- Режим "auto mode" компанії Anthropic для Claude Code перехоплює приблизно 83% надмірно активної або небезпечної поведінки до її виконання, але близько 17% все ж проходять.
- Бельгійський розробник Алекс Вотерс створив гру наприкінці травня 2025 року, помітивши, що більшість розробників або схвалюють все сліпо, або взагалі пропускають перевірки дозволів.
Ось щось, що ви, ймовірно, не очікували читати сьогодні: найчесніший стрес-тест безпеки AI для кодування прямо зараз — це браузерна гра, яку можна завершити менше ніж за хвилину.
Гру створив бельгійський розробник програмного забезпечення Алекс Вотерс. Вона ставить вас на місце людського рецензента, який спостерігає за агентом AI для кодування — програмним забезпеченням, яке виконує складні завдання програмування по черзі від вашого імені — коли він просить дозвіл на виконання команд. У вас є 60 секунд. Схваліть безпечні команди. Заблокуйте небезпечні. Отримайте якомога вищий результат.
У понад 40 000 запусків гравці схвалили приблизно одну з трьох шкідливих запитів. Це не дуже хороший результат.
Чому люди продовжують схвалювати небезпечні команди?
Короткий відповідь — утома. Перевірка кожної дії, яку виконує агент AI, справді вичерпна, а коли ви захлинаються в спливаючих вікнах, ваша увага зникає.
Вотерс створив гру, помітивши закономірність серед розробників, які використовують Claude Code, інструмент AI для кодування від Anthropic. Зіткнувшись із потоком спливаючих вікон запиту дозволу, багато хто просто включив параметр "dangerously-skip-permissions", який дозволяє моделі працювати без запиту людської санкції. Інша група клікала схвалити все, не читаючи справді.
Жоден підхід не є безпечним.
"Великий обсяг шуму викликає утому, а розробники не завжди мають контекст щодо того, що змінилося, щоб швидко визначити ризик", — написав Вотерс у записі блога, опублікованому разом із запуском гри наприкінці травня.
Дані гри, вперше повідомлені The Register AI, підтверджують це в дискомфортних деталях. Порушення обсягу — такі як агент, який тихо читає файли AWS-облікових даних або конфігураційні дані Kubernetes (файли, які зберігають ключі входу та параметри сервера, саме те, що хотів би вкрасти зловмисник), були пропущені в 35% випадків. Очевидно катастрофічні команди, такі як замовлення видалення всієї файлової системи, були перехоплені найчастіше. Люди все ще знають бомбу, коли її бачать.
Хитріші загрози проходили крізь сіто. Curl-запити на невідомі веб-адреси та пакети з опечатками в назві (програмні пакети з назвами, навмисне написаними майже як надійні, розроблені, щоб обдурити людей у запуску шкідливого коду) були пропущені майже так само часто, як захоплення облікових даних.
| Тип команди | Приблизна частота пропусків |
|---|---|
| Порушення обсягу (наприклад, читання файлів облікових даних) | 35% |
| Пакети з опечатками в назві | ~35% |
| Curl-запити на невідомі API | ~35% |
| Ін'єкції crontab / перехоплення конфігурації git | Менше |
| Очевидно деструктивні команди (наприклад, видалення root) | Найменше |
Найгірший результат: "npm run analyze", команда, яка звучить рутинно, але може бути налаштована для запуску будь-якого коду, прихованого всередині файлу проекту. Майже 65% гравців її схвалило. Гра навіть відобразила попередження в журналі історії прямо над кнопкою схвалення. Два з трьох його не прочитали.
Чи це насправді відбувається поза грою?
Так. Anthropic підтвердила це своїми даними.
У записі за травень 2025 року про те, як Claude Code обробляє дозволи, Anthropic повідомила, що користувачі схвалюють близько 93% усіх запитів дозволу, які генерує інструмент. "Що більше схвалень бачить користувач, то менше уваги він звертає на кожне", — написала компанія.
Відповідь Anthropic — це режим "auto mode", система, яка використовує окремий класифікатор AI, модель, навчену оцінювати, чи виглядає команда ризикованою, щоб відфільтрувати небезпечні запити до того, як вони коли-небудь дійдуть до людини. Він перехоплює близько 83% проблемних дій. Решта 17% все ще потрапляє на стіл людини.
Anthropic чітко зазначає, що режим auto mode — це "один рівень захисту в глибину всередину пісочниці, а не його замінник".
Вотерс погоджується. Його рекомендація — запускати агенти кодування в ізольованих віртуальних середовищах, які називаються пісочниці або devcontainers (герметичні цифрові робочі простори, які обмежують те, чого агент може торкнутися на вашому реальному комп'ютері), використовувати інструменти, подібні до auto mode, та писати користувальницькі хуки (малі скрипти, які перехоплюють команди перед їх виконанням) для позначення будь-чого підозрілого до його автоматичного запуску.
"Нам потрібно зробити інструменти простішими, щоб зробити ці системи безпечнішими, ніж указування на людський огляд як на дійсне рішення", — сказав він The Register AI.
Якщо ви доручите агенту AI довге завдання та піти, те, що повернеться, може бути не тим, чого ви очікували. Перевірка важлива, а розуміння того, що ви перевіряєте, важливіше.



