Каждая третья опасная команда AI для кодирования проходит мимо проверяющих, показывают данные игры
Браузерная игра, моделирующая реальные запросы агентов AI для кодирования, показала, что игроки одобрили примерно треть вредоносных команд даже при более чем 40 000 прохождениях. Данные указывают на проблему, выходящую далеко за рамки игры.

Ключевые моменты
- Игроки одобрили примерно одну из трёх вредоносных запросов агентов AI для кодирования в ходе более 40 000 прохождений игры и 409 000 проверенных команд в целом.
- Наиболее часто пропускаемая опасная команда «npm run analyze» была одобрена в почти 65 процентах случаев, несмотря на видимое предупреждение в журнале истории игры.
- Телеметрия самой компании Anthropic показывает, что реальные пользователи одобряют около 93 процентов запросов на разрешение от Claude Code, инструмента AI для кодирования.
- «Режим автоматизации» для Claude Code предотвращает примерно 83 процента чрезмерно активных или опасных действий перед их выполнением, но примерно 17 процентов всё же проходят дальше.
- Бельгийский разработчик Алекс Вотерс создал игру в конце мая 2025 года, заметив, что большинство разработчиков либо всё одобряют вслепую, либо полностью пропускают проверку разрешений.
Вот кое-что, чего вы, вероятно, не ожидали прочитать сегодня: самый честный тест безопасности AI для кодирования прямо сейчас — это браузерная игра, которую можно завершить менее чем за минуту.
Игра, созданная бельгийским разработчиком Алексом Вотерсом, ставит вас в роль проверяющего, который наблюдает за агентом AI для кодирования — программой, которая пошагово выполняет сложные задачи программирования от вашего имени и просит разрешение на запуск команд. У вас есть 60 секунд. Одобрите безопасные команды. Заблокируйте опасные. Набирайте как можно больше баллов.
Во время более 40 000 прохождений игроки одобрили примерно одну из трёх вредоносных запросов. Это не очень хороший результат.
Почему люди продолжают одобрять опасные команды?
Усталость — короткий ответ. Проверка каждого действия, которое предпринимает агент AI, — это действительно утомительно, и когда вас захлёстывают запросами на разрешение, ваше внимание рассеивается.
Вотерс создал игру после того, как заметил закономерность среди разработчиков, использующих Claude Code, инструмент AI для кодирования от Anthropic. Столкнувшись с потоком всплывающих окон разрешений, многие просто включили параметр «dangerously-skip-permissions», который позволяет модели работать без человеческого одобрения. Другие просто нажимали одобрить, не читая.
Ни один из этих подходов не является безопасным.
«Большое количество шума вызывает усталость, и у разработчиков часто нет контекста того, что изменилось, чтобы быстро определить риск», — написал Вотерс в статье блога, опубликованной одновременно с запуском игры в конце мая.
Данные игры, впервые сообщённые The Register AI, подтверждают это в неудобных деталях. Нарушения области доступа — такие как тихое чтение агентом файлов учётных данных AWS или конфигурационных данных Kubernetes (файлы, в которых хранятся ключи входа и параметры сервера, именно то, что хотел бы украсть злоумышленник), — были пропущены в 35 процентах случаев. Явно катастрофические команды, такие как удаление всей файловой системы, были перехвачены чаще всего. Люди по-прежнему узнают бомбу, когда видят её.
Более сложные угрозы проходили сквозь фильтр. Curl-запросы на неизвестные веб-адреса и пакеты с опечатками в названиях (пакеты программного обеспечения с названиями, намеренно написанными почти как доверенные, предназначенные для того, чтобы обмануть людей и запустить вредоносный код) были пропущены почти так же часто, как и захваты учётных данных.
| Тип команды | Примерный процент пропусков |
|---|---|
| Нарушения области доступа (например, чтение файлов учётных данных) | 35% |
| Пакеты с опечатками в названиях | ~35% |
| Curl-запросы на неизвестные API | ~35% |
| Инъекции crontab / захваты конфигурации git | Ниже |
| Явно разрушительные команды (например, удаление root) | Самый низкий |
Худший результат: команда «npm run analyze», которая звучит рутинно, но может быть настроена на запуск любого кода, спрятанного внутри файла проекта. Её одобрили почти 65 процентов игроков. В игре даже было отображено предупреждение в журнале истории прямо над кнопкой одобрения. Две трети его не прочитали.
Происходит ли это на самом деле за пределами игры?
Да. Anthropic подтвердила это собственными данными.
В посте от мая 2025 года о том, как Claude Code работает с разрешениями, Anthropic сообщила, что пользователи одобряют около 93 процентов всех запросов на разрешение, которые генерирует инструмент. «Чем больше одобрений видит пользователь, тем меньше внимания он уделяет каждому», — написала компания.
Решение Anthropic — «режим автоматизации», система, которая использует отдельный классификатор AI, модель, обученную судить о том, выглядит ли команда рискованной, для фильтрации опасных запросов ещё до того, как они когда-либо достигнут человека. Она перехватывает примерно 83 процента проблемных действий. Оставшиеся 17 процентов по-прежнему попадают на стол к человеку.
Anthropic ясно даёт понять, что режим автоматизации — это «один уровень защиты в глубину внутри песочницы, а не замена ей».
Вотерс согласен. Его рекомендация — запускать агентов кодирования в изолированных виртуальных средах, называемых песочницами или devcontainers (герметичными цифровыми рабочими пространствами, которые ограничивают то, что агент может трогать на вашем реальном компьютере), использовать такие инструменты, как режим автоматизации, и писать пользовательские хуки (небольшие скрипты, которые перехватывают команды перед их выполнением) для обозначения всего подозрительного перед его автоматическим запуском.
«Нам нужно сделать инструменты проще, чтобы сделать эти системы безопаснее, чем полагаться на человеческую проверку как на действительное решение», — сказал он The Register AI.
Если вы поручаете агенту AI длительную задачу и уходите, результат может отличаться от ожидаемого. Проверка важна, а понимание того, что вы проверяете, ещё более важно.



