Uno de cada tres comandos peligrosos de IA en programación escapa a revisores humanos, según datos del juego

Un juego de navegador que simula solicitudes reales de agentes de programación con IA encontró que los jugadores aprobaron aproximadamente un tercio de los comandos maliciosos, incluso en más de 40.000 partidas. Los datos señalan un problema que va mucho más allá del juego.

AI2Day Newsdesk4 min read
A developer's terminal screen glowing in a dark room, cascading lines of green and white code reflected faintly on a desk surface, a subtle red tint bleeding in
Share

Puntos clave

  • Los jugadores aprobaron aproximadamente uno de cada tres solicitudes maliciosas de agentes de programación con IA en más de 40.000 partidas y 409.000 comandos totales revisados.
  • El comando peligroso más pasado por alto, "npm run analyze", fue aprobado casi el 65 por ciento de las veces a pesar de una advertencia visible en el registro del juego.
  • La telemetría propia de Anthropic muestra que usuarios reales aprueban alrededor del 93 por ciento de solicitudes de permisos de Claude Code, su herramienta de programación con IA.
  • El "modo automático" de Claude Code de Anthropic detecta aproximadamente el 83 por ciento de comportamientos excesivos o peligrosos antes de que se ejecuten, pero alrededor del 17 por ciento aún se escapa.
  • El desarrollador belga Alex Wauters creó el juego a finales de mayo de 2025 después de notar que la mayoría de desarrolladores aprobaban todo ciegamente o ignoraban completamente las verificaciones de permisos.

Aquí hay algo que probablemente no esperabas leer hoy: la prueba de estrés más honesta sobre seguridad en programación con IA es ahora mismo un juego de navegador que puedes completar en menos de un minuto.

El juego, creado por el desarrollador de software belga Alex Wauters, te coloca en la posición de un revisor humano observando a un agente de programación con IA, un software que realiza tareas de programación complejas paso a paso en tu nombre, solicitar permiso para ejecutar comandos. Tienes 60 segundos. Aprueba los seguros. Bloquea los peligrosos. Obtén la puntuación más alta que puedas.

En más de 40.000 partidas, los jugadores aprobaron aproximadamente uno de cada tres solicitudes maliciosas. No es una cifra muy alentadora.

¿Por qué los humanos siguen aprobando comandos peligrosos?

La respuesta corta es el agotamiento. Revisar cada acción que realiza un agente de IA es genuinamente agotador, y cuando te ves inundado de ventanas emergentes, tu atención se dispersa.

Wauters creó el juego después de notar un patrón entre desarrolladores que utilizan Claude Code, la herramienta de programación con IA de Anthropic. Frente a una avalancha de ventanas emergentes de permisos, muchos simplemente activaban una opción llamada "dangerously-skip-permissions", que permite que el modelo se ejecute sin pedir la aprobación humana. El otro grupo hacía clic en aprobar todo sin leerlo realmente.

Ninguno de estos enfoques es seguro.

"La gran cantidad de ruido introduce agotamiento, y los desarrolladores no siempre tienen el contexto de lo que ha cambiado para determinar rápidamente el riesgo", escribió Wauters en una entrada de blog publicada junto con el lanzamiento del juego a finales de mayo.

Los datos del juego, reportados por primera vez por The Register AI, respaldan esto con detalles incómodos. Las violaciones de alcance, cosas como que un agente lea silenciosamente archivos de credenciales de AWS o datos de configuración de Kubernetes (archivos que almacenan claves de acceso y configuraciones de servidor, exactamente lo que un atacante querría robar), se pasaron por alto el 35 por ciento de las veces. Los comandos obviamente catastróficos, como ordenar la eliminación de un sistema de archivos completo, fueron detectados la mayoría de las veces. La gente aún sabe reconocer una bomba cuando la ve.

Las amenazas más difíciles de detectar se escurrieron. Las solicitudes curl a direcciones web desconocidas y paquetes con nombres falsos (paquetes de software con nombres deliberadamente similares a otros confiables, diseñados para engañar a la gente para que ejecute código malicioso) fueron pasados por alto casi con la misma frecuencia que los robo de credenciales.

Tipo de comando Tasa aproximada de no detección
Violaciones de alcance (p. ej., lectura de archivos de credenciales) 35%
Paquetes con nombres falsos ~35%
Solicitudes curl a API desconocidas ~35%
Inyecciones de crontab / secuestro de configuración de git Menor
Comandos obviamente destructivos (p. ej., eliminar raíz) Menor

El resultado más grave: "npm run analyze", un comando que suena rutinario pero puede estar configurado para ejecutar cualquier código oculto dentro de un archivo de proyecto. Casi el 65 por ciento de los jugadores lo aprobaron. El juego incluso mostró una advertencia en el registro del historial directamente encima del botón de aprobación. Dos tercios no la leyeron.

¿Está sucediendo esto realmente fuera del juego?

Sí. Anthropic lo confirmó con sus propios datos.

En una publicación de mayo de 2025 sobre cómo Claude Code maneja los permisos, Anthropic dijo que los usuarios aprueban alrededor del 93 por ciento de todas las solicitudes de permisos que genera la herramienta. "Cuantas más aprobaciones ve un usuario, menos atención presta a cada una", escribió la empresa.

La respuesta de Anthropic es el "modo automático", un sistema que utiliza un clasificador de IA separado, un modelo entrenado para juzgar si un comando parece arriesgado, para filtrar solicitudes peligrosas antes de que lleguen a un humano. Detecta aproximadamente el 83 por ciento de acciones problemáticas. El 17 por ciento restante aún llega a un escritorio humano.

Anthropic es claro en que el modo automático es "una capa de defensa en profundidad dentro de un sandbox, no un sustituto de uno".

Wauters está de acuerdo. Su recomendación es ejecutar agentes de programación dentro de entornos virtuales aislados llamados sandboxes o devcontainers (espacios de trabajo digitales sellados que limitan lo que el agente puede tocar en tu máquina real), usar herramientas como el modo automático, y escribir ganchos personalizados (scripts pequeños que interceptan comandos antes de ejecutarse) para señalar cualquier cosa sospechosa antes de que se ejecute automáticamente.

"Necesitamos hacer que las herramientas sean más fáciles de usar para que estos sistemas sean más seguros que simplemente señalar la revisión humana como una solución válida", le dijo a The Register AI.

Si le das a un agente de IA una tarea larga y te vas, lo que obtengas puede no ser lo que esperabas. Revisar importa, y entender qué estás revisando es aún más importante.

© 2026 AI2Day