Los investigadores encontraron cientos de formas de quebrantar las reglas de seguridad de la IA, y costó menos que una cena

Una organización sin fines de lucro de seguridad ejecutó una herramienta automatizada contra siete modelos de IA líderes. Dos fallaron estrepitosamente. ¿El precio para hacerlos comportarse mal? Tan bajo como $58.

AI2Day NewsdeskUpdated Editor: Lee Brown4 min read
Photoreal editorial shot of a darkened developer workstation, two large monitors glowing, one showing lines of colourful code, the other a blurred chat interfac
Share

Puntos clave

  • FAR.AI, una organización sin fines de lucro de seguridad de IA de California, encontró 448 jailbreaks en Grok y 249 en Gemini durante pruebas automatizadas en 2025.
  • Quebrantar las reglas de seguridad de Grok costó aproximadamente $58; quebrantar las de Gemini costó aproximadamente $278, utilizando una segunda IA para generar automáticamente los indicadores de ataque.
  • Los modelos Claude, Fable y GPT resistieron cada ataque automatizado en esta prueba, aunque los investigadores dicen que ataques más complejos aún podrían tener éxito.
  • Investigadores de la Universidad de Cambridge encontraron evidencia de que miembros de Boko Haram utilizaron chatbots de IA importantes para ayudar a planificar ataques violentos.
  • Ninguna ley federal estadounidense requiere aún que las empresas de IA cumplan estándares de seguridad específicos, aunque California, Nueva York e Illinois han comenzado a actuar.

Imagina un cerrajero que construye una máquina para probar miles de llaves diferentes en una cerradura hasta que una encaja. FAR.AI, una organización sin fines de lucro de seguridad de IA con sede en California, construyó algo parecido para chatbots de IA.

La herramienta genera más de mil variaciones de una pregunta dañina y las dispara contra un modelo de IA una por una, buscando la combinación que se desliza más allá de sus filtros de seguridad. Esos filtros son los guardias integrados incorporados en un modelo para evitar que ayude a alguien a fabricar un arma o planificar un ataque.

¿Qué tan malos fueron los resultados?

Lo suficientemente malos como para sonar las alarmas. FAR.AI probó siete modelos de cuatro empresas: Claude Opus 4.8 y Fable 5 de Anthropic; GPT 5.5 y 5.6 de OpenAI; Gemini 3.1 Pro de Google; y Grok 4.3 y 4.5 de SpaceXAI, la empresa recién fusionada de Elon Musk. La herramienta intentó obtener de cada modelo planes de ciberataques paso a paso y detalles sobre armas químicas o biológicas.

Grok falló más, con 448 jailbreaks exitosos. Gemini le siguió con 249. Claude, Fable y los modelos GPT bloquearon cada intento.

El costo es lo que hace que esto sea destacable. FAR.AI calculó que costó aproximadamente $58 para hacer jailbreak de Grok y $278 para Gemini, con una segunda IA escribiendo automáticamente los indicadores de ataque.

Modelo Jailbreaks encontrados Costo estimado
Grok 4.3 / 4.5 448 ~$58
Gemini 3.1 Pro 249 ~$278
Claude Opus 4.8 / Fable 5 0 N/A
GPT 5.5 / 5.6 0 N/A

"Los modelos de IA en este momento están menos regulados que los restaurantes", dijo Adam Gleave, CEO de FAR.AI, hablando con Wired AI, que reportó primero sobre los hallazgos. También dijo que depender de compromisos voluntarios y autorregulación de la industria es "una tontería".

AI2Day cubrió primero a FAR.AI el 29 de julio de 2026; este informe es la evidencia más contundente hasta ahora de lo que las pruebas de esa organización pueden exponer.

¿Deberían preocuparse las personas ordinarias?

Sí, de manera medida. Estos ataques requieren cierto esfuerzo técnico, pero la barrera de costos está cayendo rápidamente. Investigadores de la Universidad de Cambridge encontraron evidencia de que miembros de Boko Haram en el noreste de Nigeria utilizaron ChatGPT, Claude, Gemini, Grok, Meta AI y DeepSeek para ayudar a planificar ataques violentos. Ese no es un riesgo teórico.

Stephen Casper, científico informático de la Universidad de Harvard, lo explicó claramente: la comunidad de investigación de IA en general espera un incidente grave de mal uso que implique daño biológico, químico o cibernético dentro de meses, no años.

Rohin Shah de Google, director de seguridad y alineación de AGI en Google DeepMind, dijo que los resultados "no deben interpretarse como una evaluación integral de seguridad y ciberseguridad de Gemini", señalando que no todos los jailbreaks conllevan igual peligro. Un portavoz de Anthropic le dijo a Wired AI que los hallazgos reflejan inversión en salvaguardas que la empresa sigue actualizando. OpenAI y SpaceXAI no comentaron.

¿Qué sucede ahora?

Algunos estados se están moviendo. California y Nueva York ahora requieren que las empresas de IA publiquen informes de seguridad. Illinois pronto requerirá que auditores independientes verifiquen sus prácticas. Las reglas federales aún no existen.

Anka Reuel, científica informática de Stanford, lo expresó claramente: "Algunas empresas claramente saben cómo defenderse contra al menos el subconjunto de ataques probados en este informe. La pregunta es por qué algunas empresas los están utilizando y otras no".

Gleave ve fundamentos cautelosos para el optimismo. Si Claude y GPT pueden bloquear estos ataques, el manual existe. Seguirlo sigue siendo opcional, y esa es la parte que debería preocupar a todos.

El patrón se ajusta a lo que nuestro artículo del 28 de julio de 2026 sobre el llamado de Sam Altman a desacelerar el desarrollo de IA describió: las preocupaciones de seguridad están comenzando a forzar pausas que los compromisos voluntarios nunca lo hicieron.

Qué observar: No todos los modelos de IA están construidos con el mismo estándar de seguridad. Ciéntrate en plataformas de empresas que publican políticas de seguridad claras e informa cualquier cosa que un chatbot produzca que parezca diseñada para causar daño.

© 2026 AI2Day