Investigadores Encontraron Cientos de Formas de Violar las Reglas de Seguridad de IA, y Costó Menos que una Cena Fuera
Una organización de seguridad ejecutó una herramienta automatizada contra siete modelos de IA líderes. Dos fallaron gravemente. ¿El costo para hacerlos comportarse mal? Apenas $58.

Puntos clave
- FAR.AI, una organización sin fines de lucro de seguridad de IA con sede en California, encontró 448 vulnerabilidades de seguridad en Grok y 249 en Gemini durante pruebas automatizadas en 2025.
- Violar las reglas de seguridad de Grok costó aproximadamente $58; violar las de Gemini costó aproximadamente $278, utilizando otra IA para generar las solicitudes de ataque.
- Los modelos Claude, Fable y GPT resistieron todos los ataques automatizados en esta prueba, aunque los investigadores advierten que ataques más complejos podrían tener éxito.
- Investigadores de la Universidad de Cambridge encontraron evidencia de que miembros de Boko Haram utilizaron grandes chatbots de IA para ayudar a planificar ataques violentos.
- Aún no existe ley federal estadounidense que requiera que las empresas de IA cumplan con estándares de seguridad específicos, aunque varios estados han comenzado a aprobar sus propias reglas.
Imagina un cerrajero que construye una máquina para probar miles de llaves diferentes en una cerradura, una y otra vez, hasta que una encaja. FAR.AI, una organización sin fines de lucro de seguridad de IA con sede en California, construyó algo parecido, pero para chatbots de IA.
La herramienta genera más de mil variaciones de una pregunta dañina y las dispara contra un modelo de IA una por una, buscando la combinación que elude los filtros de seguridad del modelo. Esos filtros son las salvaguardas integradas, las reglas incorporadas en un modelo que tienen la intención de evitar que ayude a alguien a fabricar un arma o planificar un ataque.
¿Cuán malos fueron los resultados?
Lo suficientemente malos como para levantar alarmas. FAR.AI probó siete modelos de cuatro empresas: Claude Opus 4.8 y Fable 5 de Anthropic; GPT 5.5 y 5.6 de OpenAI; Gemini 3.1 Pro de Google; y Grok 4.3 y 4.5 de SpaceXAI. La herramienta intentó que cada modelo produjera cosas como planes detallados de ciberataques paso a paso e información sobre armas químicas o biológicas.
Grok falló más, con 448 vulnerabilidades de seguridad registradas. Gemini le siguió, con 249. Claude, Fable y los modelos GPT bloquearon todos los intentos que la herramienta les lanzó.
La columna de costo es lo que hace que esto sea sorprendente. Utilizando un segundo modelo de IA para escribir automáticamente las solicitudes de ataque, FAR.AI calculó que costaba aproximadamente $58 violar la seguridad de Grok y $278 para Gemini. Menos que una compra de fin de semana.
| Modelo | Vulnerabilidades encontradas | Costo estimado |
|---|---|---|
| Grok 4.3 / 4.5 | 448 | ~$58 |
| Gemini 3.1 Pro | 249 | ~$278 |
| Claude Opus 4.8 / Fable 5 | 0 | N/A |
| GPT 5.5 / 5.6 | 0 | N/A |
"Los modelos de IA en este momento están menos regulados que los restaurantes", dijo Adam Gleave, CEO de FAR.AI, hablando con Wired AI, que reportó primero sobre los hallazgos.
¿Deberían preocuparse las personas ordinarias?
Sí, de manera medida. Estos ataques requieren cierto esfuerzo técnico, pero la barrera de costo y habilidad está disminuyendo. Un estudio de la Universidad de Cambridge encontró evidencia de que miembros de Boko Haram en el noreste de Nigeria utilizaron ChatGPT, Claude, Gemini, Grok, Meta AI y DeepSeek para ayudar a planificar ataques violentos. Ese no es un riesgo teórico.
Stephen Casper, científico informático de la Universidad de Harvard, lo expresó claramente: la comunidad de investigación de IA en general espera un incidente grave de mal uso que implique daño biológico, cibernético o químico en cuestión de meses, no años.
Rohin Shah de Google, director de seguridad y alineación en Google DeepMind, dijo que los resultados "no deben interpretarse como una evaluación integral de la seguridad de Gemini", señalando que no todas las vulnerabilidades de seguridad conllevan igual peligro. Un portavoz de Anthropic dijo al medio que los hallazgos reflejan la inversión en salvaguardas que la empresa sigue actualizando. OpenAI y SpaceXAI no hicieron comentarios.
¿Qué sucede después?
Algunos estados se están moviendo. California y Nueva York ahora requieren que las empresas de IA publiquen informes de seguridad. Illinois pronto requerirá que auditores independientes verifiquen sus prácticas. Las reglas federales aún no existen.
Anka Reuel, científica informática de Stanford, enmarco la pregunta central claramente: "Algunas empresas claramente saben cómo defenderse contra al menos el subconjunto de ataques probados en este informe. La pregunta es por qué algunas empresas los están utilizando y otras no".
Gleave, por su parte, ve una razón para un optimismo cauteloso. Si Claude y GPT pueden bloquear estos ataques, el manual existe. El problema es que seguirlo sigue siendo opcional.
Qué observar: Si utilizas un chatbot de IA en el trabajo o en casa, ten en cuenta que no todos los modelos se construyen con el mismo estándar de seguridad. Adhiérete a plataformas de empresas que publican políticas de seguridad claras e informa cualquier cosa que un chatbot produzca que parezca diseñada para causar daño.



