Los guardrails de IA creados para detener a hackers ahora bloquean a quienes intentan detenerlos

Los investigadores de seguridad dicen que los filtros de seguridad en las herramientas de IA líderes son inconsistentes, frustrantes e impulsan a los defensores legítimos hacia modelos extranjeros no regulados.

AI2Day Newsdesk4 min read
A sleek server room bathed in cool blue light, rows of black server racks stretching into the distance, a single amber warning light glowing on one unit in the
Share

Puntos clave

  • Los modelos de IA Mythos y Fable de Anthropic enfrentaron controles de exportación del gobierno estadounidense en junio, restringiendo quién podía acceder a ellos fuera del país.
  • Tanto Anthropic como OpenAI ejecutan programas verificados que otorgan a investigadores de ciberseguridad aprobados acceso ligeramente menos restrictivo a sus herramientas de IA.
  • Múltiples investigadores de seguridad ofensiva dicen que los filtros aún bloquean trabajo esencial y producen resultados impredecibles incluso dentro de esos programas.
  • Algunos investigadores dicen que las restricciones los empujan hacia modelos de IA de código abierto chinos, como GLM, que no tienen filtros ni verificación alguna.
  • Un investigador de un fabricante de componentes para teléfonos inteligentes dijo que las herramientas de IA de su equipo se volvieron casi inútiles para trabajo de seguridad porque nadie había solicitado el programa verificado.

La ciberseguridad siempre ha sido un juego de dos lados. El mismo conocimiento que permite a un defensor reparar un agujero permite a un atacante atravesarlo. Ahora las herramientas de IA han llegado al medio de esa tensión, y los filtros de seguridad incorporados en ellas están comenzando a frustrar a las personas a las que estaban destinados a proteger.

¿Qué está saliendo mal exactamente?

Las empresas de IA colocan guardrails, es decir, reglas automáticas que impiden que el software responda preguntas que consideran peligrosas, en sus modelos para evitar que los criminales los usen para crear malware o planear ataques. El problema es que esas mismas reglas bloquean a los investigadores de seguridad legítimos de hacer su trabajo.

Chris Anley, científico jefe de la firma de consultoría de seguridad NCC Group, dio un ejemplo claro. Cuando le pide a un modelo de IA que intente explotar un fallo de software, está probando si el fallo es real y lo suficientemente peligroso como para repararlo. Un guardrail que rechaza esa solicitud no protege a nadie. Solo deja la vulnerabilidad sin confirmar y potencialmente abierta a un atacante real.

"Reparar este código es tanto un mecanismo esencial para la defensa como una hoja de ruta para encontrar vulnerabilidades críticas," dijo Anley. "La misma herramienta es tanto una herramienta ofensiva como defensiva, y los dos realmente no pueden separarse."

Su analogía: es como un martillo. No puedes construir una casa sin uno, pero también puede romper una ventana.

¿Qué tan mala es la inconsistencia?

Es lo suficientemente irregular como para desperdiciar tiempo considerable. Chris Thompson, director ejecutivo de la firma de ciberseguridad RemoteThreat y fundador de Offensive AI Con, una conferencia enfocada en seguridad e IA, le dijo a TechCrunch que incluso dentro de los programas de investigador aprobados de Anthropic y OpenAI, los guardrails se activan de manera diferente de un día a otro.

"Pasas mucho tiempo negociando con el modelo en lugar de trabajar en el programa de seguridad principal," dijo Thompson. "En lugar de analizar una vulnerabilidad, estás intentando entender por qué los modelos están sobre-sanitizando el resultado."

Un investigador sin nombre de un fabricante de componentes para teléfonos inteligentes lo expresó claramente: "Si se entera de que estamos haciendo algo relacionado con seguridad, simplemente se detiene y no es usable."

¿Hacia quién está empujando esto a las personas?

Modelos de código abierto sin filtros en absoluto, muchos de ellos desarrollados en China. Thompson dijo que los investigadores responsables están siendo alejados de sistemas sujetos a supervisión estadounidense y hacia herramientas construidas en el extranjero que no tienen responsabilidad.

"Tienes a estos investigadores responsables que están siendo empujados lejos de sistemas gobernados por EE.UU. hacia sistemas de propiedad extranjera," dijo. "Creo que es más perjudicial que beneficioso tener estos guardrails en su lugar."

No todos los investigadores se sienten bloqueados. Giuseppe Cali, quien encuentra y desarrolla zero-days (vulnerabilidades de software previamente desconocidas para las que aún no existe parche), dijo que mantiene la IA alejada de la búsqueda real de vulnerabilidades porque quiere que ese descubrimiento sea solo suyo. Para tareas de apoyo como entender código desconocido, encuentra las herramientas lo suficientemente útiles.

"Soy celoso de mis bugs," dijo Cali, "y me encanta este juego demasiado como para dejar que los modelos lo jueguen por mí."

La solución de Thompson no es eliminar los guardrails por completo. Quiere que los laboratorios de IA amplíen el acceso para investigadores verificados, apliquen reglas consistentes y responsabilicen a los malos actores cuando se produce abuso. Sin ese equilibrio, argumenta, los defensores se quedarán rezagados respecto a los atacantes que no enfrentan tales restricciones.

Preguntas frecuentes

¿Afectan estas restricciones a los usuarios ordinarios de computadoras?

No directamente. La fricción descrita aquí afecta a investigadores de seguridad profesionales, no a personas comunes usando IA para escribir o tareas de trabajo. Los guardrails generales permanecen en su lugar para todos.

¿Por qué las empresas de IA restringen preguntas sobre ciberseguridad en absoluto?

Preocupan que la orientación detallada paso a paso sobre ataques podría ayudar a los criminales a crear malware o violar sistemas. La dificultad es que esa misma orientación es exactamente lo que los defensores legítimos necesitan para probar y reforzar esos sistemas primero.

¿Qué es un modelo de IA de código abierto y por qué no tiene guardrails?

Un modelo de IA de código abierto es uno cuyo código subyacente se publica libremente para que cualquiera lo descargue y ejecute en su propia computadora. Porque se ejecuta localmente, no hay una empresa en el medio para hacer cumplir reglas, por eso los investigadores lo usan para trabajo sensible pero también por qué llevan riesgos propios.

© 2026 AI2Day