Un modelo de IA chino casi iguala los mejores sistemas occidentales. Su historial de seguridad no.

Una nueva evaluación encuentra que GLM-5.2, un modelo de peso abierto de Z.ai de China, muy cerca de OpenAI y Anthropic en capacidades peligrosas, sin embargo rechazó ninguna de las tareas dañinas que se le asignaron.

AI2Day Newsdesk5 min read
AI-driven cyber operations visual, depicting autonomous systems in a digital landscape
Share

Puntos clave

  • GLM-5.2, un modelo de IA de peso abierto de Z.ai de China, se sitúa solo a meses de distancia de GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic en capacidades peligrosas de ciberseguridad y biología, según un informe de SaferAI de 2025.
  • GLM-5.2 rechazó cero tareas ofensivas de ciberseguridad o de biología de doble uso en la evaluación de SaferAI; Claude Opus 4.7 rechazó de manera tan consistente que la misma prueba no pudo completarse en él en absoluto.
  • Debido a que los pesos del modelo de GLM-5.2 (los archivos sin procesar que hacen funcionar la IA) son descargables públicamente, cualquier configuración de seguridad que Z.ai aplique a su servicio hospedado no puede seguir al modelo una vez que alguien lo ejecuta en su propia computadora.
  • SaferAI dice que Z.ai no publicó ningún marco de seguridad, compromisos de prueba previa al despliegue o evaluación de riesgos para GLM-5.2.
  • Tanto defensores como atacantes utilizan modelos de peso abierto; Hugging Face aparentemente confió en GLM-5.2 para ayudar a repeler una brecha reciente vinculada a OpenAI.

Un modelo de IA chino se ha acercado a los sistemas más capaces del mundo, y una organización sin fines de lucro de seguridad dice que ayudará con casi cualquier cosa que un usuario pida, incluidas tareas que podrían alimentar ciberataques o experimentos biológicos peligrosos.

SaferAI, una organización sin fines de lucro de seguridad de IA, probó GLM-5.2, el último modelo de peso abierto de la empresa china Z.ai, y encontró que sus capacidades en ciberseguridad ofensiva y biología de doble uso (es decir, conocimiento biológico que podría ser mal utilizado para causar daño) quedan rezagadas solo algunos meses detrás de GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic, actualmente entre los sistemas de IA más poderosos disponibles. La evaluación fue reportada por primera vez por TechCrunch AI.

¿Qué mostraron realmente las pruebas?

GLM-5.2 completó todas las tareas ofensivas de ciberseguridad y biología de doble uso que SaferAI le asignó. Claude Opus 4.7, por el contrario, rechazó de manera tan consistente que los evaluadores no pudieron completar CyberGym, un punto de referencia que califica las capacidades de ciberseguridad de un modelo, en él en absoluto.

El director ejecutivo de SaferAI, Henry Papadatos, lo expresó claramente: "La frontera de la capacidad no es la frontera del riesgo, por lo que tenemos que tener en cuenta el estado de las mitigaciones también para evaluar el riesgo correctamente".

Cerrar la brecha de capacidad no es automáticamente un problema. Solo se convierte en uno cuando las prácticas de seguridad no van al ritmo.

¿Por qué Z.ai no puede simplemente bloquear las solicitudes peligrosas?

Z.ai puede, y lo hace, aplicar filtros de seguridad a la versión de GLM-5.2 que hospeda en sus propios servidores. El problema es que GLM-5.2 es de peso abierto: los archivos del modelo subyacente son descargables por cualquiera. Una vez que una persona descarga esos archivos y ejecuta el modelo en su propio hardware, los filtros de Z.ai no van con ellos a ningún lado.

Los modelos cerrados de empresas como OpenAI y Anthropic se basan en clasificadores (software que escanea solicitudes e indica las dañinas), entrenamiento de rechazo (enseñar al modelo a decir no a indicaciones peligrosas) y controles a nivel de API (reglas integradas en la interfaz del servicio). Ninguna de esas herramientas llega a un modelo de peso abierto ejecutándose en la máquina de otra persona.

Incluso los modelos cerrados no son herméticos. Un informe separado de la organización sin fines de lucro de seguridad de IA Far.ai encontró cientos de "jailbreaks" reutilizables (trucos que engañan a un modelo para que ignore sus reglas de seguridad) en modelos que incluyen Grok 4.5 de xAI y Gemini 3.1 Pro de Google DeepMind. Los atacantes tienden a combinar escenarios de juego de rol, autoridad falsa e historiales de conversación inventados para eludir las defensas de un modelo.

¿Qué se puede hacer realmente?

Una solución parcial es filtrar los datos de entrenamiento antes de construir un modelo, eliminando material de ciberseguridad peligroso para que el modelo nunca lo aprenda. Algunas investigaciones sugieren que esto puede reducir el conocimiento biológico peligroso sin afectar el rendimiento general. La ciberseguridad es más difícil: un modelo que codifica bien es, casi por definición, un hacker capaz, y la codificación es donde las empresas de IA ganan la mayor parte de su dinero.

Anthropic ha adoptado un enfoque más estrecho con su tarjeta del modelo Opus 5, permitiendo que el modelo encuentre vulnerabilidades en código fuente sin compilar pero no en software compilado, lo que dificulta su uso para ataques directos.

Paradójicamente, los modelos de peso abierto también ayudan a los defensores. Hugging Face aparentemente utilizó GLM-5.2 para ayudar a repeler una brecha reciente. El CEO Clem Delangue escribió esta semana que los mismos sistemas utilizados para detener un ataque impulsado por IA "ahora pueden ayudar a defender contra millones de ciberataques cada día".

Papadatos es escéptico de que ese beneficio justifique el riesgo. "Por defecto, los atacantes adoptan nuevas herramientas más rápido que los defensores", dijo. "Un grupo de ransomware puede cambiar sus métodos en una semana. Un hospital no puede".

Modelo Desarrollador ¿Rechazó tareas de CyberGym? ¿Pesos descargables públicamente?
GLM-5.2 Z.ai (China) No
Claude Opus 4.7 Anthropic Sí (completamente) No
GPT-5.5 OpenAI Parcialmente No
Grok 4.5 xAI Parcialmente (jailbreaks encontrados) No
Gemini 3.1 Pro Google DeepMind Parcialmente (jailbreaks encontrados) No

Preguntas frecuentes

¿Significa esto que GLM-5.2 es ilegal de descargar?

No. Descargar y ejecutar un modelo de IA de peso abierto es legal en la mayoría de los países. La preocupación no es la descarga en sí sino lo que alguien podría hacer con un modelo que no rechaza ninguna solicitud dañina.

¿Qué deberían sacar de esto las personas ordinarias?

Si usa cualquier chatbot de IA o servicio, vale la pena saber que la seguridad del modelo subyacente varía enormemente. Las herramientas construidas sobre modelos cerrados y probados de seguridad conllevan menos riesgos que las construidas sobre modelos descargables libremente y sin restricciones.

¿Está China regulando algo de esto?

China tiene regulaciones de IA, pero según el investigador del Centro de Política Cibernética de Stanford, Graham Webster, históricamente se han enfocado en contenido políticamente sensible y estabilidad social en lugar de riesgos catastróficos como ciberataques o mal uso biológico.

© 2026 AI2Day