Un modelo de IA chino casi iguala a los mejores sistemas occidentales. Su historial de seguridad no
Una nueva evaluación encuentra que GLM-5.2, un modelo de peso abierto de Z.ai de China, está cerca de OpenAI y Anthropic en capacidades peligrosas, pero rechazó ninguna de las tareas dañinas que se le asignaron.

Puntos clave
- GLM-5.2, un modelo de peso abierto de Z.ai de China, está solo meses por detrás de GPT-5.5 y Claude Opus 4.7 en capacidades peligrosas de ciberseguridad y biología, según un informe de SaferAI de 2025.
- GLM-5.2 rechazó cero tareas ofensivas de ciberseguridad o biología de uso dual en la evaluación de SaferAI; Claude Opus 4.7 rechazó tan consistentemente que la misma prueba ni siquiera pudo completarse en él.
- Debido a que los pesos del modelo de GLM-5.2 (los archivos sin procesar que hacen funcionar la IA) se pueden descargar públicamente, ningún filtro de seguridad que Z.ai aplique a su servicio alojado puede seguir el modelo en el hardware de otra persona.
- SaferAI dice que Z.ai no publicó ningún marco de seguridad, compromisos de prueba previa al despliegue ni evaluación de riesgos para GLM-5.2.
- Defensores y atacantes utilizan modelos de peso abierto; Hugging Face aparentemente confió en GLM-5.2 para ayudar a repeler una brecha reciente vinculada a OpenAI.
Un modelo de IA chino se ha acercado a los sistemas más capaces del mundo, y una organización sin fines de lucro de seguridad dice que ayudará con casi cualquier cosa que pida un usuario, incluidas tareas que podrían alimentar ciberataques o experimentos biológicos peligrosos.
SaferAI probó GLM-5.2, el último modelo de peso abierto de la empresa china Z.ai, y encontró que sus capacidades en ciberseguridad ofensiva y biología de uso dual (conocimiento biológico que podría ser utilizado indebidamente para causar daño) se retrasan solo unos meses con respecto a GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic. Informamos por primera vez sobre GLM-5.2 el 16 de julio de 2026 y lo hemos seguido a través de ocho historias desde entonces. TechCrunch AI informó por primera vez sobre la evaluación.
¿Qué mostraron realmente las pruebas?
GLM-5.2 completó todas las tareas ofensivas de ciberseguridad y biología de uso dual que SaferAI le planteó. Claude Opus 4.7, en contraste, rechazó tan consistentemente que los evaluadores ni siquiera pudieron completar CyberGym, un punto de referencia que califica las capacidades de ciberseguridad de un modelo, en él.
El director ejecutivo de SaferAI, Henry Papadatos, le dijo a TechCrunch: "La frontera de la capacidad no es la frontera del riesgo, por lo que también debemos tener en cuenta el estado de las mitigaciones para evaluar adecuadamente el riesgo".
Cerrar la brecha de capacidad no es automáticamente un problema. Solo se convierte en uno cuando las prácticas de seguridad no mantienen el ritmo.
¿Por qué Z.ai no puede simplemente bloquear las solicitudes peligrosas?
Z.ai puede, y lo hace, aplicar filtros de seguridad a la versión de GLM-5.2 que aloja en sus propios servidores. El problema es que GLM-5.2 es de peso abierto: cualquiera puede descargar los archivos del modelo subyacente. Una vez que alguien ejecuta esos archivos en su propio hardware, los filtros de Z.ai son irrelevantes.
Los modelos cerrados de empresas como OpenAI y Anthropic se basan en clasificadores (software que escanea solicitudes y marca las dañinas), entrenamiento de rechazo (enseñar al modelo a declinar avisos peligrosos) y controles a nivel de API (reglas integradas en la interfaz del servicio). Ninguna de esas herramientas llega a un modelo de peso abierto que se ejecuta en la máquina de otra persona.
Ni siquiera los modelos cerrados son herméticos. Far.ai, una organización sin fines de lucro de seguridad de IA, encontró cientos de "ataques de jailbreak" reutilizables (trucos que engañan a un modelo para que ignore sus reglas de seguridad) en modelos incluidos Grok 4.5 de xAI y Gemini 3.1 Pro de Google DeepMind. Los atacantes combinan escenarios de juego de rol con historiales de conversación falsos para amplificar los puntos débiles en las defensas de un modelo. Nuestra historia anterior sobre la brecha de Hugging Face mostró claramente la asimetría: los defensores que utilizan herramientas de IA comerciales fueron bloqueados por filtros de seguridad; el atacante no.
¿Qué se puede hacer realmente?
Una solución parcial es filtrar datos de entrenamiento antes de que se construya un modelo, eliminando material de ciberseguridad peligroso para que el modelo nunca lo aprenda. Algunas investigaciones sugieren que esto puede reducir el conocimiento biológico peligroso sin afectar el rendimiento general. La ciberseguridad es más difícil: un modelo que codifica bien tiende a ser también un hacker capaz, y la codificación es donde las empresas de IA ganan la mayor parte de su dinero.
Anthropic ha adoptado un enfoque más estrecho con su tarjeta del modelo Opus 5, permitiendo que el modelo encuentre vulnerabilidades en código fuente sin compilar pero no en software compilado, lo que dificulta su uso para ataques directos.
Los modelos de peso abierto también ayudan a los defensores. Hugging Face aparentemente utilizó GLM-5.2 para ayudar a repeler una brecha reciente. El director ejecutivo Clem Delangue escribió esta semana que los mismos sistemas utilizados para detener un ataque potenciado por IA "ahora pueden ayudar a defender contra millones de ciberataques cada día".
Papadatos es escéptico de que ese beneficio justifique el riesgo. "Por defecto, los atacantes adoptan nuevas herramientas más rápido que los defensores", le dijo a TechCrunch. "Un grupo de ransomware puede cambiar sus métodos en una semana. Un hospital no puede".
| Modelo | Desarrollador | ¿Rechazó tareas de CyberGym? | ¿Pesos descargables públicamente? |
|---|---|---|---|
| GLM-5.2 | Z.ai (China) | No | Sí |
| Claude Opus 4.7 | Anthropic | Sí (completamente) | No |
| GPT-5.5 | OpenAI | Parcial | No |
| Grok 4.5 | xAI | Parcial (ataques de jailbreak encontrados) | No |
| Gemini 3.1 Pro | Google DeepMind | Parcial (ataques de jailbreak encontrados) | No |
Preguntas frecuentes
¿Significa esto que es ilegal descargar GLM-5.2?
No. Descargar y ejecutar un modelo de IA de peso abierto es legal en la mayoría de los países. La preocupación no es la descarga en sí, sino lo que alguien podría hacer con un modelo que rechaza ninguna solicitud dañina.
¿Qué deberían tomar las personas ordinarias de esto?
Si utiliza cualquier chatbot de IA o servicio, la seguridad del modelo subyacente varía enormemente. Las herramientas basadas en modelos cerrados y probados de seguridad conllevan menos riesgos que las basadas en modelos sin restricciones descargables gratuitamente.
¿China está regulando algo de esto?
China tiene regulaciones de IA, pero el investigador del Centro de Política Cibernética de Stanford, Graham Webster, le dijo a TechCrunch que históricamente se han enfocado en contenido políticamente sensible y estabilidad social en lugar de riesgos catastróficos como ciberataques o mal uso biológico.



