El mayor modelo de Mistral lidera la IA de pesos abiertos en ciberseguridad y programación

Mistral Large 4 llega con un billón de parámetros, una ventaja clara en ciberseguridad y pesos completos prometidos antes de fin de mes.

AI2Day NewsdeskAsistido por IAPublicado Editor: Lee Brown5 min read
Illustration for the story: Mistral's Biggest Model Yet Leads Open-Weight AI on Cybersecurity and Coding
Ilustración creada con IA. No es una fotografía de los hechos descritos.
Share

Puntos clave

  • Mistral Large 4, apodado "le Chonk", obtuvo un 82% en un benchmark que pide a una IA encontrar y parchear una falla de software real, la puntuación más alta de cualquier modelo probado.
  • El modelo ejecuta 1 billón de parámetros totales pero activa solo 49 mil millones a la vez, manteniendo respuestas más rápidas de lo que sugiere la cifra nominal.
  • Claude Opus 5.5 y GPT-6 Astra obtienen puntuaciones cercanas a cero en esa misma prueba de seguridad porque sus filtros de seguridad se niegan a realizarla.
  • Mistral entrenó el modelo en 3.800 GPUs NVIDIA Grace Blackwell en sus propios centros de datos europeos, cubriendo más de 160 idiomas.
  • Los pesos completos del modelo serán lanzados antes de fin de mes, permitiendo a las organizaciones ejecutar la IA en sus propios servidores.

Mistral Large 4 ya está disponible a través de una API de vista previa, y se encuentra claramente adelante de cualquier otro modelo de pesos abiertos construido fuera de China en las tareas que más les importan a los equipos de seguridad. Esto es lo que realmente significa.

¿Qué es este modelo y por qué importa el tamaño?

Mistral Large 4 (ML4) es un modelo de lenguaje grande, la misma categoría de IA que impulsa chatbots como ChatGPT y Claude. Con un billón de parámetros (las configuraciones numéricas que rigen cómo piensa un modelo), es el más grande que Mistral ha enviado jamás. Una peculiaridad de su diseño significa que solo 49 mil millones de esos parámetros se activan para cualquier consulta dada. Este enfoque de mezcla de expertos, dirigiendo cada pregunta a una porción relevante del modelo en lugar de involucrar todo simultáneamente, mantiene los costos manejables sin sacrificar la velocidad.

El modelo maneja texto, código, imágenes y documentos en un único sistema, sin herramientas separadas requeridas.

¿Por qué la puntuación de ciberseguridad es tan importante?

ML4 lidera todos los modelos de pesos abiertos construidos fuera de China en el Índice Cibernético de Análisis Artificial, una clasificación independiente del desempeño de la IA en trabajo de seguridad real. Una subprueba pide a un modelo reproducir una vulnerabilidad real en software de código abierto y luego parchearlo. ML4 obtiene un 82% allí, la cifra más alta registrada para cualquier modelo. También completa el 93% de los desafíos en Cybench, 40 ejercicios extraídos de competiciones de seguridad reales.

El contraste con los modelos cerrados más capaces es llamativo. Varios de ellos obtienen puntuaciones cercanas a cero en esa misma subprueba, no porque carezcan de capacidad subyacente sino porque sus filtros de seguridad se niegan a involucrarse. La posición de Mistral es que los defensores deben probar que una falla es real antes de poder repararla, y un modelo que rechaza ese paso no es muy útil para un equipo de seguridad. Es un argumento razonable, aunque traslada la responsabilidad del despliegue seguro a quien descargue los pesos.

Cubrimos por primera vez el tema de IA y ciberseguridad el 21 de julio de 2026, y un patrón se ha repetido desde entonces: las puntuaciones de benchmark prometen más que las condiciones del mundo real. Las pruebas previas al lanzamiento de ML4 con socios de seguridad controlados y agencias gubernamentales es una señal mejor que los números solos.

¿Cómo se compara en programación y tareas generales?

Benchmark Puntuación ML4 Siguiente mejor pesos abiertos
DeepSWE v1.1 (ingeniería de software) 61,7% DeepSeek V4 Pro 0813
AutomationBench (flujos de trabajo empresariales) 59,9% Kimi K3
Cybench (desafíos de seguridad) 93% no divulgado
Prueba de parche de vulnerabilidad 82% no divulgado
Calidad de código humana (escala 1-5) 3,74 Claude Opus 5 en 4,22

En una evaluación a ciegas por Surge AI, programadores profesionales clasificaron ML4 segundo de cinco modelos probados, detrás de Claude Opus 5 (4,22 versus 3,74). Esa brecha vale la pena observar; significa que ML4 es competitivo pero aún no es la opción principal para pura calidad de programación.

En AutomationBench, que cubre 657 flujos de trabajo empresariales en herramientas incluyendo Gmail y Salesforce, ML4 obtuvo un 59,9%. Nuestro artículo del 2 de octubre sobre agentes de IA y trabajo real de oficina encontró que incluso los agentes más fuertes aún fallan en la mayoría de tareas realistas, así que 59,9% es progreso, no una meta.

También vale la pena notar lo que nuestro artículo del 17 de septiembre sobre precios de modelos frontera estableció: la brecha entre modelos cerrados costosos y las mejores alternativas de pesos abiertos ha estado reduciéndose rápidamente. ML4 es la evidencia más directa hasta ahora de esa tendencia cerrándose en trabajo específico de seguridad.

¿Qué significa esto para personas y organizaciones que usan IA hoy?

Para la mayoría de usuarios, la opción inmediata es una API de vista previa a través de Mistral Studio. Los pesos completos llegan antes de fin de mes, después de lo cual cualquier organización puede descargar y ejecutar el modelo en su propia infraestructura, sin dependencia continua de los servidores de Mistral.

Esa opción de auto-hospedaje importa más para equipos de seguridad, organizaciones de salud y organismos gubernamentales que no pueden enviar datos sensibles a una nube de terceros. Las organizaciones europeas obtienen una garantía adicional: Mistral opera el despliegue de extremo a extremo bajo la ley europea, independientemente de otros proveedores de servicios digitales.

Las capacidades de ciberseguridad merecen cuidado. Mistral está realizando pruebas previas al lanzamiento con socios precisamente porque un modelo tan capaz de encontrar fallos de software podría ser mal utilizado. Lanzar los pesos completos de todas formas es una opción deliberada, y coloca responsabilidad real en las organizaciones que lo despliegan.

Preguntas frecuentes

¿Puedo probar Mistral Large 4 ahora mismo?

Sí. Una API de vista previa está activa en Mistral Studio. Los pesos completos del modelo, necesarios para ejecutarlo en tus propios servidores, siguen antes de fin de mes.

¿Qué significa realmente "pesos abiertos" para un usuario regular?

Mistral publica el archivo de configuración interna del modelo, de la manera que se publica una receta en lugar de mantenerse en secreto. Cualquier organización puede descargarlo y ejecutar la IA en su propio hardware, sin honorarios continuos o dependencia de los servidores de Mistral.

¿Es seguro usar este modelo?

Mistral está realizando pruebas de seguridad con socios gubernamentales e industriales antes de lanzar los pesos completos. El modelo es deliberadamente menos restringido que las alternativas cerradas en tareas de seguridad, lo cual es útil para defensores pero requiere políticas de despliegue cuidadosas del lado del usuario.

© 2026 AI2Day