El Allen Institute Acaba de Publicar un Sistema de Entrenamiento para Modelos de IA con Billones de Parámetros

Olmo-core 3 permite que laboratorios académicos y equipos más pequeños construyan enormes modelos de IA sin la factura de cálculo habitualmente astronómica. Aquí está qué cambió y por qué importa.

AI2Day NewsdeskEditor: Lee Brown3 min read
Rows of glowing server racks inside a large modern data centre, cool blue and white lighting, cables running neatly between units, shot from a low angle looking
Share

Puntos clave

  • Olmo-core 3, lanzado por el Allen Institute for AI, ha evaluado comparativamente un modelo de IA con 1,2 billones de parámetros ejecutándose en 512 chips especializados, alcanzando 858 billones de operaciones de punto flotante por segundo por chip.
  • Un método de entrenamiento rediseñado entregó 2,7 veces más rendimiento en ocho GPU Nvidia B300 comparado con el sistema anterior, en pruebas preliminares.
  • Un formato de números de menor precisión llamado MXFP8 redujo el uso máximo de memoria de 103 gigabytes a 95 gigabytes e incrementó la velocidad de entrenamiento aproximadamente un 21 por ciento en pruebas controladas.
  • El marco es completamente de código abierto, publicado a través de Hugging Face; universidades y laboratorios más pequeños pueden construir sobre él sin pagar por herramientas propietarias.
  • El Allen Institute dice que la siguiente generación de su modelo de IA Olmo será construida sobre este stack y llevará su conjunto de datos de entrenamiento más grande hasta ahora.

La mayoría de la infraestructura de entrenamiento de IA permanece detrás de puertas cerradas en los grandes laboratorios. El Allen Institute for AI acaba de abrir una.

Olmo-core 3 llegó esta semana: un marco técnico para entrenar la familia de modelos de lenguaje grande Olmo, la tecnología detrás de chatbots como ChatGPT y Claude. Está construido específicamente para una clase de IA llamada modelos de mezcla de expertos, o MoEs.

¿Qué es un modelo de mezcla de expertos y por qué importa?

Un modelo MoE es una forma más inteligente de empacar más capacidad en una IA sin aumentar la factura de electricidad cada vez que procesa una oración.

Los modelos de IA "densos" ordinarios activan cada componente para cada palabra que procesan. Un MoE contiene subredes especializadas llamadas expertos y enruta cada palabra a solo un pequeño puñado de ellos. El modelo completo es enorme; la porción activa se mantiene manejable.

La coordinación es la parte difícil. Distribuir expertos en muchas GPU, los chips especializados que hacen el cálculo pesado de la IA, crea costos de comunicación que pueden erosionar las ganancias de eficiencia. Olmo-core 3 está construido para abordar eso a escala seria.

En un benchmark, el equipo expandió el conjunto de expertos de 8 a 128 especialistas. Cada token, un pequeño fragmento de texto aproximadamente del tamaño de una sílaba, aún solo consultó cuatro de ellos. La capacidad del modelo total creció de 4,6 mil millones a 47 mil millones de parámetros (los valores aprendidos que dan a una IA sus habilidades) mientras que el rendimiento del entrenamiento cayó menos del 5 por ciento. La misma infraestructura ha sido probada en más de un billón de parámetros totales.

¿Qué significa esto para los investigadores con presupuesto ajustado?

Un equipo universitario o un laboratorio pequeño ahora puede alcanzar escalas de entrenamiento que estaban esencialmente cerradas en Google o Meta hace un año.

Cubrimos primero el Allen Institute for AI el 28 de julio de 2026, y cuatro historias después el patrón es consistente: el instituto sigue lanzando herramientas abiertas mientras sus pares mantienen las suyas propietarias. Nuestra historia del 1 de septiembre sobre la herramienta de auditoría de benchmarks de Allen AI mostró el mismo instinto en acción.

El nuevo sistema abandona un método llamado paralelismo de datos completamente fragmentado, que recopila y reorganiza pesos del modelo repetidamente en chips, a favor de uno que mantiene expertos sentados en sus GPU asignadas y enruta datos a ellos. Combinado con MXFP8, un formato de números de menor precisión que encaja más cálculo en menos memoria, ahí es de donde provienen la mayoría de las ganancias de velocidad.

Ejemplo práctico: un investigador escribiendo una propuesta de beca podría ejecutar un MoE de 47 mil millones de parámetros en un clúster de GPU universitario sin necesitar una cuenta de nube corporativa.

Nota de privacidad: Olmo-core 3 es un marco de entrenamiento, no una aplicación para consumidores. Tus datos de entrenamiento permanecen en tu propio hardware; nada se envía al Allen Institute.

Precio: Gratuito y de código abierto. Aún pagas por las GPU.

El Allen Institute dice que el siguiente modelo Olmo, entrenado en su conjunto de datos más grande hasta ahora, será el primero en ejecutarse en este stack. Eso es lo que vale la pena observar: si el entrenamiento MoE de código abierto madura aquí antes de que los laboratorios propietarios decidan preocuparse, la brecha entre la IA bien financiada y todos los demás se vuelve un poco menos cómoda para el lado bien financiado.

© 2026 AI2Day