Investigadores de Apple Descubrieron una Forma Más Inteligente de Acelerar la Generación de Video con IA

Una nueva técnica de Apple ML Research reduce el tiempo que tarda la IA en convertir descripciones de texto en video, al enseñar al modelo a omitir cálculos que no necesita.

AI2Day Newsdesk· 3 min read
A glowing abstract grid of interconnected light nodes against a deep blue-black background, most connections fading to darkness while a selective few pulse brig
Share

Puntos clave

  • Apple ML Research publicó un artículo que describe un método llamado atención dispersa calibrada que acelera la generación de video a partir de texto con IA.
  • Los investigadores descubrieron que una gran parte de los cálculos internos en los modelos de video actuales producen resultados cercanos a cero y pueden omitirse sin problema.
  • Los patrones de omisión se repiten de manera confiable en diferentes solicitudes de video, por lo que el sistema puede aprenderlos de antemano en lugar de redescubrirlos cada vez.
  • Eliminar esos cálculos redundantes reduce el tiempo de procesamiento sin cambiar visiblemente la calidad del video de salida.

Generar un video corto a partir de una descripción de texto parece simple. Escribe "un gato caminando entre hojas de otoño" y el modelo construye cada fotograma, píxel a píxel. En la práctica tarda mucho tiempo, porque la IA tiene que manejar cantidades enormes de información sobre cómo cada parte de cada fotograma se relaciona con todas las demás.

El nombre técnico para ese acto de malabarismo es atención espacio-temporal, lo que simplemente significa que el modelo verifica cómo cada pequeño parche del video se conecta con todos los demás parches, tanto en el espacio como en el tiempo. Esas verificaciones son costosas. Los modelos de video modernos las ejecutan miles de millones de veces por generación.

Los investigadores de Apple ML Research identificaron algo útil enterrado en esos cálculos. Una fracción significativa de las conexiones entre parches obtienen puntuaciones tan cercanas a cero que cambian la imagen final esencialmente en nada. Omitirlas no debería importar.

Mejor aún, esas conexiones con puntuaciones bajas tienden a aparecer en los mismos lugares, sin importar lo que escriba el usuario. Los patrones son consistentes y repetibles.

Esa consistencia es el conocimiento clave. Porque las conexiones que vale la pena omitir se repiten en diferentes descripciones de texto, el sistema puede calibrarse de antemano: ejecuta el modelo en un pequeño conjunto de referencia de videos, mapea qué conexiones constantemente obtienen puntuaciones cercanas a cero, e incorpora ese mapa. A partir de ese momento, el modelo sabe de antemano qué cálculos omitir, sin necesidad de verificar cada vez.

La técnica funciona en dos niveles. Se omiten los parches individuales con conexiones cercanas a cero. También se omiten pequeños grupos locales de parches, llamados bloques de token, cuando las conexiones de todo el grupo son negligibles en conjunto.

¿Se verán peor los videos?

No, al menos no de ninguna manera visible para el espectador. Como los cálculos omitidos ya estaban contribuyendo casi nada a la imagen final, eliminarlos no cambia lo que aparece en pantalla. Los investigadores describen el efecto en la calidad de salida como negligible.

Para la gente común esto importa porque afecta la velocidad con que las herramientas de video con IA pueden responder a una solicitud. Una generación más rápida significa costos de computación más bajos para las empresas que ejecutan estos modelos, y potencialmente resultados más rápidos para los usuarios de herramientas de video de consumidor construidas sobre ellos. También podría hacer que sea más práctico ejecutar modelos de video capaces en hardware menos potente.

El enfoque no requiere reentregar el modelo subyacente desde cero, lo que facilita que los desarrolladores lo integren en sistemas existentes. Esta es una ventaja práctica sobre muchos métodos de aceleración, que demandan reconstrucciones costosas.

Apple no ha anunciado un producto basado en esta investigación, pero la técnica apunta hacia herramientas de video con IA que sean más económicas de ejecutar y más rápidas en responder.

© 2026 AI2Day