Des chercheurs d'Apple ont trouvé un moyen plus intelligent d'accélérer la génération vidéo par IA
Une nouvelle technique de Apple ML Research réduit le temps nécessaire à l'IA pour convertir des descriptions textuelles en vidéo, en apprenant au modèle à ignorer les calculs inutiles.

Points clés
- Apple ML Research a publié un article décrivant une méthode appelée attention clairsemée calibrée qui accélère la génération vidéo texte-vers-vidéo basée sur l'IA.
- Les chercheurs ont découvert qu'une grande partie des calculs internes des modèles vidéo actuels produisent des résultats proches de zéro et peuvent être ignorés sans danger.
- Les motifs d'omission se répètent de manière fiable selon les différentes demandes vidéo, ce qui permet au système de les apprendre à l'avance plutôt que de les redécouvrir à chaque fois.
- L'élimination de ces calculs redondants réduit le temps de traitement sans modifier visiblement la qualité de la vidéo générée.
Générer une courte vidéo à partir d'une description texte semble simple. Tapez « un chat marchant dans les feuilles d'automne » et le modèle construit chaque image, pixel par pixel. En pratique, cela prend longtemps, car l'IA doit gérer une quantité énorme d'informations sur la façon dont chaque partie de chaque image se rapporte à toutes les autres parties.
Le nom technique de cet acte d'équilibriste est l'attention spatiotemporelle, ce qui signifie simplement que le modèle vérifie comment chaque petit patch de la vidéo se connecte à tous les autres patches, dans l'espace et le temps. Ces vérifications coûtent cher. Les modèles vidéo modernes les exécutent des milliards de fois par génération.
Des chercheurs de Apple ML Research ont repéré quelque chose d'utile caché dans ces calculs. Une fraction importante des connexions entre patches obtient un score si proche de zéro qu'elles changent l'image finale essentiellement pas du tout. Les ignorer ne devrait pas avoir d'importance.
Mieux encore, ces connexions à faible score apparaissent généralement aux mêmes endroits, peu importe ce que l'utilisateur tape. Les motifs sont cohérents et reproductibles.
Cette cohérence est l'élément clé. Parce que les connexions à ignorer se répètent selon les différentes demandes, le système peut être calibré à l'avance : exécutez le modèle sur un petit ensemble de référence de vidéos, cartographiez les connexions qui obtiennent systématiquement un score proche de zéro, puis intégrez cette carte. À partir de ce moment, le modèle sait à l'avance quels calculs ignorer, sans avoir besoin de vérifier à chaque fois.
La technique fonctionne à deux niveaux. Les patches individuels avec connexions proches de zéro sont ignorés. Il en va de même pour les petits groupes locaux de patches, appelés blocs de tokens, lorsque les connexions du groupe entier sont négligeables.
Les vidéos seront-elles de moins bonne qualité ?
Non, du moins pas d'une manière visible pour le spectateur. Parce que les calculs ignorés ne contribuaient déjà presque rien à l'image finale, leur suppression ne change pas ce qui apparaît à l'écran. Les chercheurs décrivent l'effet sur la qualité du résultat comme négligeable.
Pour les gens ordinaires, cela importe car cela affecte la rapidité avec laquelle les outils vidéo IA peuvent répondre à une demande. Une génération plus rapide signifie des coûts informatiques plus bas pour les entreprises exécutant ces modèles, et potentiellement des résultats plus rapides pour les utilisateurs des outils vidéo grand public construits sur ces modèles. Cela pourrait aussi rendre plus pratique d'exécuter des modèles vidéo puissants sur du matériel moins performant.
Cette approche ne nécessite pas de réentraînement du modèle sous-jacent à partir de zéro, ce qui facilite son intégration dans les systèmes existants. C'est un avantage pratique par rapport à de nombreuses méthodes d'accélération, qui exigent des reconstructions coûteuses.
Apple n'a pas annoncé de produit basé sur cette recherche, mais la technique annonce des outils vidéo IA qui seraient moins coûteux à exploiter et plus rapides à répondre.



