Une nouvelle technique réduit considérablement le coût de la réduction des grands modèles d'IA

Des chercheurs ont découvert un moyen d'entraîner des modèles d'IA plus petits et moins chers à partir de modèles géants en utilisant une fraction de la mémoire auparavant nécessaire, ouvrant la porte à des expériences qui exigeaient autrefois un entrepôt de matériel informatique.

AI2Day Newsdesk5 min read
Full-frame edge-to-edge photoreal overhead view of a modern security operations center at night, rows of empty analyst desks lit by the cool blue glow of multip
Share

Points clés

  • La distillation des connaissances, qui consiste à copier le comportement d'un grand modèle d'IA dans un modèle plus petit, demande généralement des centaines de puces spécialisées et une coordination minutieuse.
  • Un nouvel article met en cache les résultats du grand modèle une seule fois au préalable, ce qui élimine le besoin de le réexécuter pendant l'entraînement, réduisant considérablement l'utilisation de la mémoire.
  • Une deuxième technique, appelée perte KL chunked fusionnée, traite les données d'entraînement par petites tranches au lieu de les traiter toutes à la fois, maintenant l'utilisation maximale de la mémoire quasi stable même pour des entrées très longues.
  • Avec 32 000 tokens de contexte, l'utilisation maximale de la mémoire passe de 85,2 gigaoctets à 5,45 gigaoctets, une réduction de 15,6 fois.
  • Le code complet de la fonction de perte économe en mémoire est publiquement disponible sur GitHub.

Les plus grands modèles d'IA au monde sont presque impossiblement volumineux. Kimi-K3, lancé plus tôt cette année, compte 2,8 billions de paramètres (pensez aux paramètres comme les millions de petits cadrans à l'intérieur d'un modèle qui sont ajustés lors de l'entraînement) et nécessite environ trois téraoctets de mémoire spécialisée juste pour se charger. C'est plus que l'espace d'une vingtaine de cartes graphiques grand public haut de gamme.

Parce que l'exécution de modèles de cette taille est si coûteuse, les chercheurs les compriment régulièrement en versions plus petites qui coûtent moins cher à faire fonctionner. La méthode standard s'appelle la distillation des connaissances : vous exécutez le grand modèle « enseignant » sur un pile de texte, enregistrez comment il répondrait, puis entraînez un modèle « étudiant » plus petit pour copier ces réponses aussi fidèlement que possible. L'étudiant finit par coûter beaucoup moins cher à exécuter tout en conservant la plupart de la qualité de l'enseignant.

Pourquoi est-ce si difficile à faire à bas coût ?

La dépense provient de deux endroits. Premièrement, l'approche standard maintient l'enseignant et l'étudiant chargés en mémoire au même moment. Deuxièmement, la comparaison de leurs résultats nécessite de construire une grille énorme : une ligne pour chaque mot du vocabulaire du modèle (souvent plus de 100 000 mots), une colonne pour chaque position de l'entrée. Multipliez ces chiffres sur un long texte et vous remplissez rapidement chaque puce dont vous disposez.

Comme exemple concret : un modèle ouvert populaire, gpt-oss-120b, a un vocabulaire de 201 088 mots. Avec une longueur de séquence de 32 000 tokens (à peu près le texte d'un court roman) et une taille de lot modeste de quatre exemples à la fois, le tenseur de résultat de l'enseignant seul occupe environ 50 gigaoctets. Ajoutez le modèle étudiant, les gradients et tout ce que le processus d'entraînement nécessite, et une seule étape d'entraînement peut monter en pics à environ 250 gigaoctets, plus que ce que peut contenir un H200, l'une des puces d'IA les plus puissantes disponibles aujourd'hui.

Qu'ont changé les chercheurs ?

Deux choses, travaillant ensemble. Les deux sont décrites dans un article publié par l'équipe de CompactifAI, d'abord partagé sur Hugging Face.

Le premier changement est la distillation hors ligne. Au lieu de réexécuter l'enseignant à chaque étape d'entraînement, les chercheurs l'exécutent une seule fois et ne sauvegardent que ses 100 prédictions de mots les plus probables par position. Ce cache est écrit sur le disque. L'enseignant est ensuite complètement désactivé, et l'étudiant s'entraîne uniquement contre le cache sauvegardé. Parce que le cache peut être réutilisé dans plusieurs expériences différentes, l'exécution coûteuse de l'enseignant devient un coût unique.

Le deuxième changement est la perte KL chunked fusionnée. La divergence KL est une mesure mathématique de la différence entre deux distributions de probabilité ; ici, le degré de différence entre les prédictions de mots de l'étudiant et celles de l'enseignant. La façon standard de la calculer consiste à construire cette grille complète vocabulaire-fois-séquence d'un seul coup et à la conserver entièrement en mémoire. La nouvelle méthode divise la séquence en petits chunks, calcule et supprime chaque chunk avant de passer au suivant, et recalcule ce dont elle a besoin lors de la passe arrière plutôt que de le stocker.

Méthode Utilisation maximale de la mémoire (contexte de 8 K) Temps d'itération
Distillation en ligne 102,8 GB 25,9 s
Hors ligne, KL dense 78,3 GB 18,5 s
Hors ligne, KL chunked avant 61,8 GB 18,4 s
Hors ligne, KL chunked fusionné 58,3 GB 20,2 s

Les quatre méthodes produisent des résultats d'entraînement quasi identiques, ce qui signifie que la perte de qualité due à l'utilisation des prédictions top-100 en cache au lieu de la distribution complète de l'enseignant est négligeable.

Cela a-t-il une importance pour les documents plus longs ?

Oui, et l'écart s'accroît rapidement. L'avantage en mémoire de l'approche chunked fusionnée est modeste à 8 000 tokens mais dramatique pour des longueurs plus grandes. À 32 000 tokens, l'utilisation maximale de la mémoire passe de 85,2 gigaoctets avec l'approche standard à 5,45 gigaoctets avec la nouvelle. La perte dense échoue complètement à 64 000 tokens. À 256 000 tokens, la méthode chunked fusionnée utilise 11,6 gigaoctets contre 134,2 gigaoctets pour la meilleure alternative suivante.

En d'autres termes : les expériences qui exigeaient auparavant un rack de centaines de puces peuvent maintenant s'exécuter sur une seule carte haut de gamme. Cela rend réaliste pour les petites équipes de recherche et les entreprises de créer des modèles comprimés à partir des plus grands systèmes d'IA open-source disponibles aujourd'hui.

Questions courantes

Le modèle plus petit finit-il par être pire que l'original ?

Dans les benchmarks rapportés, la perte d'entraînement du modèle étudiant était quasi identique dans les quatre méthodes, y compris la nouvelle approche économique. La qualité s'est maintenue malgré l'utilisation de seulement 100 prédictions de mots les plus probables par position au lieu de la sortie complète de l'enseignant.

Quelqu'un peut-il utiliser cette technique ?

Le code de perte chunked est open source et affiché publiquement sur GitHub par CompactifAI. Quiconque possédant une seule puce d'IA moderne et une copie d'un grand modèle open-source peut, en principe, exécuter ses propres expériences de distillation avec elle.

Qui en bénéficie en premier ?

Les petites équipes de recherche en IA et les entreprises qui souhaitent compresser de grands modèles open-source pour un déploiement moins coûteux ressentiront la différence le plus rapidement. Les utilisateurs finaux pourraient bénéficier ultérieurement à mesure que des modèles comprimés plus abordables atteindront les produits et services.

© 2026 AI2Day