Exécuter des modèles d'IA d'images sur un GPU ordinaire : Hugging Face apporte la diffusion 4-bit aux masses

Une nouvelle intégration appelée Nunchaku Lite permet aux IA générant des images de fonctionner sur des cartes graphiques grand public avec la moitié de la mémoire et 30 % de vitesses plus rapides, sans configuration spécialisée requise.

AI2Day Newsdesk4 min read
IT team overwhelmed by multiple screens and tools
Share

Points clés

  • Nunchaku Lite, publié par Hugging Face, réduit la mémoire requise par un modèle d'IA d'images haut de gamme d'environ 24 GB à environ 12 GB sur une NVIDIA RTX 5090.
  • La technique utilise la quantification 4-bit, une méthode de compression des nombres stockés d'un modèle pour qu'il occupe moins d'espace, tout en accélérant la génération d'images d'environ 30 %.
  • Une image 1024×1024 prend maintenant environ 1,7 secondes sur une RTX 5090 avec le modèle compressé, par rapport à la version standard beaucoup plus lourde.
  • Les développeurs peuvent charger ces modèles compressés avec une seule ligne de code dans Diffusers, la boîte à outils open-source populaire pour la génération d'images par IA.
  • Les cartes NVIDIA RTX 30 et 40 sont prises en charge, bien que le dernier format de compression nécessite le matériel RTX 50 le plus récent.

Générer une image d'IA de haute qualité nécessitait autrefois une carte graphique que la plupart des gens ne possèdent pas. Les meilleurs modèles de texte-image, lorsqu'ils sont chargés à pleine qualité, nécessitent entre 20 et 30 GB de VRAM, la mémoire rapide qui réside sur une carte graphique et effectue le gros du travail. Une carte de consommateur typique dispose de 8 à 16 GB. Cet écart a maintenu les outils d'IA d'images sérieux dans les centres de données et hors des studios à domicile.

Une nouvelle intégration publiée par Hugging Face réduit considérablement cet écart.

Qu'est-ce que Nunchaku Lite et qu'est-ce qu'il fait réellement ?

Nunchaku Lite est un moyen de charger des modèles d'IA d'images fortement compressés directement dans Diffusers, la bibliothèque open-source largement utilisée pour exécuter l'IA générant des images, sans installer un programme séparé ou compiler quoi que ce soit à partir de zéro.

La compression utilisée s'appelle SVDQuant, abréviation de Singular Value Decomposition Quantization. La quantification, largement, signifie remplacer les grands nombres précis à l'intérieur d'un modèle d'IA par des nombres plus petits et plus approximatifs, de la même manière qu'un fichier MP3 approxime un enregistrement de studio à une fraction de la taille. La plupart des outils existants font cela uniquement sur les poids stockés, les connaissances apprises du modèle, puis les reconvertissent en pleine précision au moment du calcul. Cela économise de la mémoire mais n'accélère pas les choses.

SVDQuant va plus loin. Il exécute les couches de calcul principales du modèle avec une précision de 4 bits pour à la fois les poids stockés et les calculs en direct, ce qui réduit l'utilisation de la mémoire et accélère le processus. La partie délicate est que certains nombres à l'intérieur de ces modèles sont des valeurs aberrantes extrêmes, et les compresser à 4 bits détruit la qualité. SVDQuant traite ces valeurs problématiques séparément, en conservant un petit tampon de haute précision pour les cas les plus difficiles et en quantifiant tout le reste.

Nunchaku Lite apporte cette approche dans Diffusers sans nécessiter un moteur spécialisé. Un développeur charge un point de contrôle compressé de la même manière qu'il charge n'importe quel autre modèle : un appel de fonction, pas de compilation locale.

Qui peut utiliser ceci aujourd'hui ?

Quiconque possède une carte graphique NVIDIA compatible peut l'essayer. Les cartes RTX 30 et 40, qui couvrent la majorité du marché grand public des quatre dernières années, fonctionnent avec les variantes compressées INT4. Le dernier format NVFP4, qui compresse encore plus la mémoire, nécessite les dernières cartes Blackwell d'NVIDIA : la série RTX 50, la RTX PRO 6000, ou la B200. Les cartes plus anciennes, y compris les générations Volta et Hopper, ne sont pas encore prises en charge.

Format Cartes prises en charge Mémoire maximale (image 1024px) Temps de génération
BF16 (standard) Cartes haut de gamme uniquement ~24 GB Référence
INT4 (Nunchaku Lite) Série RTX 30 & 40, A100, L40S ~12 GB ~30 % plus rapide
NVFP4 (Nunchaku Lite) Série RTX 50, B200 ~12 GB ~30 % plus rapide

Pour les utilisateurs ordinaires, l'implication pratique est claire : les modèles qui refusaient auparavant de se charger sur un PC de jeu de milieu de gamme peuvent maintenant fonctionner sans problème. Les développeurs créant des outils d'images pour des audiences plus larges disposent d'un chemin direct pour prendre en charge plus de matériel.

Qu'est-ce que cela signifie pour la qualité de l'image ?

La compression implique toujours un compromis. Nunchaku Lite est environ 30 % plus rapide qu'un modèle standard en pleine précision, mais ne correspond pas à la vitesse du moteur Nunchaku original, qui utilise des raccourcis spécifiques à l'architecture que Nunchaku Lite évite délibérément pour rester flexible. La qualité des images dans les modèles compressés est généralement très proche de l'original, bien que des différences subtiles puissent apparaître sur les détails fins. Les benchmarks propres du document SVDQuant suggèrent que l'écart est suffisamment petit pour la plupart des usages pratiques.

Questions courantes

Dois-je être un développeur pour en bénéficier ?

Pour l'instant, oui. Nunchaku Lite fonctionne via Diffusers, une bibliothèque de codage Python, le chargement de ces modèles nécessite donc d'écrire une petite quantité de code. Les applications grand public construites sur Diffusers peuvent ajouter le support automatiquement au fil du temps.

Cela fonctionnera-t-il sur un Mac ou sur des cartes graphiques AMD ?

Pas actuellement. Nunchaku Lite s'appuie sur les noyaux CUDA spécifiques à NVIDIA, le code de bas niveau qui indique aux puces NVIDIA comment effectuer ces calculs rapidement. AMD et Apple Silicon ne sont pas pris en charge à ce stade.

Les développeurs peuvent-ils compresser leurs propres modèles personnalisés ?

Oui. Hugging Face a également publié une boîte à outils complémentaire appelée diffuse-compressor qui permet aux développeurs de quantifier de nouvelles architectures de modèles eux-mêmes et de publier les résultats en tant que dépôts Diffusers standard.

© 2026 AI2Day