Ejecuta modelos de IA de imágenes en una GPU normal: Hugging Face trae Diffusion de 4 bits al público
Una nueva integración llamada Nunchaku Lite permite que la IA generadora de imágenes se ejecute en tarjetas gráficas de consumidor con la mitad de la memoria y velocidades 30% más rápidas, sin necesidad de configuración especializada.

Puntos clave
- Nunchaku Lite, lanzado por Hugging Face, reduce la memoria que necesita un modelo de IA generador de imágenes de primera categoría de aproximadamente 24 GB a unos 12 GB en una NVIDIA RTX 5090.
- La técnica utiliza cuantización de 4 bits, un método para comprimir los números almacenados de un modelo para que ocupe menos espacio, mientras también acelera la generación de imágenes alrededor de un 30%.
- Una imagen de 1024×1024 ahora tarda aproximadamente 1.7 segundos en una RTX 5090 usando el modelo comprimido, en comparación con la versión estándar mucho más pesada.
- Los desarrolladores pueden cargar estos modelos comprimidos con una sola línea de código dentro de Diffusers, el kit de herramientas de código abierto popular para generación de imágenes con IA.
- Las tarjetas NVIDIA RTX de las series 30 y 40 son compatibles, aunque el formato de compresión más nuevo requiere el hardware más reciente de la serie RTX 50.
Generar una imagen de IA de alta calidad solía requerir una tarjeta gráfica que la mayoría de las personas no posee. Los mejores modelos de texto a imagen, cuando se cargan a calidad completa, necesitan entre 20 y 30 GB de VRAM, la memoria rápida que reside en una tarjeta gráfica y realiza el trabajo pesado. Una tarjeta de consumidor típica tiene 8 a 16 GB. Esta brecha ha mantenido las herramientas serias de IA de imágenes dentro de centros de datos y fuera de estudios caseros.
Una nueva integración publicada por Hugging Face reduce considerablemente esa brecha.
¿Qué es Nunchaku Lite y qué hace exactamente?
Nunchaku Lite es una forma de cargar modelos de IA generadores de imágenes fuertemente comprimidos directamente dentro de Diffusers, la biblioteca de código abierto ampliamente utilizada para ejecutar IA generadora de imágenes, sin instalar un programa separado o compilar nada desde cero.
La compresión que utiliza se llama SVDQuant, abreviatura de Singular Value Decomposition Quantization. La cuantización, en general, significa reemplazar los números grandes y precisos dentro de un modelo de IA con otros más pequeños y aproximados, de la misma manera que un archivo MP3 aproxima una grabación de estudio a una fracción del tamaño. La mayoría de las herramientas existentes hacen esto solo en los pesos almacenados, el conocimiento aprendido del modelo, y luego los convierten a precisión completa en el momento del cálculo. Esto ahorra memoria pero no acelera las cosas.
SVDQuant va más allá. Ejecuta las capas de cálculo principal del modelo en precisión de 4 bits tanto para los pesos almacenados como para los cálculos en vivo, lo que reduce el uso de memoria y acelera el proceso. La parte complicada es que algunos números dentro de estos modelos son valores extremos atípicos, y comprimirlos a 4 bits destruye la calidad. SVDQuant maneja esos valores problemáticos por separado, manteniendo un pequeño búfer de alta precisión para los casos más difíciles y cuantizando todo lo demás.
Nunchaku Lite trae ese enfoque a Diffusers sin requerir un motor especializado. Un desarrollador carga un punto de control comprimido de la misma manera que carga cualquier otro modelo: una llamada de función, sin compilación local.
¿Quién puede usar esto hoy?
Cualquiera con una tarjeta gráfica NVIDIA compatible puede probarlo. Las tarjetas de las series RTX 30 y 40, que cubren la mayoría del mercado de consumidor de los últimos cuatro años, funcionan con las variantes comprimidas INT4. El formato NVFP4 más nuevo, que reduce aún más la memoria, requiere las tarjetas Blackwell más recientes de NVIDIA: la serie RTX 50, la RTX PRO 6000 o la B200. Las tarjetas más antiguas, incluidas las generaciones Volta y Hopper, aún no son compatibles.
| Formato | Tarjetas compatibles | Memoria máxima (imagen 1024px) | Tiempo de generación |
|---|---|---|---|
| BF16 (estándar) | Solo tarjetas de gama alta | ~24 GB | Línea base |
| INT4 (Nunchaku Lite) | Series RTX 30 y 40, A100, L40S | ~12 GB | ~30% más rápido |
| NVFP4 (Nunchaku Lite) | Series RTX 50, B200 | ~12 GB | ~30% más rápido |
Para usuarios ordinarios, la conclusión práctica es clara: los modelos que anteriormente se negaban a cargar en una PC gaming de rango medio ahora pueden ejecutarse sin problemas. Los desarrolladores que construyen herramientas de imágenes para audiencias más amplias obtienen un camino directo para soportar más hardware.
¿Qué significa esto para la calidad de la imagen?
La compresión siempre implica una compensación. Nunchaku Lite es aproximadamente 30% más rápido que un modelo de precisión completa estándar, pero no coincide con la velocidad del motor Nunchaku original, que utiliza atajos específicos de arquitectura que Nunchaku Lite evita deliberadamente para mantenerse flexible. La calidad de imagen en modelos comprimidos es generalmente muy cercana a la original, aunque pueden aparecer diferencias sutiles en detalles finos. Los propios puntos de referencia del documento SVDQuant sugieren que la brecha es lo suficientemente pequeña para la mayoría de los usos prácticos.
Preguntas frecuentes
¿Necesito ser desarrollador para beneficiarme de esto?
Por ahora, sí. Nunchaku Lite funciona a través de Diffusers, una biblioteca de codificación Python, por lo que cargar estos modelos requiere escribir una pequeña cantidad de código. Las aplicaciones de consumidor construidas sobre Diffusers pueden agregar soporte automáticamente con el tiempo.
¿Funcionará esto en una Mac o en tarjetas gráficas AMD?
Actualmente no. Nunchaku Lite se basa en kernels CUDA específicos de NVIDIA, el código de bajo nivel que le dice a los chips NVIDIA cómo hacer estos cálculos rápidamente. AMD y Apple Silicon no son compatibles en esta etapa.
¿Pueden los desarrolladores comprimir sus propios modelos personalizados?
Sí. Hugging Face también lanzó un kit de herramientas complementario llamado diffuse-compressor que permite a los desarrolladores cuantizar nuevas arquitecturas de modelo ellos mismos y publicar los resultados como repositorios estándar de Diffusers.



