Ejecuta modelos de IA para imágenes en una GPU normal: Hugging Face trae Diffusion de 4 bits a las masas
Una nueva integración llamada Nunchaku Lite permite que la IA generadora de imágenes se ejecute en tarjetas gráficas de consumidor con la mitad de la memoria y velocidades aproximadamente 30% más rápidas, sin necesidad de configuración especializada.

Puntos clave
- Nunchaku Lite, lanzado por Hugging Face, reduce la memoria que necesita un modelo de IA generador de imágenes de primer nivel de aproximadamente 24 GB a unos 12 GB en una NVIDIA RTX 5090.
- La técnica utiliza cuantización de 4 bits, un método para comprimir los números almacenados de un modelo de modo que ocupe menos espacio, mientras también acelera la generación de imágenes alrededor de un 30%.
- Una imagen de 1024×1024 ahora tarda aproximadamente 1.7 segundos en una RTX 5090 utilizando el modelo comprimido.
- Los desarrolladores pueden cargar estos modelos comprimidos con una sola línea de código dentro de Diffusers, el kit de herramientas de código abierto popular para generación de imágenes de IA.
- Se admiten tarjetas NVIDIA RTX 30 y 40 series, aunque el formato de compresión más nuevo requiere hardware RTX 50 series.
Generar una imagen de IA de alta calidad solía exigir una tarjeta gráfica que la mayoría de las personas no poseen. Los mejores modelos de texto a imagen, cargados con precisión completa, necesitan entre 20 GB y 30 GB de VRAM, la memoria rápida que reside en una tarjeta gráfica y realiza el trabajo pesado. Una tarjeta de consumidor típica tiene entre 8 y 16 GB. Esta brecha ha mantenido las herramientas serias de IA de imágenes dentro de centros de datos y fuera de estudios caseros.
Una nueva integración publicada por Hugging Face reduce considerablemente esa brecha. Cuando cubrimos la colaboración anterior de Hugging Face con NVIDIA el 17 de julio, el enfoque era hacer que los modelos grandes fueran entrenables en más hardware; esta vez se trata de hacerlos ejecutables en absoluto.
¿Qué es Nunchaku Lite y qué hace exactamente?
Nunchaku Lite es una forma de cargar modelos de IA generadores de imágenes altamente comprimidos directamente dentro de Diffusers sin instalar un programa separado o compilar nada desde cero.
El método de compresión se llama SVDQuant, abreviatura de Singular Value Decomposition Quantization. Cuantización significa reemplazar los números grandes y precisos dentro de un modelo de IA con números más pequeños y aproximados, de la manera que un archivo MP3 aproxima una grabación de estudio en una fracción del tamaño. La mayoría de las herramientas existentes hacen esto solo a los pesos almacenados, el conocimiento aprendido del modelo, y luego los convierten nuevamente a precisión completa en el momento del cálculo. Esto ahorra memoria pero no hace las cosas más rápidas.
SVDQuant va más lejos. Ejecuta las capas de cálculo principal del modelo en precisión de 4 bits para pesos almacenados y cálculos en vivo, lo que reduce el uso de memoria y acelera el proceso. La parte complicada es que algunos números dentro de estos modelos son valores atípicos extremos, y comprimirlos a 4 bits destruye la calidad. SVDQuant maneja esos valores problemáticos por separado, manteniendo un pequeño búfer de alta precisión para los casos más difíciles y cuantizando todo lo demás.
Nunchaku Lite trae ese enfoque a Diffusers sin requerir un motor especializado. Un desarrollador carga un punto de control comprimido de la misma manera que carga cualquier otro modelo: una llamada a función, sin compilación local.
¿Quién puede usar esto hoy?
Cualquiera con una tarjeta gráfica NVIDIA compatible puede probarla. Las tarjetas RTX 30 y 40 series, que cubren la mayoría del mercado de consumidor de los últimos cuatro años, funcionan con las variantes comprimidas INT4. El formato NVFP4 más nuevo, que reduce aún más la memoria, requiere las tarjetas Blackwell más recientes de NVIDIA: la serie RTX 50, la RTX PRO 6000 o la B200. Las tarjetas más antiguas de generación Volta y Hopper aún no son compatibles.
| Formato | Tarjetas compatibles | Memoria máxima (imagen 1024px) | Tiempo de generación |
|---|---|---|---|
| BF16 (estándar) | Solo tarjetas de gama alta | ~24 GB | Línea de base |
| INT4 (Nunchaku Lite) | RTX 30 & 40 series, A100, L40S | ~12 GB | ~30% más rápido |
| NVFP4 (Nunchaku Lite) | RTX 50 series, B200 | ~12 GB | ~30% más rápido |
Para usuarios ordinarios, la conclusión práctica es clara: los modelos que previamente se negaban a cargar en una PC gaming de gama media ahora pueden ejecutarse sin problemas. Los desarrolladores que crean herramientas de imágenes para audiencias más amplias obtienen un camino directo para admitir más hardware.
¿Qué significa esto para la calidad de la imagen?
La compresión siempre implica un compromiso. Nunchaku Lite es aproximadamente 30% más rápido que un modelo estándar de precisión completa, pero no coincide con la velocidad del motor Nunchaku original, que utiliza atajos específicos de arquitectura que Nunchaku Lite evita deliberadamente para mantenerse flexible. La calidad de la imagen en modelos comprimidos es generalmente muy similar a la original, aunque pueden aparecer diferencias sutiles en detalles finos. Los puntos de referencia del propio artículo de SVDQuant sugieren que la brecha es lo suficientemente pequeña para la mayoría de los usos prácticos.
Preguntas frecuentes
¿Necesito ser desarrollador para beneficiarme de esto?
Por ahora, sí. Nunchaku Lite funciona a través de Diffusers, una biblioteca de codificación Python, por lo que cargar estos modelos requiere escribir una pequeña cantidad de código. Las aplicaciones de consumidor construidas sobre Diffusers pueden agregar soporte automáticamente con el tiempo.
¿Funcionará esto en una Mac o en tarjetas gráficas AMD?
Actualmente no. Nunchaku Lite se basa en núcleos CUDA específicos de NVIDIA, el código de bajo nivel que le dice a los chips NVIDIA cómo hacer estos cálculos rápidamente. AMD y Apple Silicon no son compatibles en esta etapa.
¿Pueden los desarrolladores comprimir sus propios modelos personalizados?
Sí. Hugging Face también lanzó un kit de herramientas complementario llamado diffuse-compressor que permite a los desarrolladores cuantizar nuevas arquitecturas de modelo por sí mismos y publicar los resultados como repositorios estándar de Diffusers.
La lectura honesta aquí es que Nunchaku Lite resuelve un problema real de acceso sin hacer promesas excesivas sobre calidad o velocidad. La cifra del 30% es real pero modesta, y el techo de NVFP4 significa que los usuarios de RTX 30 y 40 series obtienen la ventaja de memoria sin el camino más rápido. Observa si los desarrolladores de aplicaciones lo adoptan lo suficientemente rápido para que los no codificadores vean alguna vez el beneficio.



