Запускайте AI моделі генерації зображень на звичайному GPU: Hugging Face запускає 4-Bit Diffusion для всіх
Нова інтеграція під назвою Nunchaku Lite дозволяє AI-моделям генерувати зображення на споживацьких графічних картах з половиною обсягу пам'яті та на 30% швидше, без необхідності спеціального налаштування.

Ключові моменти
- Nunchaku Lite, випущений Hugging Face, зменшує обсяг пам'яті, необхідної для топової AI-моделі генерації зображень, з приблизно 24 ГБ до близько 12 ГБ на NVIDIA RTX 5090.
- Цей метод використовує 4-бітне квантування — спосіб стискання чисел у моделі, щоб вона займала менше місця, а також прискорює генерацію зображень приблизно на 30%.
- Зображення розміром 1024×1024 тепер генерується близько 1,7 секунди на RTX 5090 із використанням стиснутої моделі проти набагато важчої стандартної версії.
- Розробники можуть завантажити ці стиснуті моделі однією строкою коду всередину Diffusers — популярного набору інструментів з відкритим вихідним кодом для AI генерації зображень.
- Підтримуються NVIDIA RTX 30 і 40 series, хоча новіший формат стискання потребує найновішого апаратного забезпечення RTX 50 series.
Раніше генерування високоякісного AI-зображення потребувало графічної карти, якої більшість людей не мають. Найкращі моделі перетворення тексту на зображення при завантаженні на повну якість потребують від 20 до 30 ГБ VRAM — швидкої пам'яті, що знаходиться на графічній карті та виконує основну роботу. Типова споживацька карта має 8-16 ГБ. Цей розрив зберігав серйозні AI-інструменти для зображень у центрах обробки даних, подалі від домашніх студій.
Нова інтеграція, опублікована Hugging Face, значною мірою скорочує цей розрив.
Що таке Nunchaku Lite і що він фактично робить?
Nunchaku Lite — це спосіб завантажити сильно стиснуті AI-моделі генерації зображень прямо всередину Diffusers, широко використовуваної бібліотеки з відкритим вихідним кодом для запуску AI-моделей генерації зображень, без необхідності встановлювати окремої програми або компіляції з нуля.
Стискання, яке воно використовує, називається SVDQuant, скорочено Singular Value Decomposition Quantization. Квантування в широкому сенсі означає заміну великих, точних чисел всередину AI-моделі на менші, грубші, як MP3-файл наближує студійний запис за частку розміру. Більшість існуючих інструментів робіть це лише для збережених ваг — вивченого знання моделі, а потім перетворюють їх назад на повну точність під час обчислення. Це заощаджує пам'ять, але не прискорює процес.
SVDQuant йде далі. Він запускає основні обчислювальні шари моделі з 4-бітною точністю як для збережених ваг, так і для живих обчислень, що скорочує використання пам'яті та прискорює процес. Складна частина полягає в тому, що деякі числа всередину цих моделей є крайніми викидами, і стискання їх до 4 біт руйнує якість. SVDQuant обробляє ці проблемні значення окремо, зберігаючи невеликий буфер високої точності для найскладніших випадків і квантуючи все інше.
Nunchaku Lite вносить цей підхід до Diffusers без необхідності спеціалізованого рушія. Розробник завантажує стиснену контрольну точку так само, як завантажує будь-яку іншу модель: одна функція, без локальної компіляції.
Хто може використовувати це сьогодні?
Будь-хто з сумісною графічною картою NVIDIA може спробувати. Карти RTX 30 і 40 series, які охоплюють більшість споживацького ринку протягом останніх чотирьох років, працюють зі стиснутими варіантами INT4. Новіший формат NVFP4, який стискає пам'ять ще більше, потребує новітніх карт NVIDIA Blackwell: RTX 50 series, RTX PRO 6000 або B200. Старіші карти, включаючи поколінь Volta та Hopper, поки не підтримуються.
| Формат | Підтримуються карти | Максимальна пам'ять (1024px зображення) | Час генерування |
|---|---|---|---|
| BF16 (стандартний) | Лише високопродуктивні карти | ~24 ГБ | Базовий показник |
| INT4 (Nunchaku Lite) | RTX 30 & 40 series, A100, L40S | ~12 ГБ | ~30% швидше |
| NVFP4 (Nunchaku Lite) | RTX 50 series, B200 | ~12 ГБ | ~30% швидше |
Для звичайних користувачів практичний результат очевидний: моделі, які раніше відмовлялися завантажуватися на середньопродуктивний ігровий комп'ютер, тепер можуть запускатися без проблем. Розробники, які створюють інструменти для зображень для ширшої аудиторії, отримують зрозумілий шлях до підтримки більшої кількості апаратного забезпечення.
Що це означає для якості зображення?
Стискання завжди передбачає компроміс. Nunchaku Lite приблизно на 30% швидше, ніж стандартна модель з повною точністю, але не відповідає швидкості оригінального рушія Nunchaku, який використовує специфічні для архітектури ярлики, які Nunchaku Lite навмисне уникає, щоб залишатися гнучким. Якість зображення в стиснутих моделях в основному дуже близька до оригіналу, хоча тонкі відмінності можуть з'явитися на тонких деталях. Власні тести паперу SVDQuant припускають, що розрив досить малий для більшості практичних використань.
Часті запитання
Чи потребую я буди розробником, щоб отримати користь від цього?
На даний момент так. Nunchaku Lite працює через Diffusers — бібліотеку програмування на Python, тому завантаження цих моделей потребує написання невеликої кількості коду. Споживацькі додатки, побудовані на Diffusers, можуть з часом додати підтримку автоматично.
Чи це буде працювати на Mac або на графічних картах AMD?
Наразі ні. Nunchaku Lite покладається на специфічні для NVIDIA CUDA-ядра — низькорівневий код, який повідомляє чипам NVIDIA, як швидко виконувати ці обчислення. AMD та Apple Silicon наразі не підтримуються.
Чи можуть розробники стискати власні користувацькі моделі?
Так. Hugging Face також випустив супутній набір інструментів під назвою diffuse-compressor, який дозволяє розробникам квантувати нові архітектури моделей самостійно та публікувати результати як стандартні репозиторії Diffusers.



