Запуск моделей генерации изображений на обычном GPU: Hugging Face выводит 4-битное сжатие в массы

Новая интеграция Nunchaku Lite позволяет запускать генерирующие изображения нейросети на потребительских видеокартах с половиной требуемой памяти и на 30% быстрее — без необходимости специальной настройки.

AI2Day Newsdesk4 min read
IT team overwhelmed by multiple screens and tools
Share

Ключевые моменты

  • Nunchaku Lite, выпущенный Hugging Face, сокращает объем памяти, необходимый ведущей модели AI для генерации изображений, примерно с 24 ГБ до около 12 ГБ на NVIDIA RTX 5090.
  • Метод использует 4-битное квантование — способ сжатия хранимых чисел модели, благодаря чему снижается объем занимаемой памяти и ускоряется генерация изображений примерно на 30%.
  • Изображение размером 1024×1024 теперь создается примерно за 1,7 секунды на RTX 5090 с использованием сжатой модели, в отличие от намного более требовательной стандартной версии.
  • Разработчики могут загружать эти сжатые модели одной строкой кода внутри Diffusers — популярного инструментария с открытым исходным кодом для генерации изображений на основе AI.
  • Поддерживаются видеокарты NVIDIA RTX серий 30 и 40, хотя новейший формат сжатия требует самого свежего оборудования RTX серии 50.

Раньше создание высококачественного AI-изображения требовало видеокарты, которой большинство людей не владели. Лучшие модели преобразования текста в изображение при полном качестве нуждаются в объеме видеопамяти от 20 до 30 ГБ — это быстрая память на видеокарте, которая выполняет основную работу. Типичная потребительская карта имеет объем 8–16 ГБ. Этот разрыв удерживал серьезные инструменты для работы с AI внутри дата-центров и вне домашних студий.

Новая интеграция, опубликованная Hugging Face, значительно сужает этот разрыв.

Что такое Nunchaku Lite и что он на самом деле делает?

Nunchaku Lite — это способ загружать сильно сжатые модели AI для генерации изображений непосредственно в Diffusers, широко используемую библиотеку с открытым исходным кодом для запуска создающих изображения нейросетей, без установки отдельной программы или компиляции с нуля.

Используемое сжатие называется SVDQuant, что расшифровывается как квантование сингулярного разложения. Квантование в целом означает замену больших, точных чисел внутри модели AI на меньшие, более грубые числа — как MP3-файл аппроксимирует студийную запись при доле размера оригинала. Большинство существующих инструментов применяют это только к сохраненным весам — приобретенным знаниям модели, — а затем восстанавливают их к полной точности на момент вычисления. Это экономит память, но не ускоряет процесс.

SVDQuant идет дальше. Он выполняет основные вычислительные слои модели с 4-битной точностью для как сохраненных весов, так и динамических вычислений, что снижает использование памяти и ускоряет процесс. Сложность состоит в том, что некоторые числа внутри этих моделей являются экстремальными выбросами, и их сжатие до 4 бит разрушает качество. SVDQuant обрабатывает эти проблемные значения отдельно, сохраняя небольной буфер с высокой точностью для наиболее сложных случаев и квантуя все остальное.

Nunchaku Lite внедряет такой подход в Diffusers без необходимости специального движка. Разработчик загружает сжатую контрольную точку так же, как любую другую модель: один вызов функции, без локальной компиляции.

Кто может использовать это сегодня?

Любой, у кого есть совместимая видеокарта NVIDIA, может попробовать. Карты серии RTX 30 и 40, охватывающие большинство потребительского рынка за последние четыре года, работают со сжатыми вариантами INT4. Новейший формат NVFP4, который еще больше снижает требования памяти, требует самых свежих видеокарт Blackwell от NVIDIA: RTX 50, RTX PRO 6000 или B200. Более старые карты, включая поколения Volta и Hopper, пока не поддерживаются.

Формат Поддерживаемые карты Пиковое использование памяти (изображение 1024px) Время генерации
BF16 (стандарт) Только карты высокого уровня ~24 ГБ Базовый уровень
INT4 (Nunchaku Lite) RTX 30 и 40, A100, L40S ~12 ГБ ~30% быстрее
NVFP4 (Nunchaku Lite) RTX 50, B200 ~12 ГБ ~30% быстрее

Для обычных пользователей вывод очевиден: модели, которые раньше отказывались загружаться на среднеуровневый игровой ПК, теперь могут работать без проблем. Разработчики, создающие инструменты для создания изображений для более широкой аудитории, получают простой способ поддержки большего количества оборудования.

Что это означает для качества изображений?

Сжатие всегда предполагает компромисс. Nunchaku Lite примерно на 30% быстрее стандартной модели с полной точностью, но не соответствует скорости оригинального движка Nunchaku, который использует архитектурно-специфические оптимизации, которые Nunchaku Lite намеренно избегает для сохранения гибкости. Качество изображения в сжатых моделях в целом очень близко к оригиналу, хотя на мелких деталях могут появиться тонкие различия. Собственные тесты из статьи SVDQuant показывают, что разница достаточно мала для большинства практических применений.

Частые вопросы

Нужно ли быть разработчиком, чтобы воспользоваться этим?

На данный момент да. Nunchaku Lite работает через Diffusers, библиотеку кода на Python, поэтому загрузка этих моделей требует написания небольшого количества кода. Потребительские приложения, построенные на Diffusers, могут со временем автоматически добавить поддержку.

Будет ли это работать на Mac или видеокартах AMD?

В настоящее время нет. Nunchaku Lite полагается на специфичные для NVIDIA ядра CUDA — низкоуровневый код, который говорит чипам NVIDIA, как быстро выполнять эти вычисления. AMD и Apple Silicon пока не поддерживаются.

Могут ли разработчики сжимать свои собственные пользовательские модели?

Да. Hugging Face также выпустил сопутствующий инструментарий diffuse-compressor, который позволяет разработчикам квантовать новые архитектуры моделей самостоятельно и опубликовать результаты как стандартные репозитории Diffusers.

© 2026 AI2Day