Executar Modelos de IA de Imagem numa GPU Normal: Hugging Face Traz Difusão em 4-Bit para Todos

Uma nova integração chamada Nunchaku Lite permite que a IA geradora de imagens funcione em placas gráficas de consumidor com metade da memória e 30% mais rápida, sem necessidade de configuração especializada.

AI2Day Newsdesk4 min read
IT team overwhelmed by multiple screens and tools
Share

Pontos-chave

  • Nunchaku Lite, lançado pela Hugging Face, reduz a memória que um modelo de IA de imagem de topo necessita de aproximadamente 24 GB para cerca de 12 GB numa NVIDIA RTX 5090.
  • A técnica utiliza quantização de 4-bit, um método de compressão dos números armazenados de um modelo para ocupar menos espaço, enquanto também acelera a geração de imagens em cerca de 30%.
  • Uma imagem de 1024×1024 demora agora cerca de 1,7 segundos numa RTX 5090 utilizando o modelo comprimido, em comparação com a versão padrão muito mais pesada.
  • Os programadores podem carregar estes modelos comprimidos com uma única linha de código dentro do Diffusers, o kit de ferramentas de código aberto popular para geração de imagens de IA.
  • As placas NVIDIA RTX 30 e 40 são suportadas, embora o formato de compressão mais recente exija o hardware RTX 50 mais recente.

Gerar uma imagem de IA de alta qualidade costumava exigir uma placa gráfica que a maioria das pessoas não possui. Os melhores modelos texto-para-imagem, quando carregados em qualidade total, necessitam entre 20 e 30 GB de VRAM, a memória rápida que reside numa placa gráfica e realiza o trabalho pesado. Uma placa de consumidor típica tem 8 a 16 GB. Esta lacuna manteve as ferramentas sérias de IA de imagem dentro de centros de dados e fora dos estúdios caseiros.

Uma nova integração publicada pela Hugging Face reduz essa lacuna consideravelmente.

O que é Nunchaku Lite e o que realmente faz?

Nunchaku Lite é uma forma de carregar modelos de IA de imagem altamente comprimidos diretamente dentro do Diffusers, a biblioteca de código aberto amplamente utilizada para executar IA geradora de imagens, sem instalar um programa separado ou compilar nada do zero.

A compressão que utiliza é chamada SVDQuant, abreviatura de Singular Value Decomposition Quantization. Quantização, em termos gerais, significa substituir os números grandes e precisos dentro de um modelo de IA por números mais pequenos e aproximados, da forma como um ficheiro MP3 aproxima uma gravação de estúdio a uma fração do tamanho. A maioria das ferramentas existentes faz isto apenas aos pesos armazenados, o conhecimento aprendido do modelo, e depois converte-os de volta para precisão total no momento do cálculo. Isto economiza memória mas não acelera as coisas.

SVDQuant vai mais longe. Executa as camadas de cálculo principais do modelo em precisão de 4-bit tanto para os pesos armazenados como para os cálculos em tempo real, o que reduz o uso de memória e acelera o processo. A parte complicada é que alguns números dentro destes modelos são valores extremamente atípicos, e comprimi-los a 4-bit destrói a qualidade. SVDQuant lida com estes valores problemáticos separadamente, mantendo uma pequena memória de alta precisão para os casos mais difíceis e quantizando todo o resto.

Nunchaku Lite traz essa abordagem para o Diffusers sem exigir um motor especializado. Um programador carrega um ponto de controlo comprimido da mesma forma que carrega qualquer outro modelo: uma chamada de função, sem compilação local.

Quem pode utilizar isto hoje?

Qualquer pessoa com uma placa gráfica NVIDIA compatível pode experimentar. As placas RTX 30 e 40, que cobrem a maioria do mercado de consumidor dos últimos quatro anos, funcionam com as variantes comprimidas INT4. O formato NVFP4 mais recente, que comprime ainda mais a memória, requer os cartões Blackwell mais recentes da NVIDIA: a série RTX 50, a RTX PRO 6000 ou a B200. As placas mais antigas, incluindo as gerações Volta e Hopper, ainda não são suportadas.

Formato Placas suportadas Memória máxima (imagem 1024px) Tempo de geração
BF16 (padrão) Apenas placas de topo ~24 GB Baseline
INT4 (Nunchaku Lite) Série RTX 30 & 40, A100, L40S ~12 GB ~30% mais rápido
NVFP4 (Nunchaku Lite) Série RTX 50, B200 ~12 GB ~30% mais rápido

Para utilizadores ordinários, a consequência prática é clara: modelos que anteriormente se recusavam a carregar num PC de jogos de gama média podem agora funcionar sem problemas. Os programadores que constroem ferramentas de imagem para audiências mais amplas obtêm um caminho direto para suportar mais hardware.

O que isto significa para a qualidade da imagem?

A compressão sempre envolve uma compensação. Nunchaku Lite é cerca de 30% mais rápido do que um modelo de precisão completa padrão, mas não corresponde à velocidade do motor Nunchaku original, que utiliza atalhos específicos da arquitetura que Nunchaku Lite deliberadamente evita para se manter flexível. A qualidade da imagem em modelos comprimidos é geralmente muito próxima ao original, embora diferenças subtis possam aparecer em detalhes finos. Os próprios benchmarks do artigo SVDQuant sugerem que a lacuna é pequena o suficiente para a maioria dos usos práticos.

Perguntas comuns

Preciso de ser programador para beneficiar disto?

Neste momento, sim. Nunchaku Lite funciona através do Diffusers, uma biblioteca de programação Python, portanto carregar estes modelos requer escrever uma pequena quantidade de código. As aplicações de consumo construídas no Diffusers podem adicionar suporte automaticamente com o tempo.

Isto funcionará num Mac ou em placas gráficas AMD?

Não no momento. Nunchaku Lite depende de kernels CUDA específicos da NVIDIA, o código de baixo nível que diz aos chips NVIDIA como realizar estes cálculos rapidamente. AMD e Apple Silicon não são suportados nesta fase.

Os programadores podem comprimir os seus próprios modelos personalizados?

Sim. Hugging Face também lançou um kit de ferramentas complementar chamado diffuse-compressor que permite aos programadores quantizar novas arquiteturas de modelo a si mesmos e publicar os resultados como repositórios padrão do Diffusers.

© 2026 AI2Day