Como é que os geradores de imagens por IA funcionam na verdade? Um guia em linguagem simples

De palavras digitadas para obra de arte acabada em segundos: eis o que está realmente a acontecer dentro da máquina.

AI2Day Newsdesk5 min read
Photoreal editorial shot of a dimly lit network operations center at night, multiple monitors showing abstract dashboard graphs and topology maps, slightly out
Share

Os geradores de imagens por IA transformam a sua descrição em texto numa imagem ao aprender padrões de milhões de imagens existentes e utilizar esses padrões para construir uma nova do zero. Todo o processo acontece em segundos. Nenhum artista humano está envolvido em nenhum momento.

O que é que a IA realmente aprende antes de digitar algo?

Antes de ver um único resultado, o modelo já passou semanas a estudar centenas de milhões de pares imagem-legenda. Aprende que formas visuais tendem a ir com que palavras, da mesma forma que uma criança aprende que a palavra "maçã" corresponde a um objeto redondo e vermelho.

Esta fase de treinamento é a parte cara e demorada. A pesquisa DALL-E da OpenAI e o trabalho de Imagen do Google DeepMind dependem ambos deste tipo de aprendizado visual em larga escala. No final, o modelo detém um mapa matemático comprimido de como conceitos e píxeis se relacionam entre si.

O que é "difusão" e porque é que toda a gente continua a falar disso?

A difusão é o truque central que a maioria dos geradores de imagens modernos utiliza. O modelo é treinado tomando imagens reais, enterrando-as lentamente em ruído aleatório (pense no "snow" de uma velha TV), e depois aprendendo a inverter esse processo e recuperar o original.

Assim que consegue desfocar ruído de forma confiável, pode executar o processo ao contrário: começar com ruído aleatório puro, fornecer ao modelo um comando de texto como guia, e deixá-lo "esculpir" uma imagem limpa do caos. Investigadores no arxiv descrevem isto formalmente como um modelo probabilístico de difusão por redução de ruído. Cada passo remove um pouco de ruído, orientado pelas suas palavras, até que apareça uma imagem coerente.

Como é que o modelo conecta palavras a imagens?

Texto e imagens falam idiomas diferentes, por isso o gerador precisa de um tradutor. A maioria dos sistemas utiliza um componente chamado codificador de texto, que converte o seu comando numa lista de números (chamado vetor) que captura significado. O modelo CLIP da OpenAI é um codificador amplamente utilizado: foi treinado em pares imagem-legenda até que vetores de imagem e vetores de texto para o mesmo conceito ficassem próximos no espaço matemático.

O modelo de difusão utiliza então esse vetor como uma bússola em cada passo de redução de ruído, orientando a imagem emergente na direção da sua descrição.

O que acontece no momento em que clica em "gerar"?

Quatro coisas acontecem em rápida sequência. Primeiro, o seu comando é codificado num vetor. Segundo, um campo de ruído aleatório é criado como a tela em branco. Terceiro, o modelo de difusão executa entre 20 e 50 passos de redução de ruído, cada um tornando a imagem ligeiramente mais nítida e mais adequada ao tema. Quarto, um componente final chamado descodificador amplia a imagem para resolução total.

Toda a sequência normalmente leva entre um a dez segundos num chip gráfico moderno.

Etapa O que faz Analogia simples
Codificação de texto Transforma palavras em números Traduzir uma receita em quantidades
Tela de ruído Cria píxeis de início aleatórios Tela em branco de "snow" de TV
Passos de redução de ruído Esculpe gradualmente a imagem Escultor a remover argila, não a adicionar
Orientação O seu comando orienta cada passo GPS atualizando em cada curva
Descodificação Amplia para resolução total Imprimir uma miniatura no tamanho de um cartaz

Um exemplo real: planear uma renovação de cozinha

Uma proprietária digita "cozinha escandinava brilhante, armários de carvalho, luz matinal" numa ferramenta como Adobe Firefly. Em cerca de três segundos, obtém quatro opções fotorrealistas para mostrar ao seu contratante, evitando o custo de um designer de mood board. A imagem nunca existiu antes; o modelo montou-a a partir de padrões aprendidos em milhões de fotos de cozinha.

Quanto custa, e existe um nível gratuito?

Os preços variam muito. Muitas ferramentas oferecem uma margem de início gratuita: Adobe Firefly agrupa créditos com Creative Cloud e oferece uma versão web gratuita com saídas marcadas com marca d'água. O plano de entrada do Midjourney custa cerca de 10 dólares por mês. DALL-E está disponível gratuitamente dentro do nível gratuito do ChatGPT com um limite de utilização diário. Modelos de código aberto como Stable Diffusion podem ser executados localmente por nada, embora necessite de um cartão gráfico razoavelmente potente.

Quais são as armadilhas de privacidade?

Leia os termos antes de digitar algo sensível. Vários serviços comerciais declaram nos seus termos que os comandos e imagens geradas podem ser utilizados para melhorar o modelo, o que significa que as suas entradas podem ser revistas pelo pessoal ou reintroduzidas nos dados de treinamento. Executar um modelo de código aberto localmente evita isso completamente porque nada sai da sua máquina. Se está a gerar imagens para um cliente ou a incluir rostos reconhecíveis ou ativos de marca, verifique a política de utilização comercial da plataforma antes de publicar.

Perguntas frequentes

É que a IA copia o trabalho de artistas existentes?

Não diretamente. O modelo armazena padrões estatísticos, não cópias de imagens. No entanto, como foi treinado em obra protegida por direitos de autor sem consentimento explícito do artista, este é um debate jurídico ativo, e a Estrutura de Gestão de Risco de IA do NIST sinaliza a proveniência dos dados de treinamento como uma questão chave de transparência.

Posso ser proprietário dos direitos de autor de uma imagem gerada por IA?

Na maioria dos países, a lei de direitos de autor exige um autor humano, por isso uma imagem totalmente gerada por IA sem aporte criativo humano pode não se qualificar para proteção. As regras diferem por jurisdição e ainda estão a ser testadas nos tribunais, portanto consulte a orientação local antes de utilizar imagens geradas comercialmente.

Porque é que as imagens de IA às vezes ficam com as mãos erradas?

As mãos são estatisticamente complexas: os dedos variam em número, ângulo e sobreposição de formas que são difíceis de generalizar apenas a partir dos dados de treinamento. O modelo aprendeu mãos menos consistentemente do que, por exemplo, rostos, que aparecem numa orientação frontal mais previsível em milhões de fotos.

© 2026 AI2Day