Investigadores da Apple Descobrem uma Falha Oculta que Pode Corromper Silenciosamente Imagens Geradas por IA
Um pequeno número de pontos de dados irregulares, chamados outlier tokens, pode desestabilizar os sistemas que criam imagens por IA. Uma nova investigação explica o que são e como corrigi-los.

Pontos-chave
- A Apple ML Research identificou uma falha específica, chamada outlier tokens, dentro de sistemas de geração de imagens por IA baseados num design conhecido como Diffusion Transformers.
- Estes outlier tokens aparecem tanto na parte do sistema que lê imagens como na parte que cria novas.
- O problema é mais grave nas camadas intermédias do modelo de IA, os estágios de processamento entre entrada e saída final.
- Se não forem controlados, os outlier tokens podem desviar a atenção do modelo para lugares errados, reduzindo a qualidade e precisão das imagens geradas.
Imagine uma sala de aula onde um aluno muito barulhento continua a interromper todas as aulas. Mesmo que esse aluno nunca diga nada útil, o resto da turma ainda assim vira-se para olhar. Algo muito semelhante acontece dentro dos sistemas de IA que geram imagens a partir de descrições de texto.
Investigadores da Apple ML Research identificaram o problema em detalhe. Os culpados são chamados outlier tokens. Um token, neste contexto, é um pequeno pedaço de informação que a IA processa, aproximadamente como uma palavra numa frase, mas para imagens. Um outlier token é aquele que possui um valor numérico anormalmente grande, fazendo-o parecer muito mais importante do que realmente é.
Afinal, o que corre mal?
Os outlier tokens roubam atenção. A IA dedica poder de processamento a eles mesmo que transportem muito pouca informação real sobre a imagem que está a ser construída.
A investigação concentra-se numa classe de modelos chamada Diffusion Transformers, ou DiTs. Estes são os motores que potenciam muitos dos melhores geradores de imagens por IA de hoje. Funcionam em duas fases principais. Primeiro, um codificador (pense nele como os óculos de leitura do modelo) converte uma imagem real numa descrição matemática compacta. Depois, um desruidificador (o motor criativo) constrói gradualmente uma nova imagem a partir de ruído, guiado por essa descrição.
A equipa da Apple descobriu que os outlier tokens causam problemas em ambas as fases. Os codificadores pré-treinados podem entregar representações distorcidas ao desruidificador antes de este sequer começar. E o desruidificador em si pode desenvolver os seus próprios outlier tokens enquanto processa, especialmente no profundo das suas camadas intermédias.
Isto afeta as imagens que as pessoas realmente utilizam?
Potencialmente sim, embora o artigo descreva uma descoberta de investigação e não uma falha de produto em funcionamento.
Quando a atenção do modelo é atraída para tokens sem sentido, a imagem final pode afastar-se do que o utilizador pediu. Os detalhes são perdidos. A consistência sofre. Quanto mais complexo for o pedido, mais oportunidade os outlier tokens têm para causar problemas.
A boa notícia: os investigadores também estudaram formas de suprimir estes desvios. O seu trabalho aponta para correções práticas que poderiam ser incorporadas em modelos futuros.
Para qualquer pessoa que esteja a utilizar ferramentas de imagem por IA hoje, esta investigação não requer qualquer ação. Situa-se ao nível fundacional, o tipo de descoberta que os engenheiros usam para construir sistemas melhores na próxima geração de ferramentas.
O que acontece a seguir?
A investigação encontra-se num estágio inicial e exploratório. Não foram anunciadas alterações de produtos ou atualizações de modelos públicos.
O que torna este trabalho significativo é que traz um problema conhecido de uma classe mais antiga de modelos de IA (Vision Transformers utilizados em reconhecimento de imagens) para o mundo mais recente da geração de imagens. Os investigadores tinham detetado outlier tokens em modelos de reconhecimento antes, mas o seu papel em sistemas generativos era largamente inexplorado até agora.
Estudar a doença cuidadosamente é o primeiro passo necessário antes de a curar.
Perguntas frequentes
Isto afetará as ferramentas de imagem por IA que já utilizo?
Não de forma direta ou imediata. Esta é investigação fundacional, não uma atualização de produto. Os achados provavelmente informarão a forma como os modelos de geração de imagens futuros serão projetados e treinados.
O que é um Diffusion Transformer em termos simples?
É o tipo de arquitetura de IA, ou estrutura interna, utilizado por muitas ferramentas modernas de geração de imagens. Funciona começando com ruído aleatório e moldando-o gradualmente numa imagem coerente, guiado pela sua descrição de texto.



