Os Modelos de IA Podem Não Precisar Esquecer Tudo: O Caso para um Desaprendizado Mais Inteligente

Uma nova investigação da Apple ML Research sugere que alguns dados de treino têm tão pouco efeito num modelo de IA que removê-los é uma perda de tempo e dinheiro.

AI2Day Newsdesk3 min read
Photoreal editorial shot of a dimly lit network operations center at night, multiple monitors showing abstract dashboard graphs and topology maps, slightly out
Share

Pontos-chave

  • A Apple ML Research publicou um estudo revelando que alguns pontos de dados de treino têm influência negligenciável nos resultados de um modelo de IA.
  • Os métodos de desaprendizado atuais tratam todos os pontos de dados como igualmente importantes, o que a investigação argumenta ser computacionalmente desperdiçador.
  • Os resultados poderiam reduzir o custo da conformidade de privacidade para empresas que utilizam IA treinada em dados pessoais.
  • O estudo utilizou funções de influência em tarefas de reconhecimento de linguagem e imagem para identificar dados de baixo impacto.

O que é desaprendizado em IA e por que é importante?

O desaprendizado em IA é o processo de remover uma informação específica de um modelo já treinado, sem ter de reconstruir o modelo do zero. Pense nisso como tentar fazer alguém esquecer um número de telefone sem apagar toda a sua memória.

Isto é importante porque as leis de privacidade em muitos países agora dão às pessoas o direito de ter os seus dados pessoais eliminados. Se a sua informação foi utilizada para treinar um sistema de IA, uma empresa pode ser legalmente obrigada a removê-la. Treinar um modelo grande do zero é caro. Muito caro. Por isso, os investigadores têm estado a construir atalhos de "desaprendizado" para fazer o trabalho mais rapidamente.

A abordagem padrão hoje em dia apaga cada ponto de dados assinalado com o mesmo esforço, independentemente de quanto efetivamente moldou o modelo. Uma fotografia sua que mal tocou o modelo durante o treino recebe o mesmo processo de remoção custoso que uma que o modelo memorizou profundamente.

O que é que os investigadores efetivamente descobriram?

Descobriram que nem todos os pontos de dados deixam a mesma marca. Muitos deixam praticamente nenhuma.

A equipa utilizou uma ferramenta chamada funções de influência, um método matemático que estima quanto é que cada exemplo de treino alterou o comportamento final do modelo. Aplicado tanto em tarefas de texto como de imagem, a análise identificou consistentemente um subconjunto de exemplos de treino cuja pontuação de influência era tão próxima de zero que removê-los não fez diferença mensurável nos resultados do modelo.

A conclusão: esses pontos estão efetivamente "já esquecidos". Tratá-los da mesma forma que os dados de alta influência desperdiça tempo computacional e, portanto, dinheiro.

O que significa isto para as empresas e utilizadores comuns?

Para as empresas, a implicação prática é custos de conformidade mais baixos. Se um pedido de privacidade chegar e os dados assinalados forem de baixa influência, o modelo pode não precisar de um passe de desaprendizado custoso.

Para indivíduos que pediram a uma empresa para eliminar os seus dados de um sistema de IA, esta investigação não significa que o seu pedido seja ignorado. Significa que os engenheiros poderiam um dia utilizar ferramentas mais inteligentes para verificar que os dados genuinamente não tiveram efeito, em vez de executar um processo de eliminação em massa.

Vale a pena ser honesto sobre o que ainda não sabemos. A investigação é uma análise comparativa, não um produto ou sistema implementado. A lei de privacidade do mundo real não tem atualmente uma exceção de "influência negligenciável", e os reguladores podem não aceitar uma pontuação matemática como prova de que os dados foram verdadeiramente removidos. Essas questões continuam em aberto.

O que acontece a seguir?

O desaprendizado eficiente é uma área de investigação em rápida evolução, e este trabalho acrescenta uma perspetiva prática: antes de gastar dinheiro removendo dados, verifique se os dados realmente importaram. Esse enquadramento pode mudar a forma como todo o campo aborda o problema.

Uma conclusão honesta: se a sua empresa armazena dados pessoais que alimentam um modelo de IA, comece a auditar o que realmente recolhe. Quanto menos dados desnecessários treinar, menor será o seu problema de desaprendizado mais tarde.

© 2026 AI2Day