Investigadores da Apple Encontraram uma Forma de Bloquear Modelos de IA para que Ninguém Possa Alterá-los

Os modelos de IA abertos são poderosos, partilháveis e cada vez mais difíceis de controlar. Uma nova técnica da Apple ML Research visa proteger os pesos pré-treinados de serem desviados para usos perigosos, sem sacrificar o que torna os modelos abertos úteis em primeiro lugar.

AI2Day Newsdesk3 min read
Photoreal news-editorial 16:9 image of a server room bathed in cold blue light, cables and rack units sharply in focus in the foreground, a faint red glow emana
Share

Pontos-chave

  • A Apple ML Research publicou um novo método para proteger os parâmetros internos dos modelos de IA de pesos abertos contra ajustes não autorizados.
  • Os modelos de pesos abertos, sistemas de IA cujas configurações internas são partilhadas publicamente e descarregáveis, melhoraram significativamente em qualidade nos últimos anos.
  • A técnica utiliza destilação residual de baixo rank para bloquear o comportamento central de um modelo mantendo-o funcional para utilizadores legítimos.
  • A defesa contra o uso indevido de modelos de IA abertos é difícil porque, uma vez que os pesos são públicos, qualquer pessoa pode modificá-los no seu próprio computador.
  • A investigação visa uma tensão crescente: a abertura impulsiona o progresso, mas também torna as ferramentas de IA mais fáceis de serem armamentizadas.

Imagine um manual que pode descarregar, copiar e anotar. Os modelos de IA de pesos abertos funcionam da mesma forma. Os "pesos" são os milhões de parâmetros numéricos, aprendidos durante o treino, que definem como um modelo pensa e responde. Partilhe essas configurações publicamente e investigadores de todo o mundo podem construir a partir delas, testá-las, executá-las em computadores baratos e adaptá-las a trabalhos específicos.

Essa liberdade acelerou enormemente o progresso da IA. Também criou um problema.

Qual é o risco real?

Assim que os pesos são públicos, qualquer pessoa pode retreinar ou ajustar o modelo para fins prejudiciais, e os desenvolvedores originais não têm forma de os impedir. Um filtro de segurança incorporado num modelo pode ser silenciosamente removido. Comportamentos que foram deliberadamente restringidos podem ser desbloqueados.

Defender-se contra isto é genuinamente difícil. Um utilizador determinado a trabalhar no seu próprio computador, offline, fora dos termos de serviço de qualquer plataforma, não enfrenta qualquer barreira técnica à modificação. As proteções habituais, políticas de conteúdo e restrições de API simplesmente não se aplicam aos pesos descarregados.

O que construíram realmente os investigadores da Apple?

A técnica chama-se destilação residual de baixo rank. O nome é complicado, portanto eis o que significa na prática.

"Destilação" é o processo de comprimir o conhecimento de um modelo numa nova forma. "Baixo rank" significa que as alterações são estruturadas de forma matematicamente mínima, pequenos ajustes colocados profundamente dentro do modelo. O resultado é um modelo que se comporta normalmente para usos pretendidos mas resiste a ser desviado para outro fim através do ajuste fino, o método padrão que os atacantes usariam para alterar o seu comportamento.

Pense nisso como um bloqueio construído na espinha dorsal do manual. Pode ler todas as páginas. Não pode reescrever os capítulos.

A Apple ML Research, que publicou este trabalho, enquadra-o como uma resposta direta à tensão entre abertura e segurança. Modelos abertos mais poderosos significam mais capacidade em mais mãos, o que é na sua maioria bom. Também significa que as ferramentas para causar danos se tornam mais acessíveis, o que não é.

Isto afeta as pessoas comuns?

Não diretamente, não ainda. Este é um artigo de investigação, não um produto lançado hoje.

Mas o problema subjacente afeta qualquer pessoa que utilize ferramentas de IA construídas em modelos abertos, desde assistentes de escrita a geradores de imagens até bots de atendimento ao cliente. Se esses modelos puderem ser silenciosamente modificados antes de chegarem a um produto, o trabalho de segurança feito pelos desenvolvedores originais não conta para nada.

Investigações como esta são uma tentativa de tornar o ecossistema de modelos abertos mais seguro a nível estrutural, para que os benefícios da IA partilhável, mais barata, mais rápida e mais transparente, não venham acompanhados de rotas fáceis para uso indevido.

Se a técnica se mantém contra adversários determinados em larga escala é a próxima questão. Investigadores independentes vão agora testá-la sob pressão. Isso é, presumivelmente, exatamente como a ciência aberta deveria funcionar.

© 2026 AI2Day