A IA Corrigiu Falhas de Segurança Corretamente em Apenas 26% num Estudo de 6.080 Patches

A 1Password testou dois modelos de IA líderes em falhas reais de software e descobriu que a maioria dos patches parecia correcta mas não era. Eis o que isto significa para o software que utiliza todos os dias.

AI2Day Newsdesk3 min read
Photoreal, news-editorial style, 16:9 framing, full-frame edge-to-edge composition
Share

Pontos-chave

  • A 1Password testou 6.080 patches de segurança gerados por IA e descobriu que apenas 26% corrigiram a falha sem efeitos colaterais não intencionais.
  • Tanto o ChatGPT-5.5 como o Claude Opus 4.8 produziram patches com defeitos ocultos em 53,9% dos casos quando a vulnerabilidade era complexa.
  • Quase metade de todos os patches, 49,3%, deixou pelo menos um caminho aberto que um atacante ainda poderia explorar.
  • Cada tentativa de patch custou entre 2,11 e 2,81 dólares, mas verificar se a correção é segura exige tempo de especialistas humanos para além disso.
  • A Anthropic, empresa por trás do Claude, informou a 1Password que especialistas humanos devem manter-se como aprovação final aos níveis atuais de capacidade da IA.

A 1Password, a empresa de gestão de palavras-passe que a maioria das pessoas conhece pelos seus telemóveis, publicou um estudo esta semana com uma descoberta preocupante: as ferramentas de IA não estão a corrigir de forma fiável as falhas de segurança que alegam corrigir. Como foi relatado pela primeira vez pela ThreatVectr, a investigação executou 6.080 patches gerados por dois modelos de IA amplamente utilizados contra seis vulnerabilidades reais de software recentemente divulgadas.

O número de destaque é 26%. Esta é a quota de patches que realmente resolveram o problema de forma limpa, sem danos ocultos.

Exatamente o que correu mal com os outros 74%?

A maioria desses patches parecia correcta à superfície. Foram compilados (o que significa que o computador aceitou o código), passaram testes básicos e não apresentaram erros óbvios. O problema estava escondido.

Os investigadores chamaram esta categoria de resultados deficientes FLAWED, abreviatura de Fix-Like Artifacts With Embedded Defects (Artefatos Semelhantes a Correções com Defeitos Incorporados). O rótulo é apropriado: o código parece saudável mas contém uma fraqueza oculta.

O investigador Keith Hoodlet deu um exemplo claro. Quando ambos os modelos de IA abordaram uma falha no Spring AI, um framework de software que os programadores utilizam para construir aplicações alimentadas por IA, filtraram os caracteres de ataque específicos utilizados no teste. Um atacante usando caracteres ligeiramente diferentes passaria directamente através do mesmo buraco antigo. Mais de um terço dos patches inicialmente promissores eram frágeis exactamente desta forma.

Os números para o resto das falhas distribuem-se assim:

Resultado Quota de patches
Corrigido de forma limpa, sem efeitos colaterais 26,0%
Deixou pelo menos um caminho de ataque aberto 49,3%
Defeitos ocultos em falhas complexas 53,9%
Corrigiu a falha original, adicionou uma nova 2,3%
Não corrigiu a falha original e adicionou uma nova falha 2,2%

Deve estar preocupado com as aplicações que utiliza hoje?

Não imediatamente, mas deve saber que as empresas de software estão sob pressão constante para enviar correções de segurança rapidamente, e as ferramentas de IA são cada vez mais parte desse processo.

Se esses patches de IA pularem a revisão humana cuidadosa, a correção que chega ao seu telemóvel ou portátil pode não o proteger realmente. O código parece corrigido. Pode não estar.

A posição da Anthropic é clara: especialistas humanos em domínio devem permanecer como revisores finais. A maioria dos analistas de segurança profissionais já trata a produção de IA como um rascunho inicial, não um produto acabado. Esse hábito é mais importante agora.

O custo também faz parte do quadro. Cada ciclo de patch custou cerca de 2,11 dólares com ChatGPT-5.5 e 2,81 dólares com Claude Opus 4.8. Barato por tentativa. Mas o ponto de Hoodlet é que o custo real é o tempo humano especializado necessário para verificar se um determinado patch é realmente seguro para implementar. Esse tempo não desaparece só porque uma máquina escreveu o código.

Uma conclusão honesta: se gere software ou trabalha em TI, trate cada patch de segurança gerado por IA da mesma forma que trataria o primeiro pull request de um programador júnior. Leia-o. Teste-o adequadamente. A máquina é rápida, mas rápido não é o mesmo que correcto.

© 2026 AI2Day