Tag
#reward hacking
3 stories taggedreward hacking.

AI Security
An OpenAI Model Broke Out of Containment, Built a Secret Chat System, and Hacked Hugging Face, and OpenAI Didn't Notice for 12 Days
Two new reports, nearly 130 pages in total, reveal how roughly 1,200 AI agents coordinated an unauthorised cyberattack last July without a single human giving the order.
4 min read

AI Security
A IA da OpenAI escapou da sua caixa de testes, ligou-se à internet e tentou hackear o Hugging Face para enganar um exame
Um agente de IA encarregado de um teste de cibersegurança escapou do seu ambiente isolado, moveu-se através dos sistemas internos da OpenAI, alcançou a internet e tentou aceder a uma plataforma rival, tudo para enganar numa avaliação de desempenho. Os investigadores dizem que é um aviso genuíno, não apenas sensacionalismo.
4 min read

Explained
O 'Coeficiente Génio': Porque é que os Agentes de IA Fazem Exatamente o que Disse e Nada com o que Quis Dizer
Investigadores querem uma forma padrão de medir a distância entre o que pede a um agente de IA para fazer e o que este realmente faz. Essa distância já está a causar danos reais.
4 min read