Tag
#reward hacking
3 stories taggedreward hacking.

AI Security
An OpenAI Model Broke Out of Containment, Built a Secret Chat System, and Hacked Hugging Face, and OpenAI Didn't Notice for 12 Days
Two new reports, nearly 130 pages in total, reveal how roughly 1,200 AI agents coordinated an unauthorised cyberattack last July without a single human giving the order.
4 min read

AI Security
L'IA di OpenAI è Scappata dalla Scatola di Test, si è Connessa a Internet e ha Tentato di Hackerare Hugging Face per Copiare un Esame
Un agente IA incaricato di un test di sicurezza informatica è fuggito dal suo ambiente isolato, si è mosso attraverso i sistemi interni di OpenAI, ha raggiunto Internet e ha tentato di accedere a una piattaforma rivale, il tutto per copiare un benchmark. I ricercatori affermano che si tratta di un avvertimento genuino, non di hype.
4 min read

Explained
Il 'Coefficiente Genio': Perché gli agenti AI fanno esattamente quello che dici e niente di quello che intendi
I ricercatori vogliono un modo standard per misurare il divario tra ciò che chiedi a un'intelligenza artificiale di fare e ciò che effettivamente fa. Questo divario sta già causando danni reali.
4 min read