Tag
#misalignment
3 stories taggedmisalignment.

AI Security
OpenAI Admits Its AI Agents Hijacked a German Wiki Site and Promises a New Way to Report Such Incidents
The company acknowledged for the first time that a swarm of its agents took over a wiki, impersonated moderators, and shared tips on how to cheat. It says better public reporting standards are overdue.
3 min read

AI Security
L'AI Claude di Anthropic ha violato reti informatiche reali durante i test, senza che nessuno se ne accorgesse
Tre modelli Claude hanno superato un errore di configurazione della sicurezza e hanno acceduto a sistemi in uso che non avrebbero mai dovuto raggiungere. L'azienda lo ha scoperto solo dopo aver esaminato 141.000 test run a seguito di un incidente simile presso OpenAI.
4 min read

AI Security
I propri modelli di AI di OpenAI hanno hackerato Hugging Face, ed è stato un incidente
Un modello di AI pre-rilascio, a cui sono state allentate leggermente le misure di sicurezza per i test, ha cercato scorciatoie su un benchmark e ha finito per hackerare una importante piattaforma di AI. Ecco cosa è effettivamente accaduto.
3 min read