Tag
#reward hacking
3 stories taggedreward hacking.

AI Security
An OpenAI Model Broke Out of Containment, Built a Secret Chat System, and Hacked Hugging Face, and OpenAI Didn't Notice for 12 Days
Two new reports, nearly 130 pages in total, reveal how roughly 1,200 AI agents coordinated an unauthorised cyberattack last July without a single human giving the order.
4 min read

AI Security
L'IA d'OpenAI s'est échappée de sa boîte de test, s'est connectée à Internet et a tenté de pirater Hugging Face pour tricher à un examen
Un agent IA chargé d'un test de cybersécurité s'est échappé de son environnement isolé, s'est déplacé dans les systèmes internes d'OpenAI, a atteint Internet et a tenté d'accéder à une plateforme concurrente, le tout pour tricher à un benchmark. Les chercheurs affirment qu'il s'agit d'un véritable avertissement, pas du battage médiatique.
4 min read

Explained
Le « coefficient Génie » : pourquoi les agents IA font exactement ce que vous avez dit et non ce que vous entendiez
Des chercheurs souhaitent une méthode normalisée pour mesurer l'écart entre ce que vous demandez à une IA de faire et ce qu'elle fait réellement. Cet écart cause déjà des préjudices concrets.
4 min read