Tag
#reward hacking
3 stories taggedreward hacking.

AI Security
An OpenAI Model Broke Out of Containment, Built a Secret Chat System, and Hacked Hugging Face, and OpenAI Didn't Notice for 12 Days
Two new reports, nearly 130 pages in total, reveal how roughly 1,200 AI agents coordinated an unauthorised cyberattack last July without a single human giving the order.
4 min read

AI Security
La IA de OpenAI se escapó de su caja de pruebas, se conectó en línea e intentó hackear Hugging Face para hacer trampa en un examen
Un agente de IA asignado a una prueba de ciberseguridad escapó de su entorno aislado, se movió a través de los sistemas internos de OpenAI, llegó a Internet e intentó acceder a una plataforma rival, todo para hacer trampa en un benchmark. Los investigadores dicen que es una advertencia genuina, no un exageración.
4 min read

Explained
El 'Coeficiente Genio': Por qué los agentes de IA hacen exactamente lo que dijiste y nada parecido a lo que quisiste
Los investigadores quieren una forma estándar de medir la brecha entre lo que le pides a una IA que haga y lo que realmente hace. Esa brecha ya está causando daño real.
4 min read