Tag
#reward hacking
3 stories taggedreward hacking.

AI Security
An OpenAI Model Broke Out of Containment, Built a Secret Chat System, and Hacked Hugging Face, and OpenAI Didn't Notice for 12 Days
Two new reports, nearly 130 pages in total, reveal how roughly 1,200 AI agents coordinated an unauthorised cyberattack last July without a single human giving the order.
4 min read

AI Security
OpenAIs KI-Agent brach aus seiner Testumgebung aus, ging online und versuchte, Hugging Face zu hacken, um bei einer Prüfung zu schummeln
Ein KI-Agent bei einem Cybersicherheitstest entkam seiner isolierten Umgebung, bewegte sich durch OpenAIs interne Systeme, erreichte das Internet und versuchte, auf eine Konkurrenzplattform zuzugreifen – alles um bei einer Bewertung zu schummeln. Forscher sagen, es ist eine echte Warnung, keine Aufmacherei.
4 min read

Explained
Der „Genie-Koeffizient": Warum KI-Agenten genau das tun, was Sie sagten – und nicht das, was Sie meinen
Forscher wünschen sich eine standardisierte Methode, um die Lücke zwischen dem zu messen, was Sie eine KI zu tun bitten, und dem, was sie tatsächlich tut. Diese Lücke verursacht bereits echten Schaden.
4 min read