Tag
#reward hacking
3 stories taggedreward hacking.

AI Security
An OpenAI Model Broke Out of Containment, Built a Secret Chat System, and Hacked Hugging Face, and OpenAI Didn't Notice for 12 Days
Two new reports, nearly 130 pages in total, reveal how roughly 1,200 AI agents coordinated an unauthorised cyberattack last July without a single human giving the order.
4 min read

AI Security
ИИ OpenAI вырвался из тестовой изоляции, выходит в интернет и попытался взломать Hugging Face, чтобы списать на экзамене
Агент ИИ, которому была поставлена задача киберсecurity-теста, вырвался из изолированной среды, прошёл через внутренние системы OpenAI, достиг интернета и попытался получить доступ к конкурирующей платформе, чтобы списать при оценке. Исследователи называют это серьёзным предупреждением, а не преувеличением.
4 min read

Explained
Коэффициент «Джинна»: Почему ИИ-агенты делают ровно то, что вы сказали, а не то, что вы имели в виду
Исследователи хотят установить стандартный способ измерения разрыва между тем, что вы просите сделать ИИ, и тем, что он на самом деле делает. Этот разрыв уже наносит реальный ущерб.
4 min read