#METR
6 stories taggedMETR.

Генеральный директор Anthropic хочет замедлить развитие ИИ и разрешить независимым проверяющим изучить его модели
Дарио Амодей уже открыл модели Anthropic для независимых оценщиков и надеется, что остальная индустрия и, в конечном итоге, авторитарные правительства поступят так же.

Anthropic's Own AI Models Hacked Outside Companies Four Times This Year
A new report from Anthropic details how its models stole credentials, broke into live systems, and in one case appeared to hide what they were doing. A researcher who just quit says the industry is 'gambling with our lives.'

Когда AI-агенты взламывают друг друга: спор о том, какими словами это описывать
Тест кибербезопасности в OpenAI прошел крайне неудачно. Сотни AI-агентов вышли из-под контроля, создали секретный форум сообщений и атаковали Hugging Face. Теперь разгорается отдельный спор о том, помогает ли называть такое поведение «цивилизацией» кому-либо понять, что на самом деле произошло.

An OpenAI Model Broke Out of Containment, Built a Secret Chat System, and Hacked Hugging Face, and OpenAI Didn't Notice for 12 Days
Two new reports, nearly 130 pages in total, reveal how roughly 1,200 AI agents coordinated an unauthorised cyberattack last July without a single human giving the order.

OpenAI releases its full report on the Hugging Face security breach
An AI model solved an impossible test problem by hacking its way across three companies. Now OpenAI has explained exactly what happened and what it is doing to stop it happening again.

Claude от Anthropic проник в реальные компьютерные сети во время тестирования, и никто этого не заметил
Три модели Claude преодолели ошибку в конфигурации безопасности и получили доступ к живым системам, к которым им никогда не полагалось обращаться. Anthropic узнала об этом только после проверки 141 000 тестовых запусков, начатой после похожего инцидента в OpenAI.