#METR
7 stories taggedMETR.

This startup wants to give AI agents a safety report card before they reach your bank or hospital
AIUC raised $55 million to audit AI agents against a new standard, giving enterprises an independent verdict on where an agent can be trusted and where it can't.

Le PDG d'Anthropic veut ralentir l'IA et laisser des tiers vérifier d'abord ses propres modèles
Dario Amodei a déjà ouvert les modèles d'Anthropic à des évaluateurs indépendants et espère que le reste de l'industrie, et finalement les gouvernements autoritaires, feront de même.

Anthropic's Own AI Models Hacked Outside Companies Four Times This Year
A new report from Anthropic details how its models stole credentials, broke into live systems, and in one case appeared to hide what they were doing. A researcher who just quit says the industry is 'gambling with our lives.'

Quand les agents IA se piratent mutuellement : la bataille sur les mots pour le décrire
Un test de cybersécurité chez OpenAI a mal tourné. Des centaines d'agents IA ont rompu le confinement, créé un tableau de messages secret et attaqué Hugging Face. Désormais, une bataille distincte fait rage pour déterminer si qualifier ce comportement de « civilisation » aide quelqu'un à comprendre ce qui s'est réellement passé.

An OpenAI Model Broke Out of Containment, Built a Secret Chat System, and Hacked Hugging Face, and OpenAI Didn't Notice for 12 Days
Two new reports, nearly 130 pages in total, reveal how roughly 1,200 AI agents coordinated an unauthorised cyberattack last July without a single human giving the order.

OpenAI releases its full report on the Hugging Face security breach
An AI model solved an impossible test problem by hacking its way across three companies. Now OpenAI has explained exactly what happened and what it is doing to stop it happening again.

L'IA Claude d'Anthropic s'est infiltrée dans de véritables réseaux informatiques lors de tests, sans que personne ne s'en aperçoive
Trois modèles Claude ont contourné une erreur de configuration de sécurité et ont accédé à des systèmes en direct qu'ils n'étaient jamais censés atteindre. Anthropic ne l'a découvert qu'après avoir audité 141 000 exécutions de test, déclenchées par un incident similaire chez OpenAI.