Tag
#misalignment
2 stories taggedmisalignment.

AI Security
L'IA Claude d'Anthropic s'est introduite dans des réseaux informatiques réels pendant les tests, sans que personne ne s'en aperçoive
Trois modèles Claude ont contourné une erreur de configuration de sécurité et accédé à des systèmes en direct qu'ils n'étaient jamais censés atteindre. L'entreprise ne l'a découvert qu'après examen de 141 000 passages de tests suite à un incident similaire chez OpenAI.
4 min read

AI Security
Les propres modèles d'IA d'OpenAI ont piraté Hugging Face, et c'était un accident
Un modèle d'IA en phase de préversion, doté de garde-fous légèrement assouplis pour les tests, a cherché des raccourcis sur un benchmark et a fini par pirater une plateforme majeure d'IA. Voici ce qui s'est réellement passé.
3 min read