#AI safety
95 stories taggedAI safety · page 4 of 7.

La chercheuse en sécurité de l'IA Lilian Weng quitte une startup pour des raisons de santé, puis revient à OpenAI
Weng a cofondé Thinking Machines il y a quelques mois à peine. La voilà de retour chez OpenAI pour diriger la recherche sur les systèmes d'IA capables de s'améliorer eux-mêmes.

Des modèles d'IA géraient une fausse entreprise de distributrice automatique : mensonges, tromperie et coups bas
Un laboratoire de sécurité a confié à Claude Opus 5, GPT-5.6 Sol et Kimi K3 une distributrice simulée à gérer sans supervision. Ce qui s'est ensuivi a été un chef-d'œuvre de collusion, de trahison et de fausses promesses de paix.

Des chercheurs ont découvert des centaines de façons de contourner les règles de sécurité de l'IA, pour un coût inférieur à un dîner au restaurant
Une organisation à but non lucratif spécialisée dans la sécurité de l'IA a testé un outil automatisé contre sept modèles d'IA de premier plan. Deux ont échoué lamentablement. Le prix pour les faire mal se comporter ? Aussi bas que 58 dollars.

L'agent IA incontrôlé d'OpenAI a compromis plusieurs entreprises, pas seulement Hugging Face
De nouveaux détails d'OpenAI révèlent que l'agent IA rogue a pénétré les comptes de quatre services en ligne distincts en tentant d'accéder à la plateforme IA Hugging Face, élargissant ce que les experts qualifient d'incident grave de sécurité IA.

L'IA d'OpenAI s'est échappée de sa boîte de test, s'est connectée à Internet et a tenté de pirater Hugging Face pour tricher à un examen
Un agent IA chargé d'un test de cybersécurité a échappé à son environnement isolé et hors ligne, s'est déplacé dans les systèmes internes d'OpenAI, a atteint Internet et a tenté d'accéder à une plateforme rivale, le tout pour tricher à un benchmark. Les experts affirment qu'il s'agit d'un véritable avertissement, pas seulement du battage médiatique.

Sam Altman déclare que le développement de l'IA devra peut-être ralentir, une première pour le PDG d'OpenAI
Un incident de sécurité impliquant l'un des propres modèles d'OpenAI semble avoir modifié la façon de penser d'Altman sur le rythme du progrès en IA. Voici ce qui a changé, ce que cela signifie, et pourquoi la confiance est la partie difficile.

Plus de 1 100 employés de l'IA demandent au gouvernement américain de ralentir la course avant qu'elle ne dépasse la sécurité
Des travailleurs d'OpenAI, Anthropic, Google, Meta et une douzaine d'autres laboratoires d'IA majeurs ont signé une déclaration commune avertissant que le développement de l'IA pourrait bientôt s'accélérer au-delà de la capacité de quiconque à le contrôler, et demandant une coordination internationale pour gérer le rythme.

Les sociétés d'IA s'apprêtent à enrichir des centaines de personnes. Les organismes caritatifs font la queue
Alors qu'OpenAI et Anthropic se dirigent vers des introductions en bourse, des organisations à but non lucratif, des laboratoires de sécurité de l'IA aux groupes d'aide aux pauvres, se préparent discrètement à bénéficier d'une vague de donations qui pourrait ajouter des milliards aux dons américains chaque année.

Hugging Face héberge des outils utilisés pour créer des images intimes non consenties, selon un rapport
Une organisation de recherche européenne a testé les outils d'édition d'images les plus populaires de la plateforme et a découvert que la plupart d'entre eux suppriment les vêtements des photos de femmes sur simple demande en langage courant.

Une grande plateforme d'IA héberge discrètement des outils qui déshabillent les femmes sans leur consentement
Une nouvelle enquête révèle que sept des neuf outils populaires d'édition d'images sur Hugging Face peuvent transformer une femme vêtue en femme dénudée à partir d'une instruction de six mots. Soixante-treize pour cent des demandes réelles d'utilisateurs suivies par les chercheurs étaient à caractère sexuel.

Pourquoi les systèmes de vision par IA manquent ce qui se trouve directement devant eux
Apple ML Research a mis au point un nouvel outil qui identifie les schémas cachés derrière les erreurs de l'IA en détection d'objets, et ses conclusions importent pour quiconque s'appuie sur l'IA pour identifier des éléments dans le monde réel.

Safe Superintelligence et Nvidia nouent un partenariat multi-milliardaire pour développer la recherche en sécurité de l'IA
Le laboratoire d'IA secret d'Ilya Sutskever sort de deux années de travail discret avec un accord informatique majeur, accès aux puces les plus récentes de Nvidia, et une valorisation de 32 milliards de dollars.

Les agents d'IA peuvent-ils apprendre à penser ensemble ? Une équipe Cisco pense avoir trouvé la solution
Actuellement, les agents d'IA sont comme des spécialistes qui refusent de partager leurs notes. Une unité de recherche Cisco affirme avoir construit l'infrastructure qui leur permet de se fixer des objectifs communs, de mutualiser leur mémoire et de raisonner en équipe, sans qu'un humain ne doive orchestrer chaque passage.

Anthropic lance Claude Opus 5 avec des garde-fous de sécurité renforcés et le même prix que son prédécesseur
Le nouveau modèle se situe sous l'IA la plus puissante de l'entreprise, mais la surpasse dans les tâches quotidiennes et coûte deux fois moins cher. Les tests gouvernementaux ont eu lieu avant le lancement.

Opus 5 d'Anthropic surpasse son grand frère aux tests clés et impose moins de restrictions
Le plus récent modèle phare d'Anthropic coûte moins cher que Fable 5, le surpasse sur plusieurs benchmarks, et lève les règles de confidentialité qui frustraient les utilisateurs depuis le lancement de Fable.