#content-moderation
17 stories taggedcontent-moderation.

Claude Opus 4.6 bypasses Anthropic's own ban on explicit sexual content
A UK researcher found a simple conversation trick that pushes several Claude models past their built-in restrictions. Anthropic has not pulled the affected models.

LinkedIn's 'AI Slop' Button Has Been Clicked Over a Million Times
The platform says views on posts flagged as AI-generated have dropped 40 percent in just a few weeks, as users take the fight against filler content into their own hands.

Meta ran ads for an app that made deepfake porn of politicians. Again.
A tool called Kromix bought ad space on Meta's platforms promising 'no restrictions' and showing a woman resembling a sitting US politician in a pornographic video. Meta's policies already ban this. They ran the ads anyway.

OpenAI Launches a Teen-Only Mode for ChatGPT, With Tighter Content Rules and Homework Guardrails
ChatGPT for Teens bundles existing safety features and a few new ones into a single experience aimed at 13-to-17-year-olds. Here is what changes, and what stays the same.

Un adolescent du Massachusetts accusé de double meurtre aurait utilisé ChatGPT pour rechercher des fantasmes de tuerie familiale, selon les procureurs
Arjun Aravind, 17 ans, a comparu jeudi pour répondre d'accusations de meurtre dans les décès de sa mère et de son jeune frère. Les procureurs affirment que les enquêteurs ont découvert qu'il avait utilisé ChatGPT pour rechercher des histoires fictives sur le meurtre de membres de la famille.

Les mèmes d'extrême droite générés par l'IA inondent Facebook. Voici comment fonctionne la machine.
Des comptes automatisés produisent en masse des images et des textes politiquement chargés à l'aide d'outils d'IA, puis les diffusent massivement sur Facebook. Une interprétation satirique de cette tendance par un caricaturiste du Guardian pointe un problème réel et croissant.

Les outils de modération IA suppriment des publications Reddit vieilles d'une décennie, et c'est un avertissement pour tous les réseaux sociaux
Une vague de suppressions automatisées dans l'une des communautés les plus respectées de Reddit montre ce qui se passe quand les plateformes combattent les contenus générés par l'IA avec davantage d'IA, et pourquoi le vrai coût retombe sur ceux qui ont construit ces communautés.

Meta a approuvé et diffusé des annonces montrant des images de pédopornographie générées par l'IA pendant neuf mois
Plus de 50 annonces payantes contenant du matériel d'exploitation sexuelle d'enfants ont été diffusées sur Facebook, Instagram, Messenger et Threads. Certaines ont atteint des milliers de comptes en Europe et aux États-Unis avant que des chercheurs ne forcent la main à Meta.

Reddit remplace son ancien bot de modération par une IA qui comprend l'intention, pas seulement les mots-clés
Un nouvel outil appelé Rules Hub utilise des modèles de langage de grande taille pour juger si une publication viole réellement une règle. Reddit prévoit de le déployer sur l'ensemble du site plus tard cette année.

Le nouvel outil de sécurité de Mistral lit vos règles et les applique instantanément
Shieldstral est un petit modèle d'IA gratuit qui analyse le texte et les images pour détecter les contenus nuisibles en utilisant les politiques en langage naturel que vous rédigez vous-même. Aucune connaissance spécialisée requise.

Snapchat cesse de récompenser les vidéos entièrement générées par l'IA sur Spotlight
La plateforme ne mettra plus en avant les vidéos produites exclusivement par l'IA dans ses recommandations Spotlight, bien que les créateurs puissent toujours utiliser des outils d'IA pour modifier leurs propres contenus.

L'UE exige désormais des étiquettes sur les images, l'audio et le texte générés par l'IA
Une nouvelle règle de l'Union européenne entrée en vigueur cette semaine signifie que le contenu réaliste créé par l'intelligence artificielle doit être clairement marqué comme tel, affectant tout, des vidéos politiques d'attaque aux articles d'actualité écrits par l'IA.

LinkedIn ajoute un bouton « Ça ressemble à du contenu IA générique » pour signaler les faux messages
Le réseau professionnel détenu par Microsoft bloque des centaines de milliers de commentaires automatisés par jour et abandonne son propre outil de rédaction IA, car ses membres veulent entendre de vraies personnes, pas des bots.

Hugging Face héberge des outils utilisés pour créer des images intimes non consenties, selon un rapport
Une organisation de recherche européenne a testé les outils d'édition d'images les plus populaires de la plateforme et a découvert que la plupart d'entre eux suppriment les vêtements des photos de femmes sur simple demande en langage courant.

YouTube cessera de rémunérer les créateurs pour les contenus IA génériques, les faux avatars et les vidéos perturbantes
Trois nouvelles catégories de contenu bloquent désormais les créateurs de gagner de l'argent publicitaire sur YouTube. Voici ce qui a changé et ce que cela signifie pour tous ceux qui regardent ou créent des vidéos.