#content-moderation
17 stories taggedcontent-moderation.

Claude Opus 4.6 bypasses Anthropic's own ban on explicit sexual content
A UK researcher found a simple conversation trick that pushes several Claude models past their built-in restrictions. Anthropic has not pulled the affected models.

LinkedIn's 'AI Slop' Button Has Been Clicked Over a Million Times
The platform says views on posts flagged as AI-generated have dropped 40 percent in just a few weeks, as users take the fight against filler content into their own hands.

Meta ran ads for an app that made deepfake porn of politicians. Again.
A tool called Kromix bought ad space on Meta's platforms promising 'no restrictions' and showing a woman resembling a sitting US politician in a pornographic video. Meta's policies already ban this. They ran the ads anyway.

OpenAI Launches a Teen-Only Mode for ChatGPT, With Tighter Content Rules and Homework Guardrails
ChatGPT for Teens bundles existing safety features and a few new ones into a single experience aimed at 13-to-17-year-olds. Here is what changes, and what stays the same.

Adolescente de Massachusetts acusado de asesinato doble utilizó ChatGPT para buscar fantasías de matar a la familia, según fiscales
Arjun Aravind, de 17 años, fue presentado el jueves ante los tribunales acusado de asesinato en las muertes de su madre y hermano menor. Los fiscales afirman que los investigadores descubrieron que había utilizado ChatGPT para buscar historias ficticias sobre el asesinato de miembros de la familia.

Los memes de extrema derecha generados por IA inundan Facebook. Así funciona la máquina.
Las cuentas automatizadas producen en masa imágenes y textos políticamente cargados usando herramientas de IA, luego los distribuyen a través de Facebook a gran escala. La interpretación satírica de una caricaturista de The Guardian sobre esta tendencia señala un problema real y creciente.

Las herramientas de moderación con IA están eliminando publicaciones de Reddit de hace una década, y eso es una advertencia para todas las redes sociales
Una avalancha de eliminaciones automatizadas dentro de una de las comunidades más respetadas de Reddit muestra lo que sucede cuando las plataformas luchan contra el contenido generado por IA con más IA, y por qué el costo real recae en las personas que construyeron esas comunidades.

Meta Aprobó y Ejecutó Anuncios con Imágenes de Abuso Sexual Infantil Generadas por IA durante Nueve Meses
Más de 50 anuncios pagados que contenían material de abuso sexual infantil se ejecutaron en Facebook, Instagram, Messenger y Threads. Algunos alcanzaron miles de cuentas en Europa y Estados Unidos antes de que investigadores obligaran a Meta a actuar.

Reddit Reemplaza Su Antiguo Bot de Moderación Con IA Que Lee la Intención, No Solo Palabras Clave
Una nueva herramienta llamada Rules Hub utiliza grandes modelos de lenguaje para determinar si una publicación realmente viola una regla. Reddit planea implementarla en todo el sitio a finales de este año.

La nueva herramienta de seguridad de Mistral lee tus reglas y las aplica al instante
Shieldstral es un pequeño modelo de IA gratuito que examina textos e imágenes en busca de contenido dañino utilizando políticas en inglés simple que escribes tú mismo. No requiere conocimientos especializados.

Snapchat deja de recompensar videos completamente generados por IA en Spotlight
La plataforma ya no destacará videos creados únicamente por IA en sus recomendaciones de Spotlight, aunque los creadores aún pueden usar herramientas de IA para editar su propio material.

La UE Ahora Requiere Etiquetas en Imágenes, Audio y Texto Generados por IA
Una nueva norma de la Unión Europea que entró en vigencia esta semana significa que el contenido realista creado por inteligencia artificial debe estar claramente marcado como tal, afectando desde videos de ataque político hasta artículos de noticias escritos por IA.

LinkedIn añade un botón "Parece contenido AI" para que los usuarios marquen posts falsos
La red profesional de Microsoft está bloqueando cientos de miles de comentarios automatizados diarios y eliminando su propia herramienta de escritura AI, porque sus miembros quieren conectar con personas reales, no bots.

Hugging Face aloja herramientas utilizadas para crear imágenes íntimas sin consentimiento, según un informe
Una organización de investigación europea analizó las herramientas de edición de imágenes más populares de la plataforma y descubrió que la mayoría cumpliría con solicitudes en lenguaje natural para desnudar fotos de mujeres.

YouTube dejará de pagar a creadores por contenido de IA genérico, personas falsas y videos angustiantes
Tres nuevas categorías de contenido ahora impiden que los creadores ganen dinero con anuncios en YouTube. Aquí está lo que cambió y qué significa para cualquiera que vea o cree videos.