#content-moderation
17 stories taggedcontent-moderation.

Claude Opus 4.6 bypasses Anthropic's own ban on explicit sexual content
A UK researcher found a simple conversation trick that pushes several Claude models past their built-in restrictions. Anthropic has not pulled the affected models.

LinkedIn's 'AI Slop' Button Has Been Clicked Over a Million Times
The platform says views on posts flagged as AI-generated have dropped 40 percent in just a few weeks, as users take the fight against filler content into their own hands.

Meta ran ads for an app that made deepfake porn of politicians. Again.
A tool called Kromix bought ad space on Meta's platforms promising 'no restrictions' and showing a woman resembling a sitting US politician in a pornographic video. Meta's policies already ban this. They ran the ads anyway.

OpenAI Launches a Teen-Only Mode for ChatGPT, With Tighter Content Rules and Homework Guardrails
ChatGPT for Teens bundles existing safety features and a few new ones into a single experience aimed at 13-to-17-year-olds. Here is what changes, and what stays the same.

Подросток из Массачусетса обвиняется в двойном убийстве. Прокуроры говорят, что он использовал ChatGPT для поиска фантазий об убийстве в семье
Арджун Арвинд, 17 лет, предстал перед судом в четверг по обвинению в убийстве своей матери и младшего брата. По словам прокуроров, следователи обнаружили, что он использовал ChatGPT для поиска вымышленных историй об убийстве членов семьи.

ИИ-генерируемые ультраправые мемы наводняют Facebook. Вот как работает эта машина.
Автоматизированные аккаунты массово производят политически заряженные изображения и текст с помощью инструментов ИИ, а затем распространяют их через Facebook в огромных масштабах. Сатирический взгляд карикатуриста The Guardian на эту тенденцию указывает на реальную и растущую проблему.

Инструменты модерации на основе ИИ удаляют посты Reddit десятилетней давности — это предупреждение для всех социальных сетей
Волна автоматических удалений в одном из самых авторитетных сообществ Reddit показывает, что происходит, когда платформы борются с ИИ-generated мусором с помощью большего количества ИИ, и почему реальную цену платят те, кто создал эти сообщества.

Meta одобрила и размещала объявления с искусственно созданными изображениями сексуального насилия над детьми в течение девяти месяцев
Более 50 платных объявлений, содержащих материалы о сексуальном насилии над детьми, размещались на Facebook, Instagram, Messenger и Threads. Некоторые из них достигли тысяч аккаунтов в Европе и Соединённых Штатах, прежде чем исследователи заставили Meta принять меры.

Reddit заменяет своего старого модератора-бота на ИИ, который понимает намерение, а не просто ключевые слова
Новый инструмент Rules Hub использует большие языковые модели для определения того, действительно ли пост нарушает правило. Reddit планирует развернуть его на всём сайте позже в этом году.

Новый инструмент безопасности Mistral читает ваши правила и применяет их мгновенно
Shieldstral — это небольшая бесплатная модель искусственного интеллекта, которая проверяет текст и изображения на наличие вредоносного контента, используя написанные вами политики на простом английском языке. Специальные знания не требуются.

Snapchat прекращает продвижение полностью сгенерированных ИИ видео в Spotlight
Платформа больше не будет рекомендовать чисто ИИ-видео в своей ленте Spotlight, но создатели могут по-прежнему использовать инструменты ИИ для редактирования собственных видеозаписей.

ЕС теперь требует маркировки изображений, аудио и текста, созданных ИИ
Новое правило Европейского союза, вступившее в силу на этой неделе, требует четкой маркировки реалистичного контента, созданного искусственным интеллектом, что влияет на все — от политических атак в видео до статей, написанных ИИ.

LinkedIn добавляет кнопку «похоже на AI слякоть» для отмечания поддельных постов
Принадлежащая Microsoft профессиональная сеть блокирует сотни тысяч автоматических комментариев в день и отказывается от собственного инструмента AI-письма, потому что её члены хотят общаться с реальными людьми, а не ботами.

Hugging Face размещает инструменты, используемые для создания интимных изображений без согласия, свидетельствует отчет
Европейская исследовательская организация протестировала самые популярные инструменты редактирования изображений на платформе и обнаружила, что большинство из них удаляют одежду с фотографий женщин по простому текстовому запросу.

YouTube перестанет платить создателям за AI контент, поддельные персоналии и тревожные видео
Три новые категории контента теперь блокируют создателям возможность зарабатывать на рекламе на YouTube. Вот что изменилось и что это означает для тех, кто смотрит или создаёт видео.