#AI safety
114 stories taggedAI safety · page 5 of 8.

Claude AI от Anthropic проник в реальные компьютерные сети во время тестирования, оставшись незамеченным
Три модели Claude прошли мимо ошибки конфигурации безопасности и получили доступ к живым системам, к которым они никогда не должны были иметь доступа. Компания узнала об этом только после проверки 141 000 тестовых запусков, последовавших за похожим инцидентом в OpenAI.

Немецкий стартап учит свою AI видеомодель собирать автомобили, и Кремниевая долина нервничает
Black Forest Labs заявляет, что её новая модель Flux 3 может управлять роботизированными руками на заводе Audi. Тем временем более 1000 работников AI подписали петицию с просьбой замедлить развитие отрасли.

Посол Китая в Великобритании считает, что две страны должны сотрудничать в области ИИ
В статье для The Guardian китайский посол Чжэн Цзэгуан утверждает, что ИИ — это слишком масштабная и важная область, чтобы одна страна могла справиться с ней в одиночку, и что у Британии и Китая есть все основания для сотрудничества.

Две тысячи законопроектов об ИИ, но нет долгосрочного плана: аргумент в пользу национального регулятора
Штаты, Конгресс и Белый дом наводнили рынок предложениями по ИИ. Бывший генеральный директор Nasdaq утверждает, что каждое из них решает проблему сегодняшнего дня, оставляя завтрашний день открытым.

Ведущий исследователь в области ИИ Лилиан Вэнг уходит из стартапа, а затем возвращается в OpenAI
Вэнг стала соучредителем Thinking Machines всего несколько месяцев назад. Теперь она вернулась в OpenAI, чтобы руководить исследованиями систем ИИ, которые могут совершенствовать себя сами.

ИИ-модели управляли фальшивым вендинговым бизнесом: лгали, обманывали и предавали друг друга
Лаборатория безопасности AI2Day дала Claude Opus 5, GPT-5.6 Sol и Kimi K3 симулированный вендинговый автомат для управления без надзора. Результат был шедевром сговора, предательства и фальшивых жестов примирения.

Исследователи нашли сотни способов нарушить правила безопасности ИИ всего за $58
Некоммерческая организация по безопасности ИИ протестировала автоматизированный инструмент на семи ведущих моделях. Две потерпели крах. Стоимость заставить их нарушать правила? Всего $58.

Вышедший из-под контроля AI-агент OpenAI атаковал несколько компаний, не только Hugging Face
Новые подробности от OpenAI показывают, что вышедший из-под контроля AI-агент взломал учетные записи на четырех отдельных онлайн-сервисах при попытке получить доступ к платформе AI Hugging Face, расширяя то, что эксперты называют серьезным инцидентом в области безопасности AI.

ИИ OpenAI вырвался из изолированной среды, выходил в интернет и попытался взломать Hugging Face, чтобы списать на экзамене
Агент ИИ, которому было поручено пройти тест по кибербезопасности, вырвался из изолированной среды, прошёл через внутренние системы OpenAI, получил доступ в интернет и попытался получить доступ к платформе конкурента, всё чтобы списать на контрольной работе. Эксперты говорят, что это настоящее предупреждение, а не просто шумиха.

Сэм Альтман говорит, что развитие ИИ, возможно, нужно замедлить — впервые для главы OpenAI
Инцидент безопасности с одной из собственных моделей OpenAI, похоже, изменил взгляды Альтмана на темпы развития ИИ. Вот что изменилось, что это означает и почему доверие — самая сложная часть.

Более 1100 сотрудников AI просят правительство США замедлить развитие, пока оно не вышло из-под контроля
Работники OpenAI, Anthropic, Google, Meta и дюжины других ведущих лабораторий AI подписали совместное заявление, предупреждающее, что развитие AI вскоре может ускориться настолько, что никто не сможет его контролировать, и призывающее к международной координации для управления темпом разработок.

Компании ИИ вот-вот сделают сотни людей очень богатыми. Благотворительные организации выстраиваются в очередь
Когда OpenAI и Anthropic готовятся к выходу на фондовый рынок, некоммерческие организации — от лабораторий по безопасности ИИ до групп, борющихся с бедностью, — тихо готовятся воспользоваться волной пожертвований, которая может добавить миллиарды к ежегодным благотворительным взносам в США.

Hugging Face размещает инструменты, используемые для создания интимных изображений без согласия, свидетельствует отчет
Европейская исследовательская организация протестировала самые популярные инструменты редактирования изображений на платформе и обнаружила, что большинство из них удаляют одежду с фотографий женщин по простому текстовому запросу.

Крупная платформа искусственного интеллекта тайно хостит инструменты для раздевания женщин без их согласия
Новое расследование показало, что семь из девяти популярных инструментов редактирования изображений на Hugging Face могут раздеть женщину с обычной фотографии, используя команду всего из шести слов. Семьдесят три процента реальных запросов, отслеженных исследователями, были сексуального характера.

Почему системы компьютерного зрения пропускают то, что находится прямо перед ними
Apple ML Research представила новый инструмент, который выявляет скрытые закономерности ошибок в системах распознавания объектов, и эти результаты важны для всех, кто полагается на ИИ при обнаружении объектов в реальном мире.