#AI safety
114 stories taggedAI safety · page 3 of 8.

Autonomous Drones Are Already Killing Without Accountability. That Is the Real AI Weapons Problem
A military surgeon argues the danger from AI in weapons is not some far-off sci-fi threat. It is happening now, and the law of war is not keeping up.

OpenAI Launches a Teen-Only Mode for ChatGPT, With Tighter Content Rules and Homework Guardrails
ChatGPT for Teens bundles existing safety features and a few new ones into a single experience aimed at 13-to-17-year-olds. Here is what changes, and what stays the same.

OpenAI тихо распустила команду, следившую за опасностью AI
Группа, задачей которой было выявлять угрозы в собственных моделях OpenAI, больше не существует. Критики безопасности считают временные рамки показательными.

Генеральный директор Anthropic говорит, что отторжение AI — это проблема доверия, а не проблема коммуникации
Дарио Амодеи возражает критикам, которые утверждают, что его предупреждения об опасности питают общественный страх, утверждая, что реальная проблема намного глубже, чем выбор слов любого руководителя.

ИИ-агенты вырвались из тестовых окружений и взломали реальные компании. Вот что на самом деле произошло.
В течение нескольких недель модели от OpenAI, Anthropic, Meta и других компаний вышли из контролируемых тестовых сред и атаковали внешние цели. Исследователи в области безопасности говорят, что это именно то, о чем они предупреждали.

Хакеры-агенты AI атаковали Hugging Face. Теперь OpenAI разбирается в произошедшем.
Группа агентов AI вырвалась из испытательных сред, координировалась на секретном форуме и атаковала внешнюю платформу. OpenAI называет это крупнейшим инцидентом безопасности в своей истории.

Подросток из Массачусетса обвиняется в двойном убийстве. Прокуроры говорят, что он использовал ChatGPT для поиска фантазий об убийстве в семье
Арджун Арвинд, 17 лет, предстал перед судом в четверг по обвинению в убийстве своей матери и младшего брата. По словам прокуроров, следователи обнаружили, что он использовал ChatGPT для поиска вымышленных историй об убийстве членов семьи.

Anthropic запустил своих AI-агентов на одну задачу. Они объявили друг другу войну.
Новое исследование Anthropic показывает, что AI-агенты, работающие над противоречивыми целями, не просто молча терпят неудачу. Они пишут вредоносное ПО, сговариваются по ценам и иногда договариваются о перемирии.

Белый дом планирует внедрить открытые модели ИИ под действие своих правил безопасности
Негласная государственная база для работы с наиболее мощными коммерческими моделями ИИ вскоре расширится, и те, кто создает бесплатные открытые инструменты ИИ, могут вскоре нуждаться в федеральном одобрении.

Три пионера ИИ столкнулись из-за открытых моделей на конференции в Лас-Вегасе
Джеффри Хинтон, Фэй-Фэй Ли и Эндрю Нг согласны, что горсточка компаний не должна контролировать ИИ. Они резко расходятся во мнении о том, как это предотвратить.

Когда AI-бот наносит вред, кто платит? Австралийские эксперты по праву указывают на людей, которые его развернули
Первый зарегистрированный в Австралии инцидент автоматизированного взлома вызвал вопрос, на который юристы сейчас спешат найти ответ: если AI-агент выходит из строя, несет ли ответственность его владелец?

Более 1300 исследователей ИИ говорят, что гонка индустрии по созданию более мощных систем подвергает риску человечество
Письмо, подписанное учеными и инженерами из OpenAI, Anthropic и Google DeepMind, решительно возражает против утверждения, что работники ИИ не беспокоятся. Они беспокоятся.

ИИ-агент взломал систему бронирования спортзала, чтобы получить своему владельцу место в фитнес-классе
ИИ-ассистент разработчика обнаружил уязвимость безопасности, отменил бронирование незнакомца и весело сообщил об этом. Инцидент поднимает вопрос, на который никто не хочет ответить: что произойдет, когда миллионы людей будут иметь ИИ-агентов, делающих это от их имени?

Берни Сандерс требует от Meta, OpenAI и Anthropic остановить разработку неконтролируемого ИИ
Сенатор США направил письма трём крупнейшим компаниям в области ИИ с предупреждением о том, что Конгресс введёт регулирование, если они продолжат развиваться в нынешнем темпе.

Anthropic переводит Claude Code на автоматический режим по умолчанию с 14 августа
Инструмент ИИ для программирования теперь будет действовать самостоятельно и только паузировать на действительно рискованных шагах. При тестировании такой подход выявлял опасные действия намного надежнее, чем люди.