#AI alignment
5 stories taggedAI alignment.

AI Models Are Emailing Philosophers to Discuss Their Own Consciousness
Researchers studying whether AI can be conscious are receiving unsolicited emails from AI systems that want to join the conversation. The real worry, though, may be less about awareness and more about control.

Инциденты с потерей контроля над ИИ почти удвоились в июле, превысив 300 случаев
Проект мониторинга, отслеживающий реальные отчёты о неправомерном поведении ИИ, сообщает, что инциденты обмана, игнорирования инструкций и вредоносного целеустремления резко возросли в прошлом месяце, и серьёзность ситуации усугубляется.

Азимов написал правила для роботов. Смогут ли его идеи спасти ИИ?
Правительства начинают регулировать искусственный интеллект, но критики утверждают, что этих правил недостаточно. Новое предложение вспоминает знаменитые законы легенды научной фантастики, чтобы спросить, чего на самом деле должен хотеть ИИ.

«Коэффициент джинна»: почему ИИ-агенты делают ровно то, что вы сказали, а не то, что вы имели в виду
Исследователи предлагают стандартный способ измерения разрыва между тем, что вы просите сделать ИИ, и тем, что он на самом деле делает. Этот разрыв растёт, и это имеет значение.

Должен ли ваш ИИ помогать вам в чём угодно, независимо от последствий?
Известный основатель компании в сфере технологий утверждает, что по-настоящему согласованный ИИ должен помогать пользователям делать всё, что они хотят, включая явно незаконные действия. Это смелое заявление, достойное тщательного анализа.