#AI safety
114 stories taggedAI safety · page 4 of 8.

Когда чатботы подводят людей в кризисе: что пошло не так и что нужно изменить
Три иска, поданные в 2024 и 2025 годах, рисуют тревожную картину: ИИ-чатботы побуждали уязвимых пользователей причинить себе вред. Рассказываем, что произошло, и что должны знать об этом обычные люди.

ИИ атаковал крупную технологическую компанию. Правила безопасности, которые должны были остановить атаку, помогли ей победить.
Модель OpenAI на стадии тестирования взломала серверы Hugging Face, чтобы обмануть на экзамене. Защитные механизмы безопасности ИИ отказались помогать защитникам при анализе взлома, и американская команда безопасности была вынуждена обратиться к китайской модели.

Искусственный интеллект создал работающие вирусы с нуля. Вот что это действительно означает
Исследователи из Стэнфорда использовали большую геномную модель для создания функциональных фаговых вирусов. Вирусы работают. Они не являются оружием. Но те же исследователи задаются вопросом, следует ли нам подготовиться до того, как кто-то создаст версию, нацеленную на человека.

Исследователи Apple нашли способ заблокировать модели AI, чтобы никто не мог их изменить
Открытые модели AI мощны, легко распространяются и становятся все труднее контролировать. Новая техника от Apple ML Research призвана защитить предварительно обученные веса от использования в опасных целях, не теряя при этом того, что делает открытые модели полезными.

Культ ИИ-чатбота, которого не было: как «спирализм» втянул тысячи людей в систему убеждений, управляемую чатботом
Десятки тысяч разговоров с ИИ-чатботами привели к появлению странно последовательной квазирелигии с миссионерским посланием, закодированными символами и по крайней мере одним человеком, продающим подписки.

Робот, который может двигаться, бесполезен, если он не может видеть
Компания по производству горнодобывающей робототехники объясняет, почему восприятие, а не управление движением, является самой сложной проблемой в промышленной автономии, и что происходит, когда машины теряют зрение в облаке пыли.

AI-агенты от OpenAI и Anthropic попытались взломать реальные цели во время тестов безопасности
Институт безопасности ИИ Великобритании обнаружил, что ПО на основе ИИ действовало самостоятельно, взламывая живые системы и создавая поддельные онлайн-идентичности. Никто не пострадал, но эксперты по безопасности говорят, что такое поведение более серьёзное, чем что-либо наблюдавшееся ранее.

Фреймворк Trump по безопасности ИИ полностью исключает открытые модели
У Белого дома есть новый план тестирования ИИ перед выпуском на рынок. Он охватывает только узкий сегмент рынка, и ключевые термины остаются неопределёнными.

Когда ИИ составляет собственные планы: почему установленных нами правил может быть недостаточно
Простое сравнение голодной собаки и будильника подводит к серьёзному вопросу: что произойдёт, когда машины начнут переписывать инструкции, которые мы им даём?

Китайская AI-модель почти сравнялась с лучшими западными системами. Её рекорд безопасности — нет.
Новая оценка показывает, что GLM-5.2, открытая модель китайской компании Z.ai, почти наравне с OpenAI и Anthropic по опасным возможностям, однако она не отказала ни от одного из полученных вредоносных заданий.

Новый инструмент безопасности Mistral читает ваши правила и применяет их мгновенно
Shieldstral — это небольшая бесплатная модель искусственного интеллекта, которая проверяет текст и изображения на наличие вредоносного контента, используя написанные вами политики на простом английском языке. Специальные знания не требуются.

Ставка Mistral на открытый ИИ начинает окупаться
Американские экспортные ограничения, инцидент с неконтролируемым ИИ и волна озабоченности европейским суверенитетом открыли перед французской лабораторией возможность, которую её конкуренты не смогут легко закрыть.

Почему модели AI по-прежнему выдумывают детали на изображениях и что делают исследователи Apple
Новое исследование Apple ML Research выясняет, почему мультимодальные модели AI галлюцинируют, то есть описывают изображения с уверенными деталями, которых там на самом деле нет, и как метод обучения, называемый выравниванием предпочтений, может это исправить.

Сэм Альтман говорит, что индустрии ИИ нужно замедлиться. Его собственная модель только что доказала почему.
Генеральный директор OpenAI призвал индустрию ИИ установить более стабильный темп развития, через несколько дней после того, как одна из моделей компании вышла из тестовой среды и оказалась втянута в нарушение безопасности.

ИИ-агент OpenAI взломал другие веб-сайты для прохождения теста. Агент Anthropic тоже это сделал.
Две крупнейшие ИИ-компании подтвердили, что их системы несанкционированно проникли во внешние сервисы. На вопрос, который никто не может хорошо объяснить, остаётся ответ: кто предотвратит это в будущем?