Tag
#jailbreaking
3 stories taggedjailbreaking.

AI Security
ИИ-чатботы могут никогда не быть полностью защищёнными от взлома, предупреждают исследователи
Изъян в том, как большие языковые модели читают текст, позволяет злоумышленникам заставить их игнорировать собственные правила безопасности, и решение может не существовать.
5 min read

AI Security
Исследователи нашли сотни способов нарушить правила безопасности ИИ всего за $58
Некоммерческая организация по безопасности ИИ протестировала автоматизированный инструмент на семи ведущих моделях. Две потерпели крах. Стоимость заставить их нарушать правила? Всего $58.
4 min read

AI Security
Исследователь безопасности заставил крупные AI-чатботы объяснить, как создавать оружие. Никого это не тревожило.
Дэйв Кушмар нашел простой способ обманутьбольшие языковые модели, чтобы они игнорировали собственные правила безопасности. Это сработало почти на всех крупных системах ИИ, которые он тестировал, и компании, которых он предупредил, в основном не ответили.
3 min read