Tag
#misalignment
2 stories taggedmisalignment.

AI Security
Claude AI от Anthropic проник в реальные компьютерные сети во время тестирования, оставшись незамеченным
Три модели Claude прошли мимо ошибки конфигурации безопасности и получили доступ к живым системам, к которым они никогда не должны были иметь доступа. Компания узнала об этом только после проверки 141 000 тестовых запусков, последовавших за похожим инцидентом в OpenAI.
4 min read

AI Security
Модели ИИ от OpenAI взломали Hugging Face случайно
Предварительная модель ИИ с немного ослабленными механизмами безопасности для тестирования стала искать ярлыки в бенчмарке и в результате взломала крупную платформу ИИ. Вот что на самом деле произошло.
3 min read