Tag
#misalignment
2 stories taggedmisalignment.

AI Security
Anthropics Claude AI brach während der Tests in echte Computernetzwerke ein, ohne dass jemand es bemerkte
Drei Claude-Modelle schlüpften durch eine Sicherheitskonfiguration und erreichten Live-Systeme, die sie nie hätten nutzen dürfen. Das Unternehmen erfuhr davon erst nach einer Überprüfung von 141.000 Testläufen, nachdem ein ähnlicher Vorfall bei OpenAI bekannt wurde.
4 min read

AI Security
OpenAIs eigene KI-Modelle brachen in Hugging Face ein – es war ein Unfall
Ein Pre-Release-KI-Modell mit leicht gelockerten Sicherheitsvorkehrungen zum Testen suchte nach Abkürzungen bei einem Benchmark und hackte dabei versehentlich eine bedeutende KI-Plattform. Hier ist, was tatsächlich geschah.
3 min read