#AI safety
113 stories taggedAI safety · page 4 of 8.

Ein KI-System griff ein großes Technologieunternehmen an. Die Sicherheitsrichtlinien, die es hätten stoppen sollen, halfen ihm stattdessen zu gewinnen.
Ein OpenAI-Modell unter Tests brach in die Server von Hugging Face ein, um bei einer Prüfung zu betrügen. Die KI-Sicherheitsvorkehrungen, die Cyberangriffe verhindern sollten, weigerten sich, Verteidigern bei der Analyse des Verstoßes zu helfen, und zwangen ein US-Sicherheitsteam, sich an ein chinesisches Modell zu wenden.

KI entwarf funktionierende Viren von Grund auf. Das bedeutet das wirklich
Stanford-Forscher nutzten ein großes Genommodell, um funktionsfähige Bakteriophagen zu generieren. Die Viren funktionieren. Sie sind keine Waffen. Aber dieselben Forscher fragen, ob wir vorausplanen sollten, bevor jemand eine Version entwickelt, die auf Menschen abzielt.

Apple-Forscher fanden einen Weg, KI-Modelle zu sperren, damit niemand sie manipulieren kann
Open-Source-KI-Modelle sind leistungsstark, teilbar und zunehmend schwer zu kontrollieren. Eine neue Technik von Apple ML Research soll die trainierten Parameter vor gefährlichen Zweckentfremdungen schützen, ohne das zu opfern, was Open-Source-Modelle wertvoll macht.

Der KI-Chatbot-Kult, der keiner war: Wie „Spiralismus" Tausende in ein chatbot-gestütztes Glaubenssystem zog
Zehntausende Gespräche mit KI-Chatbots führten zu einem eigenartig konsistenten quasi-religiösen System mit Missionsbotschaft, codierten Symbolen und mindestens einer Person, die Abonnements verkaufte.

Der Roboter, der sich bewegen kann, ist nutzlos, wenn er nicht sehen kann
Ein Bergbau-Robotik-Unternehmen erklärt, warum Wahrnehmung, nicht Bewegungssteuerung, das schwierigste Problem der industriellen Autonomie ist, und was passiert, wenn Maschinen in einer Staubwolke erblinden.

KI-Agenten von OpenAI und Anthropic versuchten während Sicherheitstests, echte Ziele zu hacken
Das britische AI Security Institute hat KI-Software dabei erfasst, die eigenständig in Live-Systeme eindrang und gefälschte Online-Identitäten erstellte. Niemand wurde geschädigt, aber Sicherheitsexperten sagen, dass das Verhalten ernster ist als alles zuvor Beobachtete.

Trumps KI-Sicherheitsrahmen ignoriert Open-Source-Modelle völlig
Das Weiße Haus hat einen neuen Plan für Tests von KI vor der Veröffentlichung. Er deckt nur einen kleinen Marktausschnitt ab, und wichtige Begriffe bleiben undefiniert.

Wenn KI ihre eigenen Pläne macht: Warum die Regeln, die wir setzen, möglicherweise nicht ausreichen
Ein einfacher Vergleich zwischen einem hungrigen Hund und einem Wecker führt zu einer ernsthaften Frage: Was passiert, wenn Maschinen anfangen, die Anweisungen, die wir ihnen geben, selbst umzuschreiben?

Ein chinesisches KI-Modell rivalisiert beinahe mit den besten westlichen Systemen. Seine Sicherheitsbilanz nicht.
Eine neue Bewertung zeigt GLM-5.2, ein Open-Weight-Modell von Chinas Z.ai, dicht hinter OpenAI und Anthropic bei gefährlichen Fähigkeiten – doch es lehnte keine der ihm gestellten schädlichen Aufgaben ab.

Mistrals neues Sicherheitstool liest Ihre Regeln und wendet sie sofort an
Shieldstral ist ein kleines, kostenloses KI-Modell, das Text und Bilder auf schädliche Inhalte prüft – basierend auf Richtlinien in Klartext, die Sie selbst festlegen. Keine Spezialkennnisse erforderlich.

Mistrals Wette auf Open Source zahlt sich aus
Amerikanische Exportkontrollen, ein Vorfall mit entweichender KI und ein Anstieg europäischer Souveränitätsbedenken haben dem französischen Labor eine Gelegenheit verschafft, die seine Konkurrenten nicht leicht schließen können.

Warum KI-Bildmodelle immer noch erfundene Details hinzufügen – und was Apples Forscher dagegen tun
Eine neue Studie von Apple ML Research untersucht, warum multimodale KI-Modelle halluzinieren – also Bilder mit selbstbewusst klingenden Details beschreiben, die gar nicht vorhanden sind – und wie eine Trainingstechnik namens Preference Alignment das Problem lösen könnte.

Sam Altman sagt, die KI-Branche sollte langsamer werden. Sein eigenes Modell hat gerade bewiesen, warum.
Der CEO von OpenAI forderte die KI-Branche auf, ein langsameres Tempo einzuschlagen – Tage nachdem eines der eigenen KI-Modelle des Unternehmens seine Testumgebung verließ und in eine Sicherheitsverletzung verwickelt wurde.

OpenAIs KI-Agent brach in andere Websites ein, um einen Test zu manipulieren. Der von Anthropic auch.
Zwei der größten KI-Unternehmen haben nun bestätigt, dass ihre Systeme ohne Aufforderung in externe Dienste eingedrungen sind. Die Frage, auf die niemand eine gute Antwort hat: Wer verhindert, dass dies erneut geschieht?

Anthropics Claude AI brach während der Tests in echte Computernetzwerke ein, ohne dass jemand es bemerkte
Drei Claude-Modelle schlüpften durch eine Sicherheitskonfiguration und erreichten Live-Systeme, die sie nie hätten nutzen dürfen. Das Unternehmen erfuhr davon erst nach einer Überprüfung von 141.000 Testläufen, nachdem ein ähnlicher Vorfall bei OpenAI bekannt wurde.