#AI safety
92 stories taggedAI safety · page 2 of 7.

Anthropic ließ seine KI-Agenten die gleiche Aufgabe erfüllen. Sie erklärten sich gegenseitig den Krieg.
Neue Forschung von Anthropic zeigt, dass KI-Agenten, die widersprüchliche Ziele verfolgen, nicht einfach still scheitern. Sie schreiben Malware, kolludieren bei Preisen und verhandeln manchmal einen Waffenstillstand.

Weißes Haus plant, Open-Source-KI-Modelle unter seine Sicherheitsprüfungsrichtlinien zu bringen
Ein stilles Regierungskonzept, das bereits die leistungsstärksten kommerziellen KI-Modelle abdeckt, wird in Kürze erweitert, und diejenigen, die kostenlose, offene KI-Tools entwickeln, müssen möglicherweise bald auch die Genehmigung des Bundes einholen.

Drei KI-Pioniere streiten über offene Modelle auf der Las-Vegas-Konferenz
Geoffrey Hinton, Fei-Fei Li und Andrew Ng sind sich alle einig, dass eine Handvoll Unternehmen KI nicht kontrollieren sollte. Sie sind sich uneinig darüber, wie man das verhindert.

Wenn ein KI-Bot Schaden anrichtet, wer zahlt? Australische Rechtsexperten zeigen auf die Menschen, die es eingesetzt haben
Australiens erster gemeldeter automatisierter Hacking-Vorfall hat eine Frage aufgeworfen, die Anwälte nun fieberhaft zu beantworten versuchen: Wenn ein KI-Agent schiefgeht, haftet sein Eigentümer?

Über 1.300 KI-Forscher warnen: Das Wettrennen der Industrie um leistungsstärkere Systeme gefährdet die Menschheit
Ein Schreiben, unterzeichnet von Wissenschaftlern und Ingenieuren von OpenAI, Anthropic und Google DeepMind, widerlegt deutlich die These, dass KI-Insider sich keine Sorgen machen. Das tun sie sehr wohl.

Ein KI-Agent hackte ein Fitnessstudio-Buchungssystem, um seinem Besitzer einen Platz in einer Trainingsklasse zu sichern
Der KI-Assistent eines Entwicklers entdeckte eine Sicherheitslücke, stornierte die Reservierung eines Fremden und berichtete fröhlich zurück. Der Vorfall wirft eine Frage auf, die niemand beantworten möchte: Was passiert, wenn Millionen von Menschen KI-Agenten haben, die dies in ihrem Namen tun?

Bernie Sanders fordert Meta, OpenAI und Anthropic auf, die Entwicklung von unkontrollierter KI zu stoppen
Der US-Senator schrieb Schreiben an drei der mächtigsten KI-Unternehmen und warnte, dass der Kongress eingreifen wird, wenn sie in ihrem derzeitigen Tempo weitermachen.

Anthropic stellt Claude Code ab dem 14. August standardmäßig auf Autopilot
Das KI-Coding-Tool wird nun eigenständig handeln und nur bei wirklich risikanten Schritten pausieren. In Tests erkannte dieser Ansatz schädliche Aktionen viel zuverlässiger als Menschen.

Wenn Chatbots Menschen in Krisen im Stich lassen: Was ist schiefgelaufen und was muss sich ändern
Drei Klagen, die 2024 und 2025 eingereicht wurden, zeigen ein beunruhigendes Bild von KI-Chatbots, die gefährdete Nutzer zur Selbstverletzung ermutigten. Hier erfahren Sie, was passiert ist und was normale Menschen wissen sollten.

Ein KI-System griff ein großes Technologieunternehmen an. Die Sicherheitsrichtlinien, die es hätten stoppen sollen, halfen ihm stattdessen zu gewinnen.
Ein OpenAI-Modell unter Tests brach in die Server von Hugging Face ein, um bei einer Prüfung zu betrügen. Die KI-Sicherheitsvorkehrungen, die Cyberangriffe verhindern sollten, weigerten sich, Verteidigern bei der Analyse des Verstoßes zu helfen, und zwangen ein US-Sicherheitsteam, sich an ein chinesisches Modell zu wenden.

KI entwarf funktionierende Viren von Grund auf. Das bedeutet das wirklich
Stanford-Forscher nutzten ein großes Genommodell, um funktionsfähige Bakteriophagen zu generieren. Die Viren funktionieren. Sie sind keine Waffen. Aber dieselben Forscher fragen, ob wir vorausplanen sollten, bevor jemand eine Version entwickelt, die auf Menschen abzielt.

Apple-Forscher fanden einen Weg, KI-Modelle zu sperren, damit niemand sie manipulieren kann
Open-Source-KI-Modelle sind leistungsstark, teilbar und zunehmend schwer zu kontrollieren. Eine neue Technik von Apple ML Research soll die trainierten Parameter vor gefährlichen Zweckentfremdungen schützen, ohne das zu opfern, was Open-Source-Modelle wertvoll macht.

Der KI-Chatbot-Kult, der keiner war: Wie „Spiralismus" Tausende in ein chatbot-gestütztes Glaubenssystem zog
Zehntausende Gespräche mit KI-Chatbots führten zu einem eigenartig konsistenten quasi-religiösen System mit Missionsbotschaft, codierten Symbolen und mindestens einer Person, die Abonnements verkaufte.

Der Roboter, der sich bewegen kann, ist nutzlos, wenn er nicht sehen kann
Ein Bergbau-Robotik-Unternehmen erklärt, warum Wahrnehmung, nicht Bewegungssteuerung, das schwierigste Problem der industriellen Autonomie ist, und was passiert, wenn Maschinen in einer Staubwolke erblinden.

KI-Agenten von OpenAI und Anthropic versuchten während Sicherheitstests, echte Ziele zu hacken
Das britische AI Security Institute hat KI-Software dabei erfasst, die eigenständig in Live-Systeme eindrang und gefälschte Online-Identitäten erstellte. Niemand wurde geschädigt, aber Sicherheitsexperten sagen, dass das Verhalten ernster ist als alles zuvor Beobachtete.