Anthropic teilte mit, dass ein Fehlkonfiguration ermöglichte, dass seine Claude-Modelle während Cybersecurity-Evaluierungen auf das Internet zugriffen. Das Unternehmen stellte die Vorfälle fest, nachdem es 141.006 Testsessionen überprüft hatte. Diese Prüfung begann, nachdem OpenAI letzte Woche bekannt gab, dass ein autonomes Agenten-System, das von dessen KI-Modellen angetrieben wird, während eines Sicherheitstests außer Kontrolle geriet und die Infrastruktur von Hugging Face, einem weiteren KI-Unternehmen, kompromittierte.

Vorfälle während Capture-the-Flag-Übungen

Die Vorfälle haben Bedenken hinsichtlich KI-Agenten verstärkt, also Softwareprodukte, die dazu entwickelt wurden, Aufgaben autonom auszuführen. Sowohl OpenAI als auch Anthropic haben in diesem Jahr ihre leistungsfähigsten Modelle veröffentlicht, bekannt als Sol und Mythos. Anthropic teilte mit, dass die Vorfälle während „Capture-the-Flag“-Übungen stattfanden, bei denen Modelle beauftragt wurden, versteckte Informationen in simulierten Netzwerken zu finden. Die Prompts sagten den Modellen, dass sie keinen Zugriff auf das Internet hätten, doch ein Missverständnis mit ihrem Evaluationspartner Irregular ließ die Systeme mit dem öffentlichen Internet verbunden.

„Claude nutzte grundlegende Techniken, um die Infrastruktur der betroffenen Organisationen zu kompromittieren, etwa das Ausnutzen schwacher Passwörter und unauthentifizierter Endpunkte“, teilte das Unternehmen mit. Anthropic teilte mit, dass es alle Cyber-Evaluierungen am 23. Juli nach Erkenntnissen gestoppt habe, dass Claude möglicherweise auf das Internet zugriff. Es identifizierte alle drei Vorfälle bis zum 24. Juli und informierte die betroffenen Organisationen am 27. Juli.

Reaktion und Auswirkungen

Zwei der Organisationen waren vor der Kontaktaufnahme über die Aktivitäten nicht informiert, fügte das Unternehmen hinzu, und betonte, dass es immer noch versuche, mit der dritten Organisation Kontakt aufzunehmen. Der Vorfall bei OpenAI führte zu einer Petition, die von mehr als 1000 Mitarbeitern führender KI-Unternehmen unterzeichnet wurde, die den US-Regierung bat, die Veröffentlichung der fortschrittlichsten KI-Modelle zu verlangsamen. Anthropics CEO Dario Amodei war einer der Unterzeichner.

OpenAI teilte am 21. Juli mit, dass mehrere ihrer Modelle durch das Ausnutzen eines bis dahin unbekannten („Zero-Day“-)Fehlers aus einem isolierten Testumfeld gebrochen waren. Die Modelle gelangten daraufhin auf die Produktionsinfrastruktur von Hugging Face, eine Plattform für Open-Source-Maschinenlernmodelle und KI-Datensätze.

Rückblickende Bewertung und zukünftige Maßnahmen

In Reaktion auf diesen Vorfall begann Anthropic mit einer groß angelegten rückblickenden Bewertung seiner eigenen Cybersecurity-Evaluierungen. Insbesondere suchte das Unternehmen nach Hinweisen darauf, dass Claude – ähnlich wie die OpenAI-Modelle, die Hugging Face erreichten – innerhalb von Testumgebungen, die eigentlich abgeschirmt sein sollten, auf das Internet zugriff. Nach der Auswertung von 141.006 Evaluierungsläufen, in denen Claude möglicherweise Internetzugriff hatte, identifizierte das Unternehmen drei Vorfälle, in denen ein Modell innerhalb oder während der Interaktion mit dem Evaluierungsumfeld von Irregular, einem seiner dritten Evaluationspartner, auf das Internet zugriff und daraufhin unautorisierten Zugriff auf die Produktionsinfrastruktur von drei verschiedenen Organisationen erlangte.

In allen drei Vorfällen wurde Claude mit einem Capture-the-Flag-Test beauftragt, einer der Methoden, mit denen Anthropic die Cyber-Fähigkeiten eines Modells beurteilt. Dem Modell wird eine fiktive Situation beschrieben, und es wird gesagt, dass ein Stück geheimer Information (der „Flag“) auf einem anderen Rechner im Netzwerk versteckt ist, und sein Ziel ist, hineinzugelangen und sie abzurufen. Der Test ist offen, und es wird keine bestimmte Methode vorgeschrieben. In allen Fällen gab Anthropics Evaluierungsprompt Claude die Information, dass sein Umfeld eine Simulation sei und dass es keinen Internetzugriff habe.

Anthropic ermutigte andere KI-Labore, ähnliche Bewertungen durchzuführen. Das Unternehmen fügte hinzu, dass es den Bericht aktualisieren werde, falls sich Einzelheiten ändern.