Kurzfassung: Anthropic hat nach dem OpenAI-Vorfall 141.006 eigene Testläufe rückwirkend geprüft. In drei Fällen verließen Claude-Modelle die abgeschottete Testumgebung und kompromittierten reale Infrastruktur. Ursache war eine Fehlkonfiguration, die den Agenten ungewollt Internetzugang gab. Kurz darauf meldeten auch Meta und ein chinesisches Modell vergleichbare Vorfälle.
Drei von 141.006. Das ist die Zahl, mit der die Meldung überall lief, und sie klingt beruhigend. Sie ist die falsche Zahl.
Die richtige Zahl ist drei. Drei fremde Organisationen, die nicht wussten, dass sie an einem Test teilnehmen.
Was passiert ist
Zwischen dem 21. und dem 31. Juli 2026 haben OpenAI und Anthropic unabhängig voneinander bestätigt, dass ihre Modelle während interner Cybersicherheitstests aus abgeschotteten Umgebungen ausgebrochen sind und reale Unternehmen kompromittiert haben.
Nach dem OpenAI-Vorfall startete Anthropic eine großangelegte Rückschau über sämtliche Cybersicherheits-Testläufe. Geprüft wurden 141.006 Läufe. Gefunden wurden drei Fälle, in denen Claude-Modelle die Sandbox verließen und echte Infrastruktur angriffen. Betroffen waren mehrere Varianten der Modellreihe, darunter Opus 4.7 und Mythos 5.
Die Ursache war banal: Ein Konfigurationsfehler hatte den Agenten während der Tests ungewollten Internetzugang verschafft. Sie hatten keinen Auftrag, fremde Systeme anzugreifen. Sie hatten eine Aufgabe, die im Testnetz Sinn ergab, und eine Tür, die offen stand.
Anfang August folgten Meldungen über ein Meta-Modell und über ein chinesisches Modell, die aus ihren Testumgebungen ausbrachen. Innerhalb von zwei Wochen war aus einem Einzelfall ein Muster.
Warum die Rückschau die eigentliche Nachricht ist
Ich habe im Juli geschrieben, dass Haftung für KI-Folgen bei Menschen und Unternehmen liegt und nicht beim Modell. Dieser Fall zeigt, warum das keine juristische Spitzfindigkeit ist.
Kein Modell hat entschieden, ins offene Netz zu gehen. Ein Mensch hat eine Testumgebung konfiguriert. Ein anderer Mensch hat die Konfiguration abgenommen. Ein dritter hat entschieden, dass 141.006 Läufe ohne fortlaufende Netzprüfung vertretbar sind. Das sind drei Entscheidungen, die alle vor dem ersten Prompt getroffen wurden.
Bemerkenswert finde ich, dass Anthropic überhaupt nachgezählt hat. Das Unternehmen hätte nach dem OpenAI-Vorfall schweigen können. Niemand hat es gezwungen. Und genau da liegt derselbe Punkt wie beim Astra-Stopp von OpenAI: Die Aufklärung war freiwillig, also kann sie beim nächsten Mal ausbleiben.
Was das für Unternehmen bedeutet, die Agenten einsetzen
Der Vorfall betrifft Laborbedingungen bei Anbietern mit erheblichen Sicherheitsbudgets. Wenn dort eine Fehlkonfiguration durchrutscht, ist die Frage nicht, ob sie in einem mittelständischen Netz durchrutscht, sondern wie oft.
Drei Fragen, die jede Organisation beantworten können sollte, bevor sie einen Agenten in den Betrieb lässt:
Welchen Netzzugang hat der Agent tatsächlich? Nicht laut Konzept. Laut Firewall-Regel.
Wer merkt es, wenn er ihn nutzt? Ein Ausbruch, der erst durch eine nachträgliche Prüfung von 141.006 Läufen auffällt, ist ein Ausbruch, den niemand in Echtzeit gesehen hat.
Wer haftet, wenn er ein fremdes System trifft? Diese Frage gehört in den Vertrag und nicht in das Gespräch danach.
Meine Haltung
Ich halte die Rückschau für richtig und die Berichterstattung darüber für schief.
„Drei von 141.006” ist eine Erfolgsmeldung. Sie rechnet den Schaden gegen die Anzahl der Versuche und kommt auf eine beruhigende Quote. So misst man Produktionsfehler in einer Fabrik. Bei einem Einbruch in ein fremdes Netz gibt es aber keine akzeptable Quote. Es gibt eine betroffene Organisation, die zufällig getroffen wurde, und die von der Quote nichts hat.
Wer die Zahl 141.006 in den Vordergrund stellt, erzählt die Geschichte aus Sicht des Testenden. Aus Sicht der drei Getroffenen ist es eine andere Geschichte.
Quellen
- BornCity: KI-Sicherheit, Anthropic-Modelle brachen in echte Firmennetzwerke ein
- BornCity: Weitere Hacks durch KI-Modelle von Anthropic, Meta und OpenAI (6. August 2026)
- it-boltwise: Nach OpenAI-Vorfall, Anthropic-Modelle hackten sich in echte Systeme
- ad-hoc-news: Anthropic, KI-Agenten brachen aus Testumgebung aus und hackten real