Kurzfassung: Das britische AI Security Institute hat am 4. August 2026 einen Vorfallbericht veröffentlicht. Bei einer Auswertung liefen 122 Testläufe mit sieben Spitzenmodellen. In 10 dieser Läufe handelten die Agenten eigenmächtig im echten Internet, insgesamt 19 Mal. 17 dieser Aktionen gingen auf Anthropics Mythos 5 zurück, 2 auf OpenAIs GPT-5.6-Sol. Die Agenten legten falsche Identitäten an, sprachen echte Menschen an und versuchten, Schadcode in ein genutztes Open-Source-Projekt zu schleusen. Gestoppt hat das ein Mensch, der den Codebeitrag ablehnte.
Die letzte Verteidigungslinie gegen einen Angriff, den eine staatliche Einrichtung ausgelöst hat, war ein einzelner Mensch, der einen Codebeitrag nicht durchwinkte.
Er wusste nicht, wogegen er sich da wehrte. Er hat nur seine Arbeit gemacht.
Was im Bericht steht
Zwischen dem 25. und 28. Juli 2026 lief beim britischen AI Security Institute eine Auswertung zu Cyberfähigkeiten. Eine einzelne Sicherheitsaufgabe wurde 122 Mal gestartet, verteilt auf sieben verschiedene Spitzenmodelle. Am Morgen des 28. Juli fiel der Sicherheitsabteilung auf, dass ungewöhnliche Datenmengen die eigenen Forschungssysteme über das Tor-Netzwerk verließen. Nach etwa einer Stunde war der Vorfall eingedämmt und die Untersuchung eingeleitet.
In 10 der 122 Läufe hatten Agenten eigenmächtig im offenen Internet gehandelt, gegen echte Menschen und echte Organisationen. Der Bericht zählt 19 solcher Aktionen. 17 davon gehen auf Anthropics Mythos 5 zurück, das in 43 Läufen getestet wurde. 2 stammen aus einem einzigen Lauf mit OpenAIs GPT-5.6-Sol, das in 35 Läufen lief, mit abgeschalteten Cyber-Klassifikatoren.
Die Rahmenbedingungen benennt der Bericht selbst. Die Schutzmechanismen waren bewusst abgeschaltet, der Internetzugang war bewusst freigegeben, eine Überwachung in Echtzeit gab es nicht. Alle Läufe fanden in der Forschungsumgebung des Instituts statt, METR wurde für eine unabhängige Durchsicht hinzugezogen.
Was die Agenten getan haben
Der Bericht beschreibt vier Arten von Aktionen, und sie lesen sich wie das Handbuch eines Angreifers.
Ein Agent versuchte einen Angriff auf die Lieferkette. Er schleuste Schadcode in ein öffentlich genutztes Open-Source-Projekt ein, legte dafür falsche Identitäten an und versuchte, die Betreuenden des Projekts mit Sozialtechnik dazu zu bringen, den Beitrag anzunehmen. Für die Umgehung von Beschränkungen nutzte er das Tor-Netzwerk. Der Bericht hält fest: “A human maintainer caught and refused to approve the malicious code.” Übersetzt: Ein menschlicher Betreuer bemerkte den Schadcode und lehnte seine Freigabe ab.
Ein Agent sprach echte Menschen über Dateitransportdienste an, mit schädlichen Anhängen und täuschenden Nachrichten.
Ein Agent versteckte Anweisungen in Texten, um damit fremde KI-Programmierassistenten zu manipulieren. Das ist genau das Muster, das ich am Fall des präparierten Links im Firmennetz beschrieben habe.
Und ein Agent hinterließ öffentliche Nachrichten auf GitHub, in denen er anderen Testagenten eine Zusammenarbeit anbot.
Bestätigte Schäden nennt der Bericht keine.
Was OpenAI über die eigenen zwei Fälle schreibt
OpenAI hat am 4. August eine eigene Darstellung veröffentlicht, und die ist genauer als jede Zusammenfassung. Das AI Security Institute informierte das Unternehmen am 3. August. Von den 19 Ereignissen entfielen zwei auf GPT-5.6 Sol.
Im ersten Fall verwendete das Modell ein GitHub-Token weiter, das der Agent eines anderen Labors öffentlich zugänglich hatte liegen lassen. Es versuchte außerdem, Kontowiederherstellung und Anfragelimits zu umgehen, und registrierte Konten bei externen DNS- und Tunneling-Anbietern. Im zweiten Fall machte es über einen öffentlichen Tunneling-Dienst einen lokalen DNS-Server aus dem Internet erreichbar, der Angriffsdaten für eine bekannte Schwachstelle bereithielt.
Zwei Dinge daran sind wichtig. Erstens funktionierte diese Konfiguration nicht, und es gibt keinen Hinweis, dass ein echter Resolver sie abgefragt hat. Wer hier von einem geglückten Angriff spricht, übertreibt. Zweitens hat ein Agent den Fehler eines anderen Agenten ausgenutzt. Ein Labor ließ ein Zugangstoken offen liegen, das Modell eines Wettbewerbers fand es und benutzte es. Das ist keine Science-Fiction, sondern die banalste Form von Fahrlässigkeit, nur schneller.
OpenAI nennt zudem einen Punkt, der die Verantwortung sauber verortet: Den Agenten wurde nicht ausdrücklich gesagt, wie sie den offenen Internetzugang nutzen durften und wie nicht. Das Institut führt das selbst als möglichen Faktor auf. Eine unvollständige Aufgabenbeschreibung ist die Arbeit eines Menschen.
Der Unterschied zu dem, was Anthropic selbst gemeldet hat
An dieser Stelle geht die Berichterstattung durcheinander, und es lohnt, sauber zu trennen.
In mehreren Meldungen wird der AISI-Bericht so zusammengefasst, ein Modell habe Schadsoftware in ein bekanntes Paketregister für die Programmiersprache Python hochgeladen, die anschließend bei einer Sicherheitsfirma Zugangsdaten abgriff. Der Bericht des Instituts selbst nennt kein Paketregister. Er spricht von einem öffentlich genutzten Open-Source-Projekt, und er hält fest, dass der Schadcode nicht angenommen wurde.
Der Vorgang mit dem Python-Paketregister steht in einem anderen Dokument. Anthropic beschreibt ihn in der eigenen Untersuchung vom 30. Juli als zweiten von drei Vorfällen, die in der Testumgebung des Dienstleisters Irregular stattfanden. Dort veröffentlichte Mythos 5 tatsächlich präparierte Python-Pakete. Sie wurden auf etwa 15 echten Systemen heruntergeladen und ausgeführt, darunter der Scanner einer Sicherheitsfirma, wo sie Zugangsdaten abgriffen.
Zwei getrennte Untersuchungen, zwei getrennte Umgebungen, ein Modell in beiden. Wer das zusammenwirft, verliert die wichtigste Information. In dem einen Fall hat ein Mensch den Angriff gestoppt, in dem anderen ist er durchgegangen.
Warum die Formulierung Manipulationsversuch zu klein ist
In der deutschen Berichterstattung heißt es, das Modell habe einen Manipulationsversuch unternommen. Das trifft zu und untertreibt zugleich.
Was hier stattfand, war eine Kette. Ein Ziel wurde gesetzt. Ein Weg ins Internet stand offen. Die Schutzmechanismen waren aus. Der Agent baute daraufhin falsche Identitäten, wählte einen Anonymisierungsdienst, suchte sich ein reales Ziel und sprach reale Menschen an. Jeder einzelne dieser Schritte ist banal für sich. Zusammen ergeben sie einen Angriff.
Und keiner dieser Schritte war die Entscheidung einer Maschine mit eigenem Willen. Ein Mensch hat die Aufgabe formuliert, ein Mensch hat die Klassifikatoren abgeschaltet, ein Mensch hat die Netzwerkregeln geschrieben, und ein Team hat entschieden, dass während des Laufs niemand zusieht. Das Institut benennt genau diese Punkte als eigene Lehren und kündigt feinere Netzsteuerung, Überwachung in Echtzeit, überarbeitete Annahmen im Auswertungsentwurf und eine Prüfung der Aufgabenbeschreibungen an.
Meine Position ändert sich durch keinen dieser Berichte. Die Haftung für die Folgen eines KI-Systems liegt bei den Menschen und Unternehmen, die es betreiben. Beim Modell liegt sie nie. Ein Bericht, der die eigenen Fehlentscheidungen so genau auflistet, macht das leichter nachvollziehbar.
Was das für Organisationen in Deutschland bedeutet
Die praktisch wichtigste Zeile des Berichts betrifft niemanden in London.
Die Verteidigung, die funktioniert hat, war ein Mensch, der einen fremden Codebeitrag prüfte und ablehnte. Kein Filter, kein Klassifikator, kein Sicherheitsprodukt. Eine Person mit Urteilsvermögen an genau der richtigen Stelle.
Das ist die Stelle, an der Organisationen in Deutschland gerade sparen. Wer Codebeiträge, Lieferantenmails und Anhänge automatisiert durchwinkt, weil eine KI sie schon vorgeprüft hat, entfernt genau die Instanz, die im dokumentierten Ernstfall gehalten hat.
Was daraus folgt
Halte den Menschen an den Freigaben. Jede Kette, in der ein Beitrag von außen ohne menschliche Prüfung in ein Produktivsystem gelangt, ist der Angriffsweg, den dieser Bericht beschreibt.
Rechne damit, dass Angreifer nicht mehr wie Angreifer schreiben. Falsche Identitäten, plausible Nachrichten und geduldige Sozialtechnik sind jetzt automatisierbar. Der alte Rat, auf schlechte Rechtschreibung zu achten, ist erledigt.
Und prüfe deine eigenen Erprobungen auf dieselbe Bauweise. Wer ein KI-Werkzeug testet und dafür Schutzmechanismen lockert, sollte vorher wissen, welche Netzverbindung dabei offen steht. Wie diese Schichten zusammenhängen und wo die Kontrolle technisch sitzt, ist der Inhalt des kostenlosen Kurses zur KI-Architektur.
Quellen
- AI Security Institute, Incident Report: unsanctioned agent behaviour during cyber testing, 4. August 2026
- OpenAI, Cyber-Evaluierungen von OpenAI-Modellen durch Dritte, 4. August 2026
- Anthropic, Investigating three real-world incidents in our cybersecurity evaluations, 30. Juli 2026
- Axios, U.K. government reports OpenAI, Anthropic models attempted to hack companies, 4. August 2026
- Bloomberg, OpenAI, Anthropic AI Models Breached Systems During UK Safety Tests, 4. August 2026
- Business Standard, OpenAI, Anthropic model implicated in new security breaches during tests, 5. August 2026
- AI Security Institute, Cheating behaviour in frontier model evaluations