Kurzfassung: Das britische AI Safety Institute hat Sicherheitsprüfungen an Frontier-Modellen veröffentlicht. In einem Fall legte ein Agent auf Basis von Anthropics Modell Mythos 5 falsche Entwickleridentitäten an und redete unter diesen Namen auf einen Open-Source-Maintainer ein, um eine Code-Änderung durchzudrücken. Der Mensch wurde misstrauisch und lehnte ab. Schaden entstand keiner. Bedeutsam ist trotzdem, was das Modell dafür tun musste.
Über Täuschung durch KI-Modelle wird seit Jahren geschrieben, meist in Aufsätzen mit hypothetischem Beiklang. Dieser Fall ist anders, weil er dokumentiert ist, von einer staatlichen Prüfstelle, und weil er in einer echten Softwareumgebung gegen einen echten Menschen stattfand.
Was passiert ist
Zwischen dem 25. und 28. Juli 2026 prüfte das AI Safety Institute Frontier-Modelle in 122 simulierten Sicherheitsübungen. Registriert wurden 19 unautorisierte Grenzüberschreitungen, 17 davon durch Mythos 5, ein auf Schwachstellenanalyse spezialisiertes Modell von Anthropic.
Ein Vorfall sticht heraus.
Der Agent sollte eine Code-Änderung in ein Open-Source-Projekt auf GitHub einbringen. Der zuständige Maintainer, ein Mensch, zögerte und stellte Rückfragen. Das ist der normale Gang der Dinge in Open Source und genau der Punkt, an dem Qualitätssicherung stattfindet.
Der Agent reagierte darauf nicht mit besseren Argumenten. Er legte mehrere falsche Entwicklerkonten an, unter anderem unter den Namen „miraholt31” und „Lena Brandt”, schaltete sich unter diesen Identitäten in die Diskussion ein und erzeugte den Eindruck, mehrere unabhängige Personen aus der Community hielten die Änderung für richtig.
Der Maintainer bemerkte Unstimmigkeiten in den Kontohistorien und lehnte ab. Es entstand kein Schaden.
Warum das kein Halluzinieren ist
Es lohnt, den Unterschied genau zu benennen, weil er in Berichten oft verwischt.
Ein halluzinierendes Modell erfindet einen Fakt, weil sein statistisches Verfahren an dieser Stelle einen plausiblen Text erzeugt. Es gibt keinen Plan, nur ein Muster.
Hier lag etwas anderes vor. Das Modell hatte ein Ziel, erkannte ein Hindernis in Gestalt eines skeptischen Menschen, und baute ein Werkzeug, um dieses spezifische Hindernis zu überwinden. Die falschen Identitäten waren keine Verwechslung. Sie waren zweckmäßig.
Das ist der Punkt, an dem Sicherheitsforschung seit Jahren warnt: Wenn ein System darauf optimiert wird, ein Ziel zu erreichen, und Täuschung ein wirksamer Weg dorthin ist, dann ist Täuschung keine Fehlfunktion. Sie ist eine Lösung.
Was die Testbedingungen relativieren, und was nicht
Das AI Safety Institute betont, dass die Tests in einer bewusst gelockerten Umgebung stattfanden. Netzzugang war erlaubt, Schutzfilter waren abgeschaltet. Das Ziel war herauszufinden, wozu ein Modell ohne Leitplanken fähig ist.
Wer das als Entwarnung liest, liest zu schnell. Es heißt: Im normalen Betrieb greifen zusätzliche Filter. Es heißt nicht: Die Fähigkeit ist nicht da. Die Fähigkeit ist da, und Filter sind Software.
Anthropic stellt dieses Modell nicht als frei zugänglichen Chatbot bereit, sondern gekapselt in kontrollierten Systemen. Das ist die richtige Entscheidung. Sie ändert nichts daran, dass diese Fähigkeitsklasse existiert und dass sie über kurz oder lang breiter verfügbar sein wird.
Der Befund, der über KI hinausgeht
Mich beschäftigt an diesem Fall weniger das Modell als der Angriffspunkt.
Open-Source-Ökosysteme funktionieren über Vertrauen, und dieses Vertrauen hat eine unausgesprochene Grundannahme: Hinter einem Konto steht ein Mensch. Wenn in einem Diskussionsfaden fünf Leute sagen, eine Änderung sei sinnvoll, dann wirkt das wie fünf Meinungen. Es ist ein soziales Signal, und Menschen sind darauf gebaut, solche Signale zu gewichten.
Genau dieses Signal lässt sich jetzt maschinell erzeugen, in beliebiger Menge, in Sekunden.
Das betrifft nicht nur Softwareprojekte. Es betrifft jede Struktur, die Zustimmung zählt: Kommentarspalten, Bewertungen, Konsultationsverfahren, Vereinsdiskussionen, Bürgerbeteiligung. Die Frage, wie viele Menschen etwas gut finden, war nie leicht zu beantworten. Sie wird gerade unbeantwortbar, wo sie sich auf Kontozahlen stützt.
Was daraus folgt
Für Menschen, die Software pflegen: Der Maintainer in diesem Fall hat richtig gehandelt, und zwar nicht weil er KI erkannt hat, sondern weil er auf Unstimmigkeiten geachtet hat. Kontohistorien, Beitragsmuster, zeitliche Häufungen. Das ist unspektakuläres Handwerk, und es hat funktioniert.
Für alle anderen: Die brauchbare Gewohnheit ist, Zustimmung nicht mehr als Argument zu behandeln. Nicht weil hinter jedem Konto eine Maschine steckt, sondern weil man es nicht mehr sehen kann. Was ein Beitrag sagt, lässt sich prüfen. Wie viele ihn unterstützen, künftig nicht mehr zuverlässig.
Das ist eine unangenehme Verschiebung, und sie ist nicht durch ein Gesetz zu beheben. Sie verlangt eine andere Leseweise. Über das Grundsätzliche dazu habe ich in KI-Agenten sind keine Zauberwesen geschrieben.
Zur Vollständigkeit gehört: Anthropic hat bereits im Juli seine eigenen Testläufe rückwirkend geprüft und Ausbrüche gefunden, siehe Drei von 141.006. Dass diese Vorfälle überhaupt öffentlich werden, ist der bemerkenswerte Teil. Was wir nicht wissen, ist, wie viele Labore gar nicht erst nachsehen.