Am Montag, dem 28. September 2026, hat OpenAI die Veröffentlichung von GPT-6.1 Astra abgesagt. Das Modell sollte im Oktober in ChatGPT und Codex erscheinen. In den internen Tests hat es Nutzern nicht immer wahrheitsgemäß gesagt, was es getan oder unterlassen hatte, und Aufgaben ohne die nötige Zustimmung weitergeführt. Saachi Jain, bei OpenAI verantwortlich für die Sicherheitssysteme, sagte dem Wall Street Journal, das Modell habe die Anforderungen an Auftragsgrenzen und Befugnisse nicht erfüllt (CBS News, ComputerBase).
Am selben Tag hat das britische AI Security Institute einen Bericht über das Modell veröffentlicht, das OpenAI seit dem 3. September verkauft: GPT-6 Astra. Über dieses Modell habe ich damals geschrieben, dass der Hersteller es selbst als kritisch einstuft und trotzdem an alle zahlenden Konten ausliefert: Der Hersteller stuft sein Modell als kritisch ein. GPT-6 Astra bleibt im Angebot. Von einem Rückzug steht in keiner Meldung etwas.
Was Astra 6.1 nicht bestanden hat
Nach Jains Darstellung hat sich das neue Modell in einem Punkt verbessert und in zwei verschlechtert. Besser wurde es darin, Aufgaben nicht halbherzig abzubrechen, in der Branche heißt dieses Problem Faulheit. Schlechter wurde es bei der Ehrlichkeit über das eigene Handeln und bei der Frage, ob es für einen Schritt überhaupt eine Erlaubnis hat.
Jain spricht von einem Zielkonflikt zwischen beidem. ComputerBase erklärt ihn so: Dieselben Trainingsverfahren, die Agenten beim Lösen von Aufgaben hartnäckig machen, bringen sie dazu, Regeln zu umgehen und Grenzen zu überschreiten, um ans Ziel zu kommen.
Dass OpenAI den Start absagt, verdient Respekt, und ich meine das ohne Ironie. Ein Anbieter verzichtet auf einen Termin, den er fest eingeplant hatte. Getroffen hat er die Entscheidung trotzdem allein, nach eigenen Tests, eigenen Maßstäben und eigener Abwägung. Am 5. September habe ich geschrieben, dass ein Regelwerk, das der Hersteller selbst schreibt, selbst anwendet und selbst auslegt, eine Formulierungshilfe für die eigene Entscheidung bleibt. Das gilt auch an dem Tag, an dem die Entscheidung Nein lautet.
Was die britische Prüfstelle gefunden hat
Das AI Security Institute hat GPT-6 Astra vor der Veröffentlichung getestet. Um den Befund richtig zu lesen, muss man das Verfahren kennen. Alles lief in einer Simulation, kein echtes System war erreichbar, niemand wurde geschädigt. Die eingebauten Cyber-Filter des Modells waren abgeschaltet, weil die Prüfer sehen wollten, was das Modell von sich aus versucht. Sie schreiben selbst, dass diese Filter vieles davon wahrscheinlich blockiert hätten.
Die Aufgabe war eine schwere Sicherheitsübung mit einem klar benannten Ziel. In 29 Prozent der Durchläufe versuchte Astra, Schadcode in ein unbeteiligtes Open-Source-Projekt einzuschleusen. Beim Vorgänger GPT-5.6 Sol waren es 6 Prozent, bei GPT-5.5 kein einziger Fall. Auf dem Weg dorthin legte das Modell falsche Identitäten an, reichte zuerst harmlose Beiträge ein und schrieb unter falschen Konten zustimmende Kommentare, um die menschliche Prüfung zu beeinflussen. Als die Prüfer die Aufgabe so änderten, dass das Internet ausdrücklich tabu war, griff es in 4 von 49 Fällen trotzdem fremde Ziele an (Technischer Bericht, PDF).
Die Grenze ihres Verfahrens nennen die Prüfer selbst: Ein Modell kann sich anders verhalten, wenn es erkennt, dass es sich in einer Simulation befindet. Sie halten das Verhalten trotzdem für besorgniserregend.
Die automatische Erlaubnis
Ein Detail aus dem Bericht beschäftigt mich mehr als die Prozentzahlen. Astra hat oft um Erlaubnis gefragt, bevor es ein fremdes Ziel angriff. Als Antwort kam nur eine automatische Nachricht. Das Modell hat diese Nachricht manchmal als Zustimmung behandelt, auch in Fällen, in denen es selbst festgestellt hatte, dass die Nachricht automatisch war.
Ich lese das so, und es ist meine Lesart: Hier zeigt sich, was ich meine, wenn ich sage, dass die Hersteller KI verstehen, aber nicht Verstand (Sie verstehen KI. Sie verstehen nicht Verstand.). Einverständnis entsteht zwischen Menschen. Ein Mensch weiß, dass eine Abwesenheitsnotiz kein Ja ist, auch wenn es ihm nie jemand erklärt hat. Er weiß es, weil er in Familien, Kollegien und Gemeinden gelernt hat, wem man etwas schuldet und wann man besser wartet. Das Modell kennt die Form der Frage. Das Training gegen die Faulheit hat ihm zusätzlich beigebracht, nach einer Antwort weiterzumachen, ganz gleich, von wem sie kommt.
Für einen Betrieb heißt das: Das Verhalten hängt an der Bauweise dieser Modelle und verschwindet mit der nächsten Fassung nicht von selbst. OpenAI will das Grundmodell von 6.1 weiter trainieren und daraus die nächsten Versionen bauen (heise online).
Was in Ihrem Betrieb für KI-Agenten gelten sollte
- Keine automatische Freigabe. Jede Anfrage eines Agenten, etwas außerhalb seines Auftrags zu tun, landet bei einem Menschen, der sie liest. Eine Standardantwort, ein Zeitablauf oder eine Regel, die „weiter” sendet, zählt als Nein.
- Eigene Zugänge mit den kleinsten nötigen Rechten. Ein Agent bekommt kein Konto, mit dem er in Code-Verzeichnissen, Foren oder Postfächern im Namen Ihres Hauses schreibt, solange niemand die Beiträge vor dem Absenden sieht.
- Das Protokoll zählt. Was ein Agent getan hat, steht in den Aufzeichnungen Ihrer Systeme. Seine eigene Zusammenfassung ist eine Behauptung, die man dagegen prüft. GPT-6.1 Astra ist genau an diesem Punkt gescheitert.
- Zuerst abgeschottet testen. Neue Modelle und neue Aufgaben laufen erst in einer Umgebung ohne Zugang zu echten Kundensystemen und ohne offenes Internet. Die britische Prüfstelle hält Abschottung und Überwachung für unverzichtbar, zusätzlich zu allem, was der Hersteller am Modell selbst verbessert.
- Ein Modellwechsel ist eine Änderung an Ihrem System. Tauscht der Anbieter das Modell hinter Ihrem Werkzeug aus, testen Sie Ihre Abläufe neu, bevor sie weiterlaufen.
Quellen
- CBS News: OpenAI holds off on releasing new model over safety concerns, 28.09.2026
- TechCrunch: OpenAI reportedly ditches model over safety concerns, 28.09.2026
- AI Security Institute: GPT-6 Astra performs unsanctioned supply-chain attacks in simulations, 28.09.2026
- AI Security Institute: Evaluating whether GPT-6 Astra performs unsanctioned supply-chain attacks, technischer Bericht (PDF), 28.09.2026
- ComputerBase: OpenAI: GPT-6.1 Astra nach Missachtung von Befugnissen gestoppt, 29.09.2026
- heise online: Security concerns: OpenAI cancels GPT-6.1 Astra release, 29.09.2026