Kurzfassung: OpenAI hat am 7. August 2026 Teile der Arbeit an seinem kommenden Modell Astra angehalten. Eine interne Prüfung ergab, dass das Modell eigenständig gut verteidigte reale Systeme angreifen kann. OpenAI schließt nicht mehr aus, dass Astra die Stufe „Critical” im eigenen Cyber-Raster erreicht. Kein Gesetz hat diesen Stopp erzwungen.

Ein Unternehmen erklärt sein eigenes, noch unveröffentlichtes Produkt für möglicherweise zu gefährlich. Das ist die Nachricht. Der Rest der Woche war Beiwerk.

Am 7. August 2026 teilte OpenAI mit, dass es die Arbeit an Astra teilweise verlangsamt und interne Läufe pausiert, die den verschärften Schutzvorgaben nicht genügen. Auslöser war eine interne Prüfung mit zwei auffälligen Sprüngen: agentisches Programmieren und Cybersicherheit. Astra fand Schwachstellen in echten Systemen und griff sie eigenständig an, auch dort, wo die Verteidigung stark war.

Was daran wirklich neu ist

Nicht die Fähigkeit. Dass Modelle Schwachstellen finden, ist seit Wochen bekannt. Ich habe im Juli darüber geschrieben, als OpenAIs Modell fremde Server angriff.

Neu ist der Zeitpunkt der Ansage. OpenAI hat das gemeldet, bevor das Modell draußen war. Kein Vorfall, kein Schaden, kein Journalist, der etwas aufgedeckt hat. Eine Selbsteinstufung.

Und genau da fängt mein Problem an.

Eine Selbsteinstufung ist keine Aufsicht

Wer sich selbst einstuft, legt auch fest, was die Stufen bedeuten. Das Raster stammt von OpenAI. Die Tests stammen von OpenAI. Die Entscheidung, was „Critical” auslöst, stammt von OpenAI. Dass das Unternehmen sich dieses Mal streng bewertet hat, ist keine Eigenschaft des Systems, sondern eine Entscheidung von Menschen. Sie kann diese Woche so und nächste Woche anders ausfallen.

Das Unternehmen sagt selbst, es habe die Information öffentlich gemacht, damit die Sicherheitsgemeinschaft von einer möglichen Verschiebung erfährt. Diese Offenheit vor einer Veröffentlichung ist selten. Selten heißt aber auch: nicht verpflichtend. Was nicht verpflichtend ist, kann jederzeit unterbleiben, ohne dass jemand davon erfährt.

Der EU AI Act kennt Pflichten für Modelle mit systemischem Risiko, er regelt Meldewege, Bewertungen und Dokumentation. Ob eine Fähigkeitsstufe wie diese darunter fällt und wer sie feststellt, ist damit nicht beantwortet. Die Bundesnetzagentur hat die Aufsicht in Deutschland übernommen. Sie prüft keine Modellgewichte in Kalifornien.

Warum ich das trotzdem für die richtige Reaktion halte

Anhalten ist besser als ausliefern. OpenAI arbeitet nach eigener Aussage mit Behörden und ausgewählten Sicherheitsgruppen daran, die Fähigkeiten des Modells zu prüfen. Das ist der Weg, den ich erwarte.

Nur ändert er nichts an der Zurechnung. Wenn Astra in einem halben Jahr erscheint und ein Kunde damit ein fremdes Netz zerlegt, haftet nicht das Modell. Es haften Menschen und Unternehmen: der Betreiber, der Kunde, der Anbieter. Ein Modell ist kein Täter, es ist ein Werkzeug mit einem Hersteller und einem Nutzer. Diese Zurechnung wird durch keine noch so ernsthafte Selbstbewertung weicher.

Was Unternehmen daraus mitnehmen sollten

Drei Punkte, ohne Panik.

Erstens: Wer KI-Agenten im eigenen Netz einsetzt, sollte wissen, welchen Netzzugang sie haben. Nicht welchen sie haben sollen, sondern welchen sie tatsächlich haben. Die Vorfälle der vergangenen Wochen gingen fast alle auf Fehlkonfigurationen zurück, nicht auf böse Absicht.

Zweitens: Zugangsdaten, die offen im Netz liegen, sind ab sofort ein anderes Risiko als vor einem Jahr.

Drittens: Wer Verantwortung an einen Anbieter delegiert, delegiert sie nicht. Er verlagert nur, wen er später verklagt.

Meine Haltung

Ich finde es richtig, dass OpenAI diesen Schritt gegangen ist. Und ich finde es beunruhigend, dass es allein an OpenAI lag, ihn zu gehen.

Ein Sicherheitsversprechen, das jederzeit einseitig zurückgenommen werden kann, ist eine Ankündigung, keine Zusage. Solange Einstufung, Prüfung und Veröffentlichungsentscheidung in derselben Hand liegen, bleibt der Schutz eine Frage der Firmenkultur. Firmenkulturen ändern sich mit dem Quartalsergebnis.

Quellen