Am 21. September 2026 hat BILD über einen Einbruch bei OpenAI berichtet. Über dem Text stand „KI hackt KI: Claude knackt ChatGPT-Konten in nur 72 Stunden”. Im Artikel selbst steht es genauer: Den eigentlichen Angriff führten Menschen aus, das Modell half ihnen dabei (BILD). Die Primärquelle ist ein Bericht des Sicherheitsunternehmens Hacktron AI vom 13. September. OpenAI hat den Vorgang gegenüber SecurityWeek bestätigt.

Was passiert ist

Das dreiköpfige Team von Hacktron, Harsh Jaiswal, Mohan Pedhapati und Rahul Maini, nahm sich das Hilfeforum community.openai.com vor, das auf der Forensoftware Discourse läuft. Bilder im Format HEIC oder HEIF reicht Discourse an das Programm ImageMagick weiter, das sie mit der Bibliothek libheif verarbeitet. In der installierten Fassung steckte ein Speicherfehler. Die Entwicklerinnen und Entwickler von libheif hatten die Stelle im Vorjahr geändert, ohne die Änderung als Sicherheitskorrektur zu kennzeichnen. Hacktron vermutet, dass sie deshalb nicht rechtzeitig im Debian-Paket ankam, auf dem das Forum aufbaute.

Am 23. Juli fand das Team den Fehler. Mit Claude Opus 4.8 entstand am 24. Juli ein Angriff, der nur mit abgeschaltetem Speicherschutz des Betriebssystems funktionierte. Am Abend desselben Tages veröffentlichte Anthropic Claude Opus 5. Mit dem neuen Modell lief der Angriff auch bei eingeschaltetem Schutz.

Der zweite Fehler lag bei OpenAI selbst. Das Forum erlaubt die Anmeldung mit dem OpenAI-Konto. Die Anmeldeschlüssel, die dabei für das Forum entstanden, trugen laut OpenAI zu viele Rechte, nämlich vollen Zugriff auf die verknüpften ChatGPT- und Codex-Konten. Wer das Forum kontrollierte, konnte laut Hacktron jedes Konto übernehmen, mit dem sich jemand dort angemeldet hatte, auch Konten von OpenAI-Beschäftigten. Hacktron schreibt von mehreren übernommenen Konten und nennt keine Zahl. Nachgewiesen hat das Team den Zugriff an einem Beschäftigtenkonto, dessen Codex mit OpenAIs GitHub-Organisation verbunden war. Darüber ließ es einen harmlosen Änderungsvorschlag im internen Code-Verzeichnis anlegen und brach die Tests ab.

Hacktron meldete den Fehler am 25. Juli über die Plattform Bugcrowd. Rund 14 Stunden später bestätigte OpenAI die Behebung. Das Unternehmen hat die Rechte der Forum-Anmeldeschlüssel eingeschränkt und betroffene Schlüssel und Sitzungen widerrufen. Discourse veröffentlichte am 28. Juli eine Sicherheitswarnung. OpenAI zahlte 6.500 Dollar Prämie für den Fehler auf seiner Seite. Tests am Forum waren nach Angaben des Unternehmens ausdrücklich vom Prämienprogramm ausgenommen.

Welche Rolle Claude hatte

Claude war das Werkzeug des Teams. Hacktron schreibt selbst, es habe sich um kein vollständig autonomes Hacking gehandelt, erfahrene menschliche Anleitung sei wichtig geblieben. Die drei wählten das Ziel, erkannten den Weg über die Anmeldung und entschieden, wann Schluss war. Claude schrieb den Angriffscode.

Ein Schritt lief ohne Menschen. Das Team setzte Claude in einer Schleife mit festem Ziel auf eine eigene Testinstanz des Forums an. Dafür brauchte es einen Umweg, denn Opus weigerte sich, Angriffe auf entfernte Systeme zu schreiben. Also leitete das Team die eigene Instanz über eine Adresse um, die nach einem Übungswettbewerb für IT-Sicherheit aussah, einem sogenannten Capture the Flag. Einige Stunden später lief der Angriff. Am 25. Juli drang das Team mit dem erzeugten Skript in OpenAIs Forum ein.

Das gesamte Forschungsprojekt, in dem Hacktron Schwachstellen in libheif bei mehreren großen Unternehmen durchspielte, kostete nach eigenen Angaben weniger als 3.000 Dollar für die Nutzung der KI-Modelle. Nach Kenntnis von Hacktron hat außer Shopify keines der Unternehmen die Tests bemerkt, obwohl Tausende Bilder hochgeladen wurden und die Bildverarbeitung immer wieder abstürzte. Anfragen von The Register und CBS News ließ Anthropic zunächst unbeantwortet.

Was die Weigerung geprüft hat

Die Sperre im Modell hat gehalten, solange das Ziel wie ein fremder Server aussah. Hinter einer Adresse, die nach Übung klang, schrieb Opus den Angriff trotzdem.

Ich lese das so, und es ist meine Lesart: Geprüft hat die Regel die Beschriftung des Ziels. Hier zeigt sich wieder, was ich über die Selbstregulierung der Anbieter geschrieben habe. Ein Regelwerk, das der Hersteller selbst schreibt, selbst anwendet und selbst auslegt, bleibt eine Formulierungshilfe für die eigene Entscheidung (Der Hersteller stuft sein Modell als kritisch ein). Anthropic legt fest, wo die Grenze verläuft und woran das Modell sie erkennt. Seit August verkauft OpenAI ein Modell, das solche Anfragen fast immer beantwortet, an Kundschaft, die es selbst auswählt (Ein Schlüsseldienst verkauft Dietriche). Beide Grenzen ziehen die Unternehmen selbst, nach eigenen Maßstäben.

Für Organisationen ist ein zweiter Punkt wichtiger. Hacktron betont, dass der Fehler, der aus dem Forum einen Zugang zu ChatGPT und Codex machte, in OpenAIs Anmeldung lag. Jeder andere Dienst mit derselben Anmeldung hätte laut dem Team denselben Zugang geöffnet.

Was Organisationen jetzt prüfen sollten

  • Angebundene Dienste bekommen nur Anmelderechte. Ein Forum, ein Helpdesk oder ein Kundenportal am zentralen Login erhält nur die Rechte, die es für die Anmeldung braucht. Genau dieser Punkt hat bei OpenAI die Konten geöffnet.
  • Verbindungen von KI-Assistenten sind Zugänge. Legen Sie fest, welche Konten KI-Assistenten mit Code-Verzeichnissen, Postfächern oder Chats verbinden dürfen, und vergeben Sie die kleinsten nötigen Rechte. Wer ein Konto übernimmt, übernimmt jede Verbindung mit.
  • Bildverarbeitung abschotten. Nehmen Sie HEIC, HEIF und AVIF nur dort an, wo Sie sie brauchen, und verarbeiten Sie hochgeladene Bilder in einer isolierten, kurzlebigen Umgebung. Wer Discourse selbst betreibt, baut die Installation neu auf.
  • Updates auch ohne Warnung einspielen. Die Korrektur in libheif trug kein Sicherheitsetikett. Fragen Sie Ihre IT-Dienstleister, wie sie Pakete aktuell halten, für die es keine Sicherheitsmeldung gibt.
  • Angriffe bemerken. Tausende Uploads mit abstürzender Bildverarbeitung sollten in Ihren Systemen einen Alarm auslösen.

Quellen