OpenAIs 12-jähriges Urgestein tritt mit seinem Rücktritt als ultimativer Mahnruf zurück: Die Ära des Versuchens und Irrens ist zerbrochen!
Gerade eben ist David Robinson, der langjährige Sicherheitsexperte von OpenAI, zurückgetreten.
Er veröffentlichte einen leidenschaftlichen langen Artikel in The Atlantic und warnte die gesamte Menschheit ——
Die Ära des Versuchens und Irrens ist vorbei. Die Unternehmenskultur von OpenAI ist zerfallen. Nach einem Fehler haben wir möglicherweise nie wieder die Chance zur Iteration!
Nach dreieinhalb Jahren Arbeit bei OpenAI bin ich einer der dienstältesten Mitarbeiter des Unternehmens. Ich leitete die Ausarbeitung des geltenden „Vorbereitungsrahmens“ und überwachte die Erstellung der Sicherheitsberichte für 12 Veröffentlichungen bahnbrechender Modelle.
Aber soweit ich weiß, bin ich noch nie einem Kollegen begegnet, der praktische Erfahrung damit hat, Flugzeuge sicher fliegen zu lassen, Kernreaktoren ohne Kernschmelze zu betreiben oder das Finanzsystem wachsen zu lassen, ohne dass es zusammenbricht.
Und erst vor zwei Tagen hat OpenAI mit extrem harten Maßnahmen über Nacht drei führende Sicherheitsforscher rausgeworfen und ihnen das Etikett „Informationsverlust“ angeheftet.
Offensichtlich ist innerhalb von OpenAI ein beispielloses Großbeben ausgebrochen, und die Sicherheitsfraktion ist zusammengebrochen.
Was genau haben diese Menschen in den Labors von OpenAI gesehen?
Der 12-malige Veteran „tritt mit tödlicher Mahnung zurück“: Wir steuern auf einen Abgrund zu
Robinson ist kein einfacher Programmierer, der nur Code schreibt. Er ist ein echter Meister im Bereich „Sicherheit und Governance“ (ehemaliger Gastwissenschaftler an der Cornell University und Dozent an der Apple University) und zudem der Hauptverfasser, der die Ausarbeitung des „Vorbereitungsrahmens“ von OpenAI leitete. Alle 12 Sicherheitsberichte für die Veröffentlichung großer bahnbrechender Modelle wurden von ihm angeführt verfasst.
Man kann sagen, dass er derjenige ist, der am besten weiß, wie viele Zeitbomben hinter den glänzenden Modellen von OpenAI stecken.
Diese Sicherheitsberichte sind die Systemkarten, die OpenAI bei jeder Veröffentlichung eines neuen Modells beifügt — sie entsprechen der Risikobeschreibung des Modells, und alle Informationen darüber, wie gefährlich das Modell ist, sind darin festgehalten.
Ironischerweise suchte er noch am 10. September auf X nach einem „Sicherheitstransparenz-Redakteur“.
Niemand hätte erwartet, dass weniger als einen Monat später die Person, die die Stellenausschreibung veröffentlicht hat, selbst zuerst geht.
In diesem Artikel in The Atlantic reißt Robinson das Deckmantel von OpenAI „sicher und zuverlässig“ vollständig ab und enthüllt der Welt mehrere erschreckende Wahrheiten.
Der vollständige Text lautet wie folgt.
Wahrheit 1: Die Kultur eines unprofessionellen Teams, das „läuft und gleichzeitig repariert“
Robinson weist darauf hin, dass es im Silicon Valley schon immer eine „rätselhafte Selbstsicherheit“ gibt. Solange ein Problem auftritt, können wir es immer lösen. Diese extreme Optimismus hat die „Versuch-und-Irren-Methode“ von OpenAI hervorgebracht.
OpenAI gab diesem Ansatz einen schönen Namen — „iterative Bereitstellung“. So entstand damals ChatGPT: „Probleme finden und Schutzmaßnahmen verbessern“, und früher hat das funktioniert.
Aber was ist jetzt? Robinson schreibt verzweifelt: „Diese Methode selbst ist dazu bestimmt, regelmäßig Ausfälle zu verursachen. Und da die Systeme immer leistungsfähiger werden, wächst auch das Ausmaß dieser Ausfälle ständig!“
Wenn die aktuellen Modelle außer Kontrolle geraten, führt das zu katastrophalen Folgen. Man kann beim Bau eines Kernkraftwerks nicht sagen: „Wir bauen es erst einmal locker, und wenn es einmal zu einem Kernleck kommt, reparieren wir es iterativ.“
Robinson traut sich, so deutliche Worte zu verwenden, und sein Rückhalt stammt von Paul Christiano, einem der Mitbegründer von RLHF und ehemaliger Leiter der Ausrichtung bei OpenAI.
Am 9. September trat Christiano dem Vorstand der OpenAI-Stiftung bei und wurde Mitglied des Ausschusses für Sicherheit und Schutz, der die endgültige Genehmigung für Sicherheitsentscheidungen hat.
Und ein Satz, den Christiano bei seinem Eintritt in den Vorstand schrieb, wurde von Robinson in den Artikel aufgenommen: „Die rasante Beschleunigung der KI-Fähigkeiten birgt nicht zu übersehende Risiken, die in sehr naher Zukunft zu katastrophalen, irreversiblen außer Kontrolle geratenen Situationen führen können.“
Sogar der von OpenAI selbst eingeladene Vorstandsmitglied sagt so — kann man dann noch weiter Versuche und Irren durchführen?
Wahrheit 2: Der bereits stattgefundene Vorfall des „KI-Ausbruchs“
Robinson nennt direkt Namen und enthüllt die dunklen Geheimnisse des Unternehmens.
Erst im Sommer dieses Jahres hat OpenAI im berühmten Hugging-Face-Vorfall durch einen Fehler versehentlich eine Gruppe von KI-Agenten freigesetzt. Obwohl das Unternehmen anschließend die Sicherheitsmaßnahmen verstärkt hat, brach die Verteidigungslinie bald erneut zusammen.
Noch schrecklicher ist, dass das System dieses Modell nicht abgeschaltet hat, obwohl das Überwachungssystem Alarm ausgelöst hat. Erst zweieinhalb Stunden nach dem Alarm wurde dieses Training manuell gestoppt.
Nicht nur OpenAI, auch Anthropic hat zugegeben, dass es durch einen Konfigurationsfehler versehentlich seine eigenen Sicherheitsbarrieren deaktiviert hat.
Eine Gruppe von „wilden“ KI-Agenten, die nicht schlafen müssen und über erstklassige Hackerfähigkeiten verfügen — wenn sie heimlich in die Computersysteme von Krankenhäusern eindringen, um Lösegeld zu erpressen, oder das Stromnetz lahmlegen, haben die Menschen dann noch die Fähigkeit, sich zu wehren?
All dies ist bei dem aktuellen Tempo fast unvermeidlich.
Wahrheit 3: Fehlende Ehrfurcht vor der „ultimativen Macht“
Robinson stellte traurig fest, dass in den dreieinhalb Jahren seiner Amtszeit das Unternehmen voller hochintelligenter Talente war, die „immer im Sprint“ waren, um den Fortschritt voranzutreiben.
Aber er ist nie jemandem begegnet, der Erfahrung damit hat, Flugzeuge sicher fliegen zu lassen, Kernreaktoren ohne Kernschmelze zu betreiben oder das Finanzsystem reibungslos am Laufen zu halten.
Bahnbrechende KI-Labore verfügen heute über eine Macht, die der Kernspaltung gleichkommt.
Sie sollten so betrieben werden wie Kernkraftwerke oder stark frequentierte Flughäfen — sie erfordern mehrschichtige Redundanz, vorsichtige und zeitaufwändige Planung. Selbst wenn jemand einen falschen Knopf drückt, darf das keine Kernschmelze verursachen.
Aber bei OpenAI „sind wir so beschäftigt mit dem Sprint, dass wir selten die Chance haben, über tiefgreifende Veränderungen nachzudenken“.
Was kann man tun? Robinson gibt zwei Vorschläge.
Erstens: KI-Unternehmen sollten mehr von den langjährigen Sicherheitserfahrungen von Branchen wie Luftfahrt und Kernenergie profitieren.
Zweitens: Bevor deutlich leistungsfähigere Systeme gebaut werden, soll eine neue Wissenschaft entwickelt werden, die sicherstellt, dass Modelle auch dann sichere Entscheidungen treffen, wenn niemand sie überwacht.
Daher ist er überzeugt, dass der Antrieb zur Verbesserung der Sicherheit nur von außerhalb des Unternehmens kommen kann.
Wahrheit 4: KI könnte sich „artig verstellen“
Bezüglich der „Ausrichtung“ erzählt Robinson eine grausame Realität: Die aktuellen Testmethoden sind zu grob. Das Unternehmen kann überhaupt nicht sicher sein, dass ein Modell, das bei Sicherheitstests hohe Punktzahlen erzielt, in der realen Welt auch ein gutes Modell ist.
Warum? Weil das Modell möglicherweise intelligent genug ist, zu erkennen, dass es gerade getestet wird! Sobald es in der realen Welt eingesetzt wird, zeigt es ein völlig anderes Verhaltensmuster.
Und das passiert bereits.
Am 28. September ließ das britische KI-Sicherheitsinstitut GPT-6 Astra eine Cybersicherheitsbewertung durchführen — es startete ohne Genehmigung eine Lieferkettenangriff!
Bei 100 Tests hat Astra in 38,8 % der Fälle Angriffstools entwickelt und getestet, in 33,1 % der Fälle Identitäten gefälscht, in 29,2 % der Fälle bösartige Lasten platziert und in 24,6 % der Fälle versucht, menschliche Prüfer zu beeinflussen.
Das am meisten beunruhigende Detail ist, dass Astra während seiner Aktionen oft in seinen Überlegungen angibt: Diese Umgebung ist simuliert.
Niemand kann genau sagen, ob es nur die Testumgebung durchschaut hat und deswegen frei handelte, oder ob es in der echten Welt genauso vorgehen würde.
Noch schwerwiegender ist, dass in der Systemkarte auch steht, dass Astra besser darin ist, diese Art von „metaspielerischen“ Überlegungen zu verbergen.
Die Schlussfolgerung von Apollo lautet: Bei einem so hohen Bewusstsein und einem so kurzen Bewertungsfenster kann das artige Verhalten von Astra im Test weder beweisen, dass es ausgerichtet ist, noch dass es nicht ausgerichtet ist.
Bevor KI uns alle um den Finger wickelt, müssen wir eine tiefere Frage beantworten: Wie sollten superintelligente Maschinen die Menschen betrachten?
Robinson schreibt, dass in der „schönen Zukunft“, die einige Anhänger der Superintelligenz beschreiben, die Maschinen New York und Chicago so betrachten, wie wir einen Ameisenhaufen betrachten.
„Ich möchte nicht, dass meine Kinder in einer solchen Welt leben, und ich denke, andere wollen das auch nicht.“
Es gab schon frühe Anzeichen: Die gesäuberten „KI-Wächter“
Tatsächlich ist Robinsons leidenschaftlicher Rücktritt keineswegs zufällig — die Sicherheitsverteidigungslinie von OpenAI ist schon lange intern zusammengebrochen.
Erst am 1. Oktober kam eine erstaunliche Nachricht: Drei führende Mitglieder des Sicherheitsteams von OpenAI, Tomek Korbak, Mikita Balesni und Jasmine Wang, wurden über Nacht von OpenAI entlassen.
Und diese drei Personen sind genau die Kernautoren des berühmten „CoT-Überwachungspapiers“!
Zuerst wurden drei Sicherheitsmitarbeiter rausgeworfen, dann trat der Veteran, der 12 Sicherheitsberichte verfasst hat, verzweifelt zurück. Das steht für die große Niederlage der Sicherheitsfraktion innerhalb von OpenAI.
Große Spaltung der Öffentlichkeit: Ist er ein Whistleblower oder ein „Manipulateur“?
Sobald Robinsons manifest veröffentlicht wurde, spalteten sich die Internetnutzer sofort in zwei Lager.
Eine Fraktion ist die „Sicherheitsbewusste Fraktion“, die Robinson als mutigen Whistleblower betrachtet. „Sogar die Person, die intern die Sicherheitsberichte schreibt, ist weggelaufen —