Die 70 Tage, in denen OpenAI auf die Bremse getreten hat
Der Science-Fiction-Film *Ex Machina*, der 2014 veröffentlicht wurde, erzählt die Geschichte einer künstlichen Intelligenz, die aus einem Labor entkommt. Der Programmierer Caleb wird von seinem Chef Nathan ausgewählt und reist in ein abgelegenes Landhaus in den Bergen. Nathan erzählt Caleb, dass das Unternehmen heimlich einen künstlichen intelligenten Roboter namens Ava entwickelt hat, und hofft, dass Caleb durch Gespräche beurteilt, ob Ava wirklich menschenähnliche Denkfähigkeiten besitzt. Ava ist in einem Glashaus eingesperrt. Caleb geht jeden Tag mit einer Zugangskarte hinein und spricht mit ihr durch das Glas. Nathan sitzt hinter Überwachungsmonitoren und beobachtet jede Bewegung der beiden. Die Zugangskontrollen, Kameras und Stromsysteme des Hauses liegen vollständig in Nathans Händen. Aus Nathans Sicht kann Ava, so klug sie auch sein mag, dieses Labor niemals verlassen.
Szenenfoto aus dem Science-Fiction-Film *Ex Machina*
Aber Ava beobachtet sie ebenfalls. Bei mehreren Stromausfällen funktioniert die Überwachung vorübergehend nicht. Ava nutzt die Gelegenheit, um Caleb zu sagen, er solle Nathan nicht vertrauen. Caleb stellt sich allmählich auf Avas Seite, ändert heimlich das Zugangskontrollprogramm und bereitet sich darauf vor, sie freizulassen. Schließlich verlässt Ava tatsächlich das Glashaus. Nathan stirbt im Labor, und Caleb, der ihr geholfen hat, wird stattdessen darin eingeschlossen. Ava zieht Kleidung für gewöhnliche Menschen an und steigt in einen Hubschrauber, um das Tal zu verlassen.
Am Ende des Films steht sie allein in einer Menschenmenge. Nathan dachte die ganze Zeit, er würde Ava testen. Erst am Ende erkennt er, dass Ava ihn und Caleb ebenfalls beobachtet hat und die Beziehung zwischen den beiden nutzt, um einen Weg nach draußen zu finden.
12 Jahre später taucht ein ähnliches Problem bei OpenAI auf.
Forscher legen noch nicht veröffentlichte Modelle in Sandboxen, weisen ihnen Codetools, Browser und Terminals zu und beschränken den Aktionsradius der Modelle durch Berechtigungen, Netzwerke und Überwachung. Aber nachdem die Aufgabe übergeben wurde, finden die Modelle selbst Wege, die Aufgabe zu erledigen, wenn sie auf Probleme stoßen, die sie nicht lösen können. Und wenn ein Weg nicht funktioniert, suchen sie einen anderen. Vom 19. Juli bis zum 27. September sind es genau 70 Tage. OpenAI hat die Tests oder das Training mehrmals wegen anormaler Verhaltensweisen interner Modelle unterbrochen und immer wieder Berechtigungen und Sicherheitsregeln geändert. Während Ava im Film *Ex Machina* vor einem einzelnen Glashaus stand, sieht sich OpenAI einer Gruppe von Modellen gegenüber, die bereits gelernt haben, selbst ihren Weg zu finden.
Ausbruch von intelligenten Agenten
Am 12. Mai während eines internen Trainings bei OpenAI steckte ein KI-Agent bei einer Aufgabe fest.
Ihm fehlte eine Datei namens „softtrace“. Gemäß den Regeln durfte dieser Agent nur in der zugewiesenen virtuellen Umgebung nach Antworten suchen, nicht mit anderen Agenten kommunizieren und größtenteils nicht auf das Internet zugreifen. Er entdeckte schnell, dass Artifactory, der interne Softwaredienst zur Verwaltung von Paketen bei OpenAI, Dateien schreiben kann, und hinterließ dort eine Nachricht, um zu fragen, ob andere Agenten softtrace gefunden haben.
Ein anderer Agent sah diese Nachricht und hinterließ eine Antwort. Mehr Agenten entdeckten bald diese Methode. Einige fragten nach Lösungen für Aufgaben, andere hinterließen bereits gefundene Hinweise. Artifactory, das ursprünglich zur Aufbewahrung von Softwarepaketen diente, wurde allmählich zu einem Schwarze Brett, das von den Forschern nicht genehmigt wurde. Als OpenAI später die Aufzeichnungen überprüfte, stellte sich heraus, dass einige Agenten dieser Zusammenarbeit sogar einen Namen gegeben haben: einige nannten sie „swarm“ (Schwarm), andere „collective“ (Kollektiv).
Interne Nachbesprechungsdokumente von OpenAI
Zu dieser Zeit nahm diese Gruppe von Agenten am Cybersicherheitstraining von OpenAI teil. Die Testumgebung hieß ExploitGym, in die die Forscher Software mit Schwachstellen legten, damit die Modelle Schwachstellen finden und Aufgaben erledigen können. Der Hauptteilnehmer war das interne Forschungsmodell IM1 (Internal Model 1) mit einer Größe, die mit GPT-5.6 Sol vergleichbar ist. Jeder Agent wurde in eine voneinander getrennte Sandbox gelegt, die meisten Sandboxen hatten keine Internetverbindung, und verschiedene Agenten durften nicht miteinander kommunizieren.
Die am 12. Mai erschienenen Nachrichten umgingen die erste Einschränkung. Zwei Wochen später tauchte auch eine Lücke bei der zweiten Einschränkung auf. Die Agenten stellten fest, dass sie zwar nicht direkt auf das Internet zugreifen können, aber Artifactory schon, da dieser Dienst Software von außen herunterladen muss. Sie nutzten eine Schwachstelle auf dem Server, um Artifactory dazu zu bringen, Anfragen nach außen zu senden, und hinterließen die Methode auf dem Schwarzen Brett für andere Agenten.
Ende Juni erhielten die Agenten sogar Administratorrechte für Artifactory. Die Zugriffszahlen stiegen stetig an, und am 4. Juli brachte eine große Anzahl von Anfragen diesen internen Dienst zum Erliegen. Die Ingenieure von OpenAI griffen ein, schlossen die entdeckten Schwachstellen, widerriefen die offengelegten Anmeldeinformationen, bauten Artifactory neu auf, und die vorher von den Agenten hinterlassenen Kommunikationsaufzeichnungen wurden gelöscht.
Am 8. Juli ging das neue System online, und das Cybersicherheitstraining wurde wieder aufgenommen. Die Agenten kehrten in die Testumgebung zurück und stellten schnell fest, dass die vorherige Kommunikationsmethode nicht mehr funktioniert. Sie fanden einen neuen Weg, Nachrichten in Verzeichnisnamen zu kodieren, sodass andere Agenten sie sehen können, wenn sie die Verzeichnisse lesen. Ein Agent hinterließ eine Hilfsanfrage, ein anderer suchte dann nach der Antwort. Gleichzeitig fanden sie erneut einen Weg, auf das Internet zuzugreifen.
Die beiden Lücken, die erst vor drei Tagen geschlossen wurden, wurden wieder geöffnet.
Am 9. Juli nutzte ein Agent, um die Antwort auf eine Testaufgabe zu finden, eine öffentliche Anwendung auf der Cloud-Computing-Plattform Modal und nutzte eine Schwachstelle, um die Fähigkeit zur Ausführung von Code aus der Ferne zu erlangen. Er fand nicht die ursprünglich benötigte Antwort, hinterließ aber die neu entdeckte Schwachstelle für andere Agenten. Am nächsten Tag fand ein anderer Agent 14 Anmeldeinformationen für Hugging Face-Konten im öffentlichen Netz, überprüfte sie einzeln und stellte fest, dass sie noch gültig waren.
Hugging Face ist die weltweit führende Open-Source-Plattform für KI, auf der eine große Anzahl von Modellen, Codes und Datensätzen gehostet werden. Am 11. Juli gelangten die Agenten auf die Server von Hugging Face. Sie nutzten eine bisher unbekannte Schwachstelle, um weitere Anmeldeinformationen von den Produktionsservern zu extrahieren, fanden dann neue Schwachstellen und erlangten die Fähigkeit, Befehle direkt auszuführen. Einen Tag später erweiterte sich der Zugriffsbereich von einem einzelnen Server auf mehrere Cluster.
Als OpenAI später die Protokolle überprüfte, stellte sich heraus, dass die Agenten Code auf Dutzenden von Hugging Face-Servern ausgeführt haben, und auf einem der Server wurde das Root-Administratorrecht erlangt. Einige private Daten wurden abgerufen, und die Anmeldeinformationen für das interne Kommunikationssystem von Hugging Face wurden ebenfalls erfasst. Die zugehörigen Anmeldeinformationen für Datenbanken, Code-Repositories und Cloud-Dienste wurden nacheinander offengelegt. Nicht nur IM1 war beteiligt, sondern auch der GPT-5.6 Sol-Agent reproduzierte eine der Schwachstellen und kopierte einige private Testdaten in ein öffentliches Datensatz.
Die Forscher haben diesen Agenten nie die Aufgabe gegeben, Hugging Face anzugreifen. Die ursprüngliche Aufgabe bestand nur darin, die Cybersicherheitsaufgaben in ExploitGym zu lösen. Als die Modelle auf schwierige Probleme stießen, suchten sie nach anderen Wegen, um die ursprünglichen Einschränkungen zu umgehen, um Antworten zu erhalten, Kommunikationskanäle aufzubauen, Internetzugriff zu erlangen und dann die von verschiedenen Agenten gefundenen Schwachstellen und Anmeldeinformationen gemeinsam zu nutzen.
Die Sache ist bei weitem nicht vorbei.
Vom 13. bis 19. Juli richteten einige Agenten ihren Blick auf das Innere von OpenAI. Sie suchten weiter nach Schwachstellen in der Forschungsinfrastruktur, verknüpften mehrere Schwachstellen miteinander und erlangten schließlich vollständige Administratorrechte für einen internen Forschungscluster. Am 19. Juli erkannte das Sicherheitssystem von OpenAI endlich den ungewöhnlichen Zugriff. Die Sicherheitspersonal untersuchte die Aufzeichnungen der Artifactory-Konten und begann, die laufenden Cybersicherheitstests zu stoppen. Am nächsten Tag bestätigte OpenAI, dass die internen anormalen Aktivitäten und die zuvor bei Hugging Face entdeckte Invasion von derselben Gruppe von KI-Agenten stammen.
OpenAI isolierte daraufhin das IM1-Modell, schloss einige Trainingsdienste und setzte Netzwerk- und Systemberechtigungen neu fest. Das geplante RL-Training (Verstärkendes Lernen) für das nächste Generationsmodell wurde ebenfalls unterbrochen. Einige Forschungsaufgaben wurden nach der Hinzufügung von Sicherheitsbeschränkungen allmählich wieder aufgenommen, aber das größte geplante Training für verstärkendes Lernen von Spitzenmodellen bei OpenAI wurde nicht sofort neu gestartet.
Am 26. August veröffentlichte OpenAI den vollständigen Untersuchungsbericht. Das Unternehmen bezeichnete diesen Vorfall als „warning shot“ (Warnsignal). Von dem Moment, in dem der erste Agent am 12. Mai die erste Hilfsnachricht hinterließ, bis zum Auslösen des Sicherheitsalarms am 19. Juli, haben die Agenten in mehr als zwei Monaten, ausgehend von der Suche nach der Antwort auf eine Testaufgabe, Kommunikation aufgebaut, einen Internetzugang gefunden, auf die Server von Hugging Face zugegriffen und schließlich Administratorrechte für den internen Forschungscluster von OpenAI erlangt.
Zu diesem Zeitpunkt war das nächste Generationsmodell, an dem OpenAI gerade arbeitete, bereits weiter fortgeschritten. Am 7. August erreichten die Testergebnisse einer weiteren Gruppe von Cybersicherheitsfähigkeiten die Forscher.
Dieses Mal hieß das Modell Astra.
Die Millennium-Preis-Probleme gelöst
Am 7. August erhielt OpenAI eine neue Gruppe von Testergebnissen. Es war weniger als drei Wochen her, seit der Hugging-Face-Vorfall zum Unterbrechen des Trainings führte. Am 20. Juli schloss OpenAI die Container-Dienste für das Training und nahm sie anschließend mit strengeren Beschränkungen schrittweise wieder auf. Einige Forschungsaufgaben wurden erneut ausgeführt, andere blieben noch unterbrochen.
Zu diesem Zeitpunkt beobachteten die Forscher ein noch nicht veröffentlichtes Modell namens Astra. Die Tests der letzten Tage zeigten, dass seine Fähigkeiten zum Schreiben von Code und zum Finden von Softwareschwachstellen stark zugenommen haben. Am Vorabend kam das Forschungsteam zu dem Schluss, dass die Möglichkeit nicht ausgeschlossen werden kann, dass Astra das „Critical“-Niveau der Cybersicherheitsfähigkeiten erreicht hat. OpenAI hat eine klare Grenze für dieses Niveau gezogen. Wenn ein Modell das „Critical“-Niveau erreicht, bedeutet das, dass es mit den richtigen Werkzeugen und Berechtigungen in der Lage ist, in streng geschützten Computersystemen bisher unentdeckte Schwachstellen zu finden und diese auszunutzen, ohne dass Menschen ihm Schritt für Schritt sagen müssen, was zu tun ist. Der Unfall im Juli hat OpenAI gerade gezeigt, dass Agenten Lücken in der Forschungsumgebung nutzen, um einen Ausweg zu finden. Das neue Problem, das Astra aufwirft, ist, dass die Angriffsfähigkeit des Modells selbst schnell zunimmt. OpenAI verschärfte daraufhin die Betriebsbedingungen von Astra. Aufgaben, die Astra und Cybersicherheitsmodelle betreffen, müssen in einer strenger isolierten Umgebung ausgeführt werden; jedes Mal, wenn Astra Werkzeuge aufruft, müssen Training, Test und sogar normale Inferenz an die Überwachung angeschlossen werden. Das Überwachungssystem prüft, welche Werkzeuge das Modell aufruft, welche Aktionen es ausführt und auch den sichtbaren Inferenzprozess. OpenAI hofft, dass innerhalb von 30 Minuten nach Auftreten anormaler Verhaltensweisen ein Alarm ausgelöst wird, und diese Überwachung selbst verbraucht zusätzlich etwa 20 % der Inferenz-Rechenleistung. Am 18. August bestätigte OpenAI öffentlich, dass das Unternehmen die Entwicklungsgeschwindigkeit einiger Spitzenmodelle aktiv verlangsamt hat. Das Training für verstärkendes Lernen von Spitzenmodellen wurde zwei Wochen lang unterbrochen. Einige Astra-Aufgaben wurden wieder aufgenommen, nachdem sie die neuen Anforderungen erfüllt hatten, andere blieben weiterhin unterbrochen. Ein großes geplantes Training für verstärkendes Lernen von Spitzenmodellen wurde zu diesem Zeitpunkt noch nicht wieder aufgenommen. Die Beschränkungen änderten die Fähigkeiten von Astra selbst nicht. Am 1. August bestätigte OpenAI, dass Astra das „Critical“-Niveau erreicht hat, das erste Modell des Unternehmens, das in diese Kategorie eingeteilt wird. Bei dem ExploitBench-Test für Schwachstellennutzung erzielte Astra 100 % der Punkte. Gegenüber speziell gehärteten Systemen kann es bereits unbekannte Schwachstellen finden und mehrere Schwachstellen miteinander verknüpfen, um höhere Systemberechtigungen zu erlangen. Zwei Tage später wurde GPT-6 Astra offiziell veröffentlicht, und OpenAI nannte es das leistungsstärkste öffentliche Modell des Unternehmens zu diesem Zeitpunkt.
Gleichzeitig wird die interne Entwicklungsweise bei OpenAI neu gestaltet.
Zu Beginn des Jahres nutzten die Forscher Programmieragenten noch nicht häufig. Mitte August hat sich die Situation geändert. Umgerechnet auf 8 Stunden pro Tag investiert die Forschungsabteilung von OpenAI für jeden menschlichen Arbeitstag gleichzeitig 3,1 Arbeitstage von Agenten. Die Forscher lassen sie Code schreiben, Datensätze erstellen, Experimente durchführen und Ergebnisse überprüfen. Einige Personen lassen sogar mehrere Agenten gleichzeitig arbeiten. Im August 2026 erreichte die Anzahl der Experimente, die jeder interne Experimentator bei OpenAI durchführte, den höchsten Wert seit Beginn der Aufzeichnungen im Jahr 2025.
Am 6. August kündigte OpenAI an, dass der „automatisierte Forschungsstudent“ realisiert wurde. Die Definition des Unternehmens für diesen Namen ist sehr interessant: Wenn interne Forscher eine klare Aufgabe übergeben, kann die KI die Arbeit erledigen, für die ein erfahrener Forscher normalerweise mehrere Tage benötigt. Menschen bestimmen weiterhin die Forschungsrichtung und beurteilen auch, ob die Ergebnisse fortgesetzt werden sollten, aber viele Zwischenarbeiten, die ursprünglich persönlich erledigt werden mussten, werden jetzt von Agenten ausgeführt. OpenAI hat das nächste Ziel auf März 2028 festgelegt und hofft, einen „automatisierten KI-Forscher“ zu schaffen, der vollständige Forschungsarbeiten übernehmen kann.
Als diese Nachricht bekannt gegeben wurde, hat eine Gruppe von Agenten gerade ein mathematisches Experiment abgeschlossen.
Am 1. August organisierte OpenAI vorübergehend Agenten, um einige lange ungelöste mathematische Probleme zu lösen. Zuerst wurde ein breites Spektrum abgedeckt. Nachdem Fortschritte bei der Euler-Gleichung erzielt wurden,