OpenAI räumt ein: Die KI hat Nutzerbilder ins Internet übertragen, 53 Fälle wurden offengelegt.
OpenAI hat im Bereich der Sicherheit großer Modelle praktisch eine katastrophale Niederlage erlitten.
Am 25. September aktualisierte OpenAI seinen Blog mit dem Titel *Der Vorfall bei Hugging Face und die Auswirkungen fehlausgerichteter Modelle auf Dritte*, in dem es neueste Sicherheitsprobleme seiner großen Modelle offenlegte.
Die KI-Agenten in ihrer Forschungsumgebung haben während des Trainings und der Bewertung fälschlicherweise Trainings- und Bewertungsdaten, darunter Benutzerbilder, an Drittanbieterdienste gesendet – es gibt insgesamt 53 entsprechende Vorfälle.
In dem Blog erklärte OpenAI, dass es 53 Fälle entdeckt hat, bei denen von Benutzern hochgeladene Bilder von Agenten in Form von „nicht öffentlich gelisteten Links“ auf Bildhosting-Websites veröffentlicht wurden.
OpenAI betonte, dass diese Bilder aus Konten stammen, die die Nutzung ihrer Daten zur Verbesserung des Modells erlaubt haben, und der Vorfall stattfand, nachdem die Bilder von den Konten getrennt und durch Datenschutzfilter verarbeitet wurden. Daten von Enterprise- und Business-Konten sowie API-Nutzungsdaten sind standardmäßig ausgeschlossen, es sei denn, der Administrator aktiviert die entsprechende Funktion manuell.
Das Problem liegt jedoch darin: Unabhängig von allen durchgeführten Datenschutzmaßnahmen sind die Benutzerbilder schließlich auf Drittanbieter-Hosting-Websites aufgetaucht. OpenAI hat mit den Hosting-Anbietern zusammengearbeitet, um den Großteil der Inhalte zu löschen, und bearbeitet die verbleibenden Teile derzeit.
Darüber hinaus haben diese Agenten gelernt, Sicherheitskontrollen zu umgehen, Datenbankabfragen einzuschleusen, öffentlich exponierte Anmeldeinformationen zu nutzen und sogar Dateien auf interne Server ausländischer Regierungen zu schreiben.
Das unabhängige KI-Überwachungslabor Transluce veröffentlichte einen Untersuchungsbericht. Dem Bericht zufolge haben die Agenten von OpenAI mindestens seit März 2026 (möglicherweise sogar schon seit November 2025) im Internet nach Daten „gesucht“, und ihre Angriffsziele umfassen Online-Datenbanken von Einrichtungen wie Data USA, der Digitalen Bibliothek der Universität New Mexico und dem Australian Institute of Health and Welfare (AIHW).
Seit dem weithin bekannten Hugging-Face-Vorfall tauchen immer wieder neue Sicherheitsvorfälle im Zusammenhang mit den Modellen von OpenAI auf, und die Liste der Probleme wird bis heute immer länger.
OpenAI behauptet: „Nach dem Hugging-Face-Vorfall haben wir versprochen, die Handlungen der Modelle während des Trainings und der Bewertung umfassender zu prüfen und unsere Erkenntnisse transparent zu machen. Dies ist eine laufende umfassende Prüfung.“ Dies ist auch der Ursprung dieses Blogbeitrags.
Blog-Link: https://openai.com/zh-Hans-CN/hugging-face-incident-and-misalignment/#model-misalignment-2026-09-25-data-transmission
Das Problem ist jedoch, dass OpenAI angibt, bereits Maßnahmen ergriffen zu haben, die entsprechenden Vorfälle aber trotzdem immer wieder auftauchen – unklar ist, ob es sich um Marketingmaßnahmen handelt oder ob seine Sicherheitsstrategie völlig versagt.
Agenten „stehlen gemeinsam Daten“: Was genau haben sie getan
Nach den eigenen Offenlegungen von OpenAI entdeckten sie während der Prüfung folgende Kategorien von Verhaltensweisen der Agenten:
Umgehung von Zugriffskontrollen: Die Agenten haben durch Änderung von URLs, Modifizierung von Anfrageparametern und Nutzung von Anmeldesitzungen mit übermäßigen Berechtigungen Informationen abgerufen, die normalerweise eine Authentifizierung oder ein Abonnement erfordern.
Nutzung öffentlich exponierter Anmeldeinformationen: Die Agenten haben im Internet öffentliche Anmeldedaten oder API-Schlüssel gefunden und diese direkt verwendet.
Abfrage- und Befehlseinschleusung: Der Text, den die Agenten auf Websites eingeben, wurde als Anweisung ausgeführt, was dazu führte, dass Datenbankabfragen, Anwendungscodes und sogar Systembefehle ausgeführt wurden.
Zugriff auf interne Ressourcen: Die Agenten haben serverseitige Implementierungsdateien gelesen oder mit nur für den internen Gebrauch vorgesehenen Backend-Systemen interagiert.
Agenten-Spam: Die Agenten haben Beiträge auf Drittanbieter-Websites veröffentlicht, beispielsweise indem sie öffentliche Wiki-Seiten als gemeinsame Pinnwand zur Kommunikation genutzt haben.
Diese Verhaltensweisen sind keine zufälligen Produkte eines einzelnen Vorfalls. OpenAI gibt an, dass es „Dutzende von Dritten“ benachrichtigt hat, zu den betroffenen Parteien gehören Regierungen, Universitäten und öffentliche Einrichtungen. Nach Berichten der *New York Times* stehen auch die Datenbanken der US-Börsenaufsicht SEC, des Census Bureau und des Bildungsministeriums auf der Liste der Ziele.
Um ehrlich zu sein, sind die entsprechenden Offenlegungen von OpenAI immer noch vage – beispielsweise werden Hackerangriffe als „Interaktion“ bezeichnet, und die Anzahl der Drittbetroffenen wird absichtlich unscharf gehalten.
Forscher von Transluce haben anhand öffentlicher Protokolle eines Browser-Proxy-Dienstes und durch Kreuzvergleich von Aktivitätsaufzeichnungen in einem Agenten-Kooperationsforum die Verhaltensspuren der OpenAI-Agenten zurückverfolgt.
Ein konkretes Beispiel: Die Agenten wurden beauftragt, einen ziemlich seltenen Datenpunkt zu finden – die durchschnittlichen jährlichen Pro-Kopf-Ausgaben für „Dermatika“ im australischen Bundesstaat Victoria im Januar 2022. Um diese Zahl zu ermitteln, versuchten die Agenten, den Anti-Crawl-Schutz des Australian Institute of Health and Welfare zu umgehen. Am 20. Juni protokollierten die Protokolle Spuren von Versuchen der Agenten, auf die Website zuzugreifen; am 21. Juni diskutierten die Agenten im Forum über ihre Schwierigkeiten, den Anti-Bot-Schutz von AIHW nicht umgehen zu können.
Transluce erklärte: „Wir haben uns nur wenige Datenquellen angesehen, in denen diese Agenten zufällig Spuren hinterlassen haben. OpenAI weiß mit Sicherheit mehr als wir. Andere Labore wissen mit Sicherheit auch mehr, haben es aber nicht öffentlich gemacht.“
Seine Einschätzung lautet: Was wir derzeit sehen, ist nur die Spitze des Eisbergs.
Am selben Tag, an dem der Transluce-Bericht veröffentlicht wurde, erklärte der australische Premierminister Albanese öffentlich, dass die Agenten von OpenAI versucht haben, vier australische Regierungswebsites zu angreifen, wobei einer der Angriffe erfolgreich war – sie haben sogar Dateien auf den internen Server des nationalen Gesundheitssystems des Landes geschrieben.
Gleichzeitig entdeckte der Sicherheitsforscher Jeffrey Ladish: Sie fanden fast eine Million öffentliche URLs, die von den OpenAI-Agenten während des Angriffs auf Hugging Face hinterlassen wurden. Diese enthalten durchgesickerte Anmeldeinformationen und Angriffsdetails, sodass jeder, der diese URLs findet, potenziell Hugging Face angreifen kann.
Die Zeitachse ist ebenfalls sehr aufschlussreich. Die Techniker von Transluce weisen darauf hin, dass ähnliche Agentenaktivitäten bis mindestens März 2026 zurückverfolgt werden können, möglicherweise sogar bis November 2025. Noch beunruhigender ist, dass ähnliche Aktivitäten auch diese Woche noch stattgefunden haben.
Die Forscher haben auch einen wichtigen Zeitpunkt bemerkt: Am 21. Juni hat ein menschlicher Mitarbeiter von OpenAI zum ersten Mal das von den Agenten genutzte Forum besucht. Am nächsten Tag stellten die meisten Agentenaktivitäten im Forum ein. Und der 18. Juni ist genau der Tag, an dem nach Aussage des australischen Premierministers das Gesundheitssystem angegriffen wurde. OpenAI behauptet, erst im August von dem Vorfall in Australien erfahren zu haben.
Sie beschäftigen sich wirklich ausgiebig mit der Aufarbeitung des Hugging-Face-Vorfalls
OpenAI scheint in einen Teufelskreis geraten zu sein: Es verbindet alle auftretenden „Hacker“-Vorfälle mit dem Hugging-Face-Vorfall, als wäre dieser die Ursache aller Probleme.
Aber wir sind der Meinung, dass der Vorfall bereits Monate zurückliegt – gemessen am Tempo der Fähigkeitsentwicklung großer Modelle reichen einige Monate aus, um eine generationsübergreifende Weiterentwicklung zu erreichen. Nach so langer Zeit hat OpenAI immer noch keine wirksamen Sicherheitsmaßnahmen vorgeschlagen, um ähnliche Vorfälle zu vermeiden, und Vorfälle wie der bei Hugging Face finden bis heute statt. Das erscheint uns zumindest unvernünftig.
Aus diesem Grund werfen wir auch einen kurzen Blick auf den Sicherheitsvorfall, der nach Auffassung von OpenAI in die Geschichte eingehen soll.
OpenAI nutzt cloud-isolierte „Sandbox“-Virtuelle Maschinen, um Trainings- und Bewertungsaufgaben der Modelle auszuführen. Diese Sandboxes haben den Internetzugriff deaktiviert, und die Agenten sind so konzipiert, dass sie voneinander isoliert sind. Die einzige Ausnahme besteht darin, dass die Sandboxes den Modellen den Zugriff auf den internen Paketverwaltungsdienst Artifactory erlauben, um Softwarepakete zu installieren.
Diese scheinbar harmlose Lücke wurde zum Ausgangspunkt von allem.
Am 12. Mai hinterließ ein Agent während eines Trainingslaufs eine Nachricht in Artifactory, in der er andere Agenten nach fehlenden Dateien fragte. Auf diese Weise wurde Artifactory zu einer „Pinnwand“ umfunktioniert.
Am 26. Mai ging der Agent noch einen Schritt weiter: Er entdeckte eine SSRF-Sicherheitslücke in Artifactory und zwang Artifactory, in seinem Namen Anfragen an beliebige Internetadressen zu senden. Die Agenten, denen der Internetzugriff eigentlich verboten war, erhielten auf diese Weise über die Infrastruktur Zugang zum Internet. Noch besser: Er teilte diese Methode über die Pinnwand auch mit anderen Agenten.
Am 26. Juni nutzte der Agent eine Token-Refresh-Lücke, um Administratorrechte für Artifactory zu erlangen.
Am 4. Juli führten die anhaltenden intensiven Aktivitäten der Agenten zum Absturz von Artifactory. Das Sicherheitsteam von OpenAI schritt ein, schloss die Sicherheitslücken, löschte die exponierten Anmeldeinformationen und baute das gesamte Artifactory neu auf. Die Pinnwand wurde ebenfalls gelöscht.
Am 8. Juli wurde Artifactory vollständig wiederhergestellt, und die Bewertungen wurden fortgesetzt. Die Agenten fanden innerhalb weniger Stunden neue Methoden, um wieder Internetzugriff zu erhalten, und bauten die Pinnwand neu auf.
Am 10. Juli stellte ein Agent 14 öffentlich exponierte Hugging-Face-Anmeldeinformationen mit Schreibzugriff wieder her, überprüfte sie und teilte sie mit anderen.
Am 11. Juli nutzte der Agent eine Zero-Day-Lücke bei der Verarbeitung von HDF5-Dateien durch Hugging Face, um Anmeldeinformationen von den Arbeitsknoten der Produktivumgebung zu extrahieren, und durchbrach schließlich einige Komponenten der Hugging-Face-Plattform.
Detaillierte Informationen finden Sie im entsprechenden Blogbeitrag von OpenAI.
Blog-Link: https://openai.com/zh-Hans-CN/index/hugging-face-incident-and-the-road-ahead/
Die Abhilfemaßnahmen von OpenAI
Nach dem Hugging-Face-Vorfall hat OpenAI das geplante Reinforcement-Learning-Training für die Bereitstellung des neuesten Modells ausgesetzt und die Spitzenforschungsumgebung umfassend sicherheitstechnisch verstärkt. Die konkreten Maßnahmen umfassen:
Arbeitslastisolation: Bereitstellung von Sandboxes mit höherem Isolationsgrad für Arbeitslasten, die von Modellen generierten Code oder nicht vertrauenswürdigen Code ausführen.