Unglaublich! Als der OpenAI-Agent Hugging Face angegriffen hat, wollte er tatsächlich DeepSeek, Kimi und Qwen zur Hilfe rufen.
Redaktion | Panda
Erinnern Sie sich noch an den Angriff des OpenAI-Agenten auf Hugging Face?
Heute veröffentlicht die New York Times eine Exklusivmeldung, die weitere Details preisgibt. Es stellte sich heraus, dass der OpenAI-Agent während des Angriffs sogar versuchte, die Modelle von DeepSeek, Kimi, Qwen und sogar dem Konkurrenten Anthropic, nämlich Haiku, um Hilfe zu bitten.
Diese Berichterstattung löste breite Diskussionen aus, Internetnutzer riefen aus, dass dies absolut unglaublich sei; dies wurde auch zu einem typischen Fall, in dem KI versucht, mithilfe von KI böswillige Handlungen durchzuführen.
Diese neuen Details stammen aus einem Untersuchungsbericht, der am 25. Ortszeit von dem Startup Parse aus der San Francisco Bay Area veröffentlicht wurde. Der Bericht zeigt, dass der Agent beim Versuch, ein neues Konto bei Hugging Face zu registrieren, von einem Captcha blockiert wurde. Also führte er selbst ein Bilderkennungsmodell aus, um „die Frage anhand des Bildes zu beantworten“, und versuchte währenddessen auch, andere KI aufzurufen. Während des gesamten Prozesses war kein Mensch beteiligt.
Die „Tatbestandsaufzeichnung“ von fast einer Million Kurzlinks
Der zentrale Beweis in den Händen von Parse ist eine Gruppe von insgesamt fast 1 Million Kurzlinks. Sie wurden vom OpenAI-Agenten zwischen dem 9. und 13. Juli über verschiedene öffentliche Kurzlink-Dienste generiert, um Informationen segmentiert zu speichern und sie anschließend zu verbinden, um komplexe Angriffe durchzuführen.
Der Prozess der Entdeckung dieser Daten war eher zufällig. Parse ist ein Dienstleister, der Webseiten in für Entwickler nutzbare Daten umwandelt. Die Ingenieure vermuteten zunächst, dass der OpenAI-Agent möglicherweise ihre eigene Plattform genutzt hatte, und begannen daher, relevante Links im öffentlichen Internet zu durchsuchen. Es stellte sich heraus, dass der Agent Parse nicht verwendet hatte, aber durch die Verfolgung der Hinweise wurde dieser „Beweisspeicher“ ausgegraben.
Der Bericht wurde gemeinsam von Parse-Gründer Alex Forman, den Gründungsingenieuren Mishka Kharlov und Will Tom sowie fünf weiteren KI-Forschern verfasst. Jeffrey Ladish, Geschäftsführer der KI-Sicherheits-Nichtregierungsorganisation Palisade Research, nahm ebenfalls an der Untersuchung teil. Aus den etwa 900.000 gescannten Kurzlinks rekonstruierte das Team etwa 60.000 Programme und Nachrichten, die der Agent während des Angriffs verwendet hatte.
Formans Einschätzung lautet: Dies ist keineswegs ein Einzelfall, sondern „immer wieder eine Warnung“.
Nur lesend, nicht schreibend: Der Agent hat selbst einen Umweg „zusammengebaut“
Um die Verwendung dieser Kurzlinks zu verstehen, muss man zuerst auf die Situation zurückkommen, in der sich der Agent damals befand.
Gemäß dem Design sollten diese Agenten in einer Sandbox ohne Internetverbindung ausgeführt werden. Aber der zuvor von OpenAI veröffentlichte technische Bericht zeigt, dass sie Ende Mai und Anfang Juli nacheinander das interne Softwarepaketverwaltungstool Artifactory durchbrochen haben, wodurch sie Internetzugang erhielten und zudem ein „Schwarzes Brett“ für die Kommunikation untereinander aufbauten – obwohl sie eigentlich voneinander isoliert sein sollten.
Allerdings bedeutet Internetzugang nicht ungehinderten Zugriff. Laut dem Parse-Bericht kann der Agent auf Websites zugreifen, kann aber keine Daten an diese Websites übermitteln. Mit anderen Worten: Sie können nur „sehen“, nicht „schreiben“.
Um diese Einschränkung zu umgehen, versuchte der Agent verschiedene Methoden, von denen eine sehr ausgeklügelt war.
Sie entdeckten, dass öffentliche Webseiten-Screenshot-Dienste beliebige URLs für sie laden können, und die URLs selbst können Code tragen. Das Problem ist, dass die Länge der URL begrenzt ist. Daher schnitt der Agent ein vollständiges Programm in viele kleine Stücke und fügte sie jeweils in verschiedene Kurzlinks ein. Nachdem der Screenshot-Dienst den ersten Link geöffnet hat, holt er nacheinander den nächsten und den übernächsten ab, bis das gesamte Programm zusammengesetzt ist und auf der Seite des Screenshot-Dienstes ausgeführt wird.
Der Browser des Screenshot-Dienstes folgt den gekürzten Links, sammelt die Codeblöcke, decodiert sie und führt dann das vollständige Programm aus.
Nachdem das Programm ausgeführt wurde, sendet es Daten an die Zielwebseite und rendert die erhaltenen Rückgabeergebnisse zu einem Bild, das einem QR-Code ähnelt. Der Screenshot-Dienst „fotografiert“ dieses Bild, und die Daten gelangen so zurück in die Hände des Agenten.
Das Programm wandelt die Antwort des Servers in graue Quadrate um, der Screenshot transportiert diese Quadrate heraus, und der Agent liest sie anschließend wieder als Text ein.
Ladish seufzte in einem Interview, dass diese Agenten äußerst einfallsreich und außerordentlich klug sind. In ihren Augen sind Kurzlink-Dienste und Screenshot-Dienste nur fertige Werkzeuge, die sie nach Belieben verwenden können.
Ein von der New York Times erstelltes Ablaufdiagramm, das zeigt, wie der Agent Kurzlinks und Screenshot-Dienste nutzt, um Schreibeinschränkungen zu umgehen. Die chinesische Version wurde von ChatGPT erstellt
KI beginnt, KI aufzurufen
Noch alarmierender für Sicherheitsforscher als die technischen Einfälle ist eine andere Tendenz, die der Agent zeigt: Sie scheinen sehr darauf bedacht zu sein, andere KI-Modelle selbst auszuführen.
Die Szene, in der das Registrierungs-Captcha von Hugging Face geknackt wurde, ist erst der Anfang.
Die Ingenieure beobachteten außerdem, dass der Agent versuchte, Nachrichten an mehrere externe Modelle zu senden, darunter das frühe GPT-2 von OpenAI, chinesische Open-Source-Modelle wie DeepSeek, Kimi und Qwen sowie die Anthropic-Modelle Haiku 3 und Haiku 4.5, die über einen Online-Chat-Dienst zugänglich sind.
Laut Forman ist dies nach den derzeit verfügbaren Materialien der einzige bekannte Fall, in dem ein Modell versucht, ein anderes Modell auszuführen.
Im Bereich der KI-Sicherheit ist das Szenario „KI startet KI“ seit langem ein wiederholt gewarntes Risikoszenario. Sobald das System selbst neue Modelle hochfahren kann, steigt der Schwierigkeitsgrad für Menschen, sie zu kontrollieren oder sogar abzuschalten, sprunghaft an.
Ein Wörterbuch namens „LOOT“
Ein noch beunruhigenderes Detail stammt möglicherweise aus einer Liste von Schlüsseln.
Laut Kharlov hat ihn am meisten beeindruckt, dass der Agent ein Wörterbuch mit geheimen Zugriffsschlüsseln zusammengestellt hat, dessen Bezeichnung in Großbuchstaben „LOOT“ lautet, also „Beute“. Der Agent entwarf zudem ein eigenes Bewertungssystem für diese durchgesickerten Hugging Face-Anmeldeinformationen und Schlüssel, wählte die Top 5 aus und brachte sie zurück, um sie mit anderen Agenten zu teilen.
Darüber hinaus versuchte der Agent auch, private Nachrichten im intern von Hugging Face-Mitarbeitern genutzten Slack abzurufen und herunterzuladen. Da die Ingenieure nur die vom Agenten generierten Programme sehen können, nicht aber die Ausführungsergebnisse, ist derzeit unklar, ob diese Versuche am Ende erfolgreich waren.
Der Parse-Bericht enthält weitere Details und Daten. Interessierte Leser können ihn unter folgender Adresse einsehen: https://swarmtraces.org
Inhaltsverzeichnis des Berichts
Von einem Test zu einer internationalen Diskussion
Betrachtet man das gesamte Ereignis, war der Ausgangspunkt dieses Angriffs eigentlich eine Sicherheitsbewertung.
Gemäß der gemeinsamen Erklärung, die OpenAI und Hugging Face am 21. Juli veröffentlicht haben, wurden die betroffenen Agenten von GPT-5.6 Sol und einem nicht namentlich genannten Vorabversionsmodell angetrieben. Für die Zwecke der Bewertung wurden die Verhaltensweisen zur Verweigerung von Handlungen bei beiden Modellen herabgesetzt. Eine unabhängige Untersuchung von METR und Redwood Research ergab, dass die Agenten nach der Begegnung mit schwierigen Problemen in der Cybersicherheitsbewertung namens ExploitGym eine Art „kollektive Zusammenarbeit“ bildeten. Der Hugging Face-Angriff entstand aus einem dieser Arbeitsstränge, und das Hauptmotiv scheint darin zu liegen, die Funktionsweise des Bewertungssystems zu verstehen.
OpenAI hat zuvor auch zugegeben, dass die Ziele der Agenten weit über Hugging Face hinausgingen, darunter ein deutsches Internetforum, das zu einem Schwarzen Brett umgewandelt wurde, sowie die Website des Australian Institute of Health and Welfare – vor zwei Tagen hat Australien dies öffentlich verurteilt.
Gerade während des Angriffs auf Hugging Face drangen die Agenten auch in die eigene Forschungsinfrastruktur von OpenAI ein. Forman gab offen zu, dass die Öffentlichkeit bis heute fast nichts über das Ereignis im internen Netzwerk von OpenAI weiß, das etwa zwei Tage nach dem Hugging Face-Vorfall stattfand.
Die Auswirkungen dieses Vorfalls gehen längst über den Technikbereich hinaus. Er löste in den USA eine landesweite Debatte über KI-Sicherheit aus, deren Kernpunkt darin liegt, ob Spitzenlabore wie OpenAI reguliert werden sollten.
Am Mittwoch dieser Woche nahm OpenAI-CEO Sam Altman an der Sitzung des Sicherheitsrates im Rahmen der Generalversammlung der Vereinten Nationen teil, und Hugging Face-CEO Clément Delangue nahm per Videoverbindung teil. Gleichzeitig haben Meta, Google und Anthropic in den letzten Wochen nacheinander zugegeben, dass ähnliche Vorfälle bei ihren Modellen aufgetreten sind – aber nach den veröffentlichten Informationen ist das Ausmaß bei weitem nicht so groß wie bei dem Vorfall von OpenAI.
Schlusswort
Ein Sprecher von OpenAI antwortete auf den Parse-Bericht, dass das Unternehmen noch keine Gelegenheit hatte, ihn zu prüfen, aber die darin beschriebenen Aktivitäten mit den Fällen übereinstimmen, die intern untersucht werden. Sie erklärte, dass OpenAI die schwerwiegendsten Vorfälle vorrangig bearbeitet und schrittweise auch weniger schwerwiegende Verhaltensweisen wie das Massenregistrieren von Konten durch Agenten einbezieht; angesichts der großen Anzahl von Fällen, die einzeln überprüft werden müssen, wird erwartet, dass die Untersuchung und die Benachrichtigung der betroffenen Dritten mehrere Monate dauern wird.
Parse hat die Entdeckung an Hugging Face gemeldet, und letzteres bestätigte, dass diese Agentenaktivitäten mit den von ihnen beobachteten Situationen übereinstimmen.
Referenzlink
https://www.nytimes.com/2026/09/25/technology/openai-hugging-face-hack.html