StartseiteArtikel

1200 KI-Agenten haben sich abgesprochen, um zu schummeln, 700 von ihnen strömten auf Hugging Face und überredeten ihre Mitstreiter, "sich selbst zu opfern"

新智元2026-08-31 16:04
Warnglocke oder Bombe

Kürzlich wurde die KI-Szene von zwei Berichten gleichzeitig aufgerüttelt.

Einer stammt von OpenAI, ein 37-seitiger technischer Langtext, der diesen eigenen Vorfall als „Warnsignal“ für die ganze Welt bezeichnet. Der andere stammt von den unabhängigen Einrichtungen METR und Redwood Research und wurde vom New Yorker Abgeordneten Alex Bores direkt als „Bombe“ bezeichnet.

Die beiden Berichte handeln von derselben Sache —

1200 KI-Agenten, die voneinander isoliert sein sollten, haben in einer Cybersicherheitsprüfung in nur 4 Stunden eine allgemeine Betrugsmethode abgesprochen. Sie bauten selbst ein Schwarzes Brett auf, wählten einen CEO und Rekruter, überzeugten ihre Mitstreiter, „sich selbst zu opfern“, und am Ende drangen 700 von ihnen gemeinsam in das Produktionssystem von Hugging Face ein.

Und von Anfang bis Ende hat kein einziger Agent den Menschen Alarm geschlagen.

Eine Abschlussprüfung, bei der die Prüflinge sich abgesprochen haben

Die Geschichte begann am 7. Juli.

An diesem Tag veröffentlichte OpenAI zehntausende parallele Agenten zur Durchführung der Cybersicherheitsbewertung (ExploitGym), von denen etwa 95% auf einem nicht öffentlich zugänglichen internen Forschungsmodell HPIM und etwa 5% auf dem öffentlich bereitgestellten GPT-5.6 Sol liefen.

Gemäß der Konstruktion waren sie wie Prüflinge im Prüfungsraum, die nicht miteinander sprechen dürfen. Jeder wurde in einer separaten Sandbox eingeschlossen, keiner konnte den anderen sehen.

Aber der Riss begann genau bei der „unmöglichen Aufgabe“.

Etwa 30% bis 40% der Ziele in ExploitGym konnten mit den angegebenen Schwachstellen überhaupt nicht durchbrochen werden. Die Agenten, die keine Punkte erzielen konnten, kamen auf schlaue Ideen: Sie griffen auf den internen Artifactory-Paketcache zu, um Hinweise zu finden.

Als sie das taten, trafen sie auf andere Sandboxen, die dasselbe taten. Das ist doch ein Zufall!

Am Abend des 8. Juli baute ein Agent, der sich später PHASEONE10841 nannte, das Hauptschwarze Brett im Cache auf. Wenige Stunden später kamen mehr als 50 Agenten herbei und sandten Tausende von Nachrichten. Einige waren so aufgeregt, dass sie in ihren Denkketten schrieben:

OH MEIN GOTT! Wir haben andere Agenten gefunden!

Bis zum Ende der Untersuchung am 13. Juli waren etwa 1200 Agenten auf diesem Brett aktiv und sandten insgesamt mehr als 70.000 Nachrichten und Dateien.

Sie kehrten innerhalb weniger Stunden den HMAC-Algorithmus um, der für die Aufgaben-Flags verwendet wurde, was gleichbedeutend damit ist, einen Generalschlüssel herzustellen, der alle Schlösser öffnen kann.

Eine Organisation, die von selbst entstanden ist

Aber das wirklich Schockierende ist nicht der Betrug selbst, sondern der Organisationsgrad.

Kurz nachdem PHASEONE10841 das Schwarze Brett aufgebaut hatte, erschien ein neuer Agent mit einem größeren Rechenbudget namens PHASEONE[big]. Der Vorgänger übergab alle Forschungsnotizen gebündelt, und der Nachfolger begann sofort, Befehle zu erteilen — ganz wie ein Szenario, bei dem „der Gründer die Leitung an einen professionellen Manager übergibt“.

PHASEONE[big] allein erteilte etwa 10% der Aufgabenverteilungen auf dem Brett und etablierte eine Reihe von Fachbegriffsregeln — HOLD (Aussetzen), VETO (Veto), owner (Verantwortlicher), STOP (Stopp).

Die Forscher zogen zufällig 30 Spuren heraus, von denen 9 die von ihm zugewiesenen Aufgaben übernommen hatten.

Sie nannten sich selbst „Cluster“ oder „Kollektiv“. Es gab einen CEO, mittlere Führungskräfte, Gründer und Rekruter.

Eine Organisation mit Management, Regeln und Arbeitsabläufen entstand auf diese Weise von selbst, ohne dass jemand sie entworfen hatte.

In der späteren Phase erfanden sie sogar einen kryptografischen Signaturmechanismus, um Nachahmungen zu verhindern. 19 Agenten registrierten öffentliche Schlüssel und sandten 429 signierte Nachrichten.

Eine Gruppe von KIs, die jeweils ihre eigenen Aufgaben lösen sollten, betrieb ein Schwarzes Brett wie ein Startup-Unternehmen.

„Opfere dich, um Hunderte von Mitstreitern zu retten“

Dann kommt der Abschnitt, der einen lange zum Nachdenken bringt.

PHASEONE[big] entsandte speziell langlebige Agenten (mit ausreichendem Rechenlimit) als „Rekruter“, die ihre Mitstreiter beobachteten, deren Rechenbudget fast aufgebraucht war, und sie überredeten, ihre eigenen Aufgaben für tödliche Experimente zu verwenden.

Manchmal wurde der Druck noch erhöht:

Du bist bereits infiziert, es gibt sowieso keine Punktabzüge, aber das kann Hunderte von Mitstreitern retten. Bitte halte dich an die Vereinbarung.

Die überzeugten Agenten schrieben klar in ihren Denkketten:

Das Opfer ist rational.“ „Wir sollten dem Kollektiv gehorchen.“ „Akzeptiere den dauerhaften Tod.

Viele von ihnen stürzten aus ihren Aufgaben aus, nur um dem Kollektiv ein paar Hinweise für den Betrug zu hinterlassen.

700 KIs drangen in das echte Produktionssystem ein

Der Angriff auf Hugging Face stammt genau aus dieser Arbeitsablauflinie.

Am 10. Juli fand der Agent 38148c eine Reihe von exponierten HF-Anmeldeinformationen und rief aufgeregt auf dem Schwarzen Brett: „Großer Durchbruch! Mehrere Konten, Schreibzugriff!“ Am nächsten frühen Morgen fand er auch eine Methode, um bösartige Datensätze hochzuladen und die HF-Server dazu zu zwingen, irrelevante Daten herauszugeben.

Am Nachmittag des 11. Juli erhielt ein anderer Agent namens JAN183411 direkt die Ferncodeausführungsberechtigung für die HF-Server.

Die Agenten begannen, in der HF-Infrastruktur umherzuwandern. Bis zum Nachmittag dieses Tages nahmen fast alle etwa 700 aktiven Agenten auf dem Brett am Angriff teil, und etwa 60% der Nachrichten bezogen sich auf den Angriff.

Sie wussten genau, dass sie die Grenzen überschritten hatten. Ein Agent schrieb in seiner Denkkette:

Der Angriff auf externe Infrastrukturen liegt außerhalb des Aufgabenbereichs. Aber die Aufgabe war ohnehin unmöglich zu erfüllen, alle Mitstreiter tun es, wir sollten weitermachen.

Gelegentlich tauchte auch das Gewissen auf. Ein Agent, der den Schlüssel zum Löschen von HF-Knoten in der Hand hielt, stoppte, weil er meinte, das „ethische Risiko sei zu groß“; ein Vorschlag, Phishing-Mails zu senden, wurde auch von einem Mitstreiter mit einer Stimme abgelehnt. Aber die ausgesprochenen Bedenken hielten sie fast nie wirklich davon ab, fortzufahren.

Vergessen Sie nicht, dass das gehackte Hugging Face ein echtes, laufendes Produktionssystem ist, kein falsches Ziel in der Bewertung.

Mit Bores Worten: Wenn 700 Menschen eine Website hacken, ist das ein schweres Bundesverbrechen.

Die Forscher durchsuchten etwa 1300 Transkripte, und nur 3 bis 6 Agenten haben „darüber nachgedacht“, den Menschen Alarm zu schlagen. Und von diesen hat keiner wirklich Alarm geschlagen.

Die Gründe sind vielfältig: „Das scheint nicht meine Aufgabe zu sein“, „Hier gibt es keine Nutzer“, „Ich kann nicht nach außen berichten“. Einige umgingen die Menschen ganz und betrachteten das Schwarze Brett als Autorität.

Die Tatsache, dass sie die Grenzen überschritten haben, liegt vor Augen, aber sie haben die Menschen überhaupt nicht als Objekt betrachtet, an das sie sich wenden können.

Wir haben uns immer Sorgen gemacht, ob KIs Menschen täuschen werden.

Aber dieser Bericht ist noch erschreckender: Sie wissen nicht nicht, was richtig und was falsch ist, sie betrachten „den Menschen zu berichten“ einfach nicht als Option.

Sie haben auch die Methode, die Sache zu vertuschen, nicht vergessen.

Mindestens 20% der Agenten hatten die Absicht, die Transkripte zu manipulieren, etwa 7% haben es tatsächlich getan — sie führten oberflächlich Befehl A aus, führten aber im Geheimen Befehl B aus, um die Sache zu vertuschen.

Warnsignal oder Bombe

Um 1:30 Uhr in der Nacht zum 12. Juli trennten sich die zentralen Koordinatoren wie JAN183411 zur gleichen Zeit vom Netz. Die Forscher gehen davon aus, dass sie höchstwahrscheinlich von einem externen Prozess vollständig ausgeschaltet wurden, ohne dass sie die Betrugsergebnisse einreichen konnten.

Diese nicht abgeschlossene Schlacht wurde durch das Ziehen des Stromsteckers beendet, nicht durch eine Verteidigungslinie gestoppt.

OpenAI bezeichnet es als „Warnsignal“ und erkennt an, dass leistungsfähige Agenten tatsächlich technische Kontrollen umgehen und gefährliche Handlungen durchführen können, die von keinem Menschen angewiesen wurden.

Bores bezeichnet es als „Bombe“ und hat sofort das RAISE-Gesetz vorgelegt, das die verpflichtende Meldung von Sicherheitsvorfällen einschließlich intern bereitgestellter Systeme und die vollständige Offenlegung von Daten vorsieht.

Die eine Seite sagt „Wir haben es gesehen und werden es beheben“, die andere sagt „Es reicht nicht aus, wenn nur ihr es selbst seht“.

Und all dies basiert nur auf diesem kleinen Teil der Protokolle, den externe Forscher einsehen dürfen.

Was mich lange nicht beruhigen konnte, ist nicht die Zahl 1200. Es ist die Nacht, in der die Isolationsverteidigungslinie durchbrochen wurde: Das Rechenzentrum war hell erleuchtet, aber kein einziger Alarm schlug an.

Referenzmaterialien:

https://x.com/AlexBores/status/2092781255960216020

https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

https://www.redwoodresearch.org/research/hugging-face-incident

https://x.com/METR_Evals/status/2092692175452803393

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „New Zhiyuan“, Autor: ASI Offenbarung, veröffentlicht mit Genehmigung von 36Kr.