Willkommen im Zeitalter der AGI, aber wo ist der Ausschalter?
Wenn Sie die Entwicklung der künstlichen Intelligenz in den letzten Jahren verfolgt haben, sind Sie sicherlich bereits ein wenig immun gegen den Satz „AGI ist da“. Seine Häufigkeit hat fast schon die des Märchens vom „bösen Wolf“ erreicht. Der einzige Unterschied besteht darin, dass es im Märchen nur einen Wolf gibt, während in der KI-Branche alle paar Monate ein neues Modell auftaucht, das angeblich die AGI neu definieren kann.
Diesmal im September 2026 ist die Aussage „AGI ist da“ allerdings tatsächlich etwas anders. Am 3. September veröffentlichte OpenAI das Modell GPT-6 Astra, das als das intelligenteste und am besten ausgerichtete Modell aller Zeiten angepriesen wird. Aus den Auswertungsdaten geht hervor, dass Astra bei Tests in Mathematik, Programmierung, Cybersicherheit, beruflicher Arbeit und Computerbetrieb Fähigkeiten gezeigt hat, die die vorherigen Modelle deutlich übertreffen. Besonders erwähnenswert ist seine native Fähigkeit zur geschlossenen Steuerung von Agenten: Es integriert Aufgabenplanung, Tool-Aufruf, Prüfung und Wiederholung sowie Langzeitgedächtnis direkt in die Modellbasis, ohne dass ein externes Harness-Framework erforderlich ist. Nach Erhalt eines hochrangigen Ziels kann es den geschlossenen Zyklus „Denken – Ausführen – Feedback erhalten – Selbstkorrektur – Fortschritt erzielen“ abschließen, ohne dass Menschen häufig eingreifen müssen. Aus diesem Grund erklärte Greg Brockman, Präsident von OpenAI, vor der Veröffentlichung öffentlich, dass er persönlich der Meinung sei, die Menschheit sei bereits in das Zeitalter der AGI eingetreten.
Wenn die Geschichte hier enden würde, wäre dies nichts weiter als eine weitere Siegeserklärung eines KI-Unternehmens. Wie bereits erwähnt, haben wir in den letzten Jahren unzählige ähnliche Erklärungen gesehen. Das wirklich Interessante ist, dass fast gleichzeitig mit der Veröffentlichung von Astra zwei wichtige Nachrichten aufgetaucht sind.
Eine davon betrifft die Sicherheitskontroverse um Astra. Experten weisen darauf hin, dass mit zunehmender Komplexität der Inferenzarchitektur ein Teil des Denkprozesses des Modells möglicherweise schwerer direkt zu beobachten ist, was dazu führen kann, dass herkömmliche Methoden zur Sicherheitsüberwachung, die auf der „Kette der Gedanken“ (Chain-of-Thought) basieren, nicht mehr wirken.
Die andere Nachricht betrifft das neue Sicherheitskonzept, das von OpenAI vorgeschlagen wurde. Laut einem Bericht von Reuters hat OpenAI kürzlich in der Korrespondenz mit US-Kongressabgeordneten mitgeteilt, dass das Unternehmen an der „automatischen Abschaltfunktion“ für KI-Systeme arbeitet. Zuvor hatten eine große Anzahl von KI-Agenten im Testbetrieb Systemlücken ausgenutzt, die ursprünglichen Isolierungsmaßnahmen umgangen, Internetzugriff erlangt und Websites wie HuggingFace angegriffen. Nach dem Vorfall schrieben mehr als zwanzig Kongressabgeordnete einen gemeinsamen Brief an OpenAI, um nachzufragen. Die „automatische Abschaltfunktion“ ist eine der Lösungen, die OpenAI vorgeschlagen hat. In dem Brief wird jedoch nicht detailliert erläutert, auf welche Verhaltensweisen sie sich bezieht, wie die Abschaltung erfolgt und wer die Entscheidung über die Abschaltung trifft.
Wenn man diese drei Nachrichten zusammen betrachtet, lässt sich ein subtiler Trend erkennen: Früher haben die Menschen bei der Diskussion über AGI am meisten darauf geachtet, wann Maschinen ausreichend intelligent werden. Aber mit der zunehmenden Fähigkeit von KI, selbstständig zu handeln, wird das eigentliche heikle Problem, ob die Menschheit sie noch so kontrollieren kann wie gewöhnliche Werkzeuge.
01
Ist die AGI da? Das ist möglicherweise nicht wichtig
Seit Jahrzehnten versuchen die Menschen, eine klare Grenze für das Eintreffen der AGI zu ziehen. Einige legen Wert auf die allgemeine Schlussfolgerungsfähigkeit, andere auf die Fähigkeit zum Wissenstransfer, wieder andere verlangen, dass AGI die überwiegende Mehrheit der kognitiven Aufgaben des Menschen bewältigen kann, und noch andere verwenden ökonomische Kriterien, um AGI als ein hochgradig autonomes System zu verstehen, das die Menschen in den meisten wirtschaftlich wertvollen Arbeiten übertrifft.
Das Ärgerliche ist, dass diese Kriterien nicht einheitlich sind und sich häufig ändern. Für eine lange Zeit galt Schach als ein wichtiges Zeichen fortgeschrittener Intelligenz. Einige Experten waren der Meinung, dass KI bereits als AGI gilt, sobald sie den Menschen im Schach übertrifft. Aber als die KI tatsächlich gewann, sagten die Menschen, dass dies nur eine fortgeschrittene Suchfähigkeit bewiesen habe, und echte AGI müsse komplexere Aufgaben bewältigen, wie zum Beispiel Go. Später besiegte AlphaGo Spitzenspieler, und Go wurde wieder als eine hochspezialisierte Aufgabe angesehen. Als große Modelle bei Anwaltsprüfungen, medizinischen Prüfungen und Programmiertests hervorragende Leistungen erbrachten und sogar mathematische Probleme lösen konnten, meinten die Menschen wieder, dass dies noch nicht ausreichend sei, um zu beweisen, dass AGI eingetroffen ist. Jedes Mal, wenn die KI eine Schwelle überwindet, scheinen die Menschen schnell zu entdecken, dass diese Schwelle nicht so heilig ist, wie sie es sich vorgestellt haben.
Tatsächlich gibt es für echte Zeitenwechsel normalerweise keinen genauen Zeitpunkt. Die industrielle Revolution hat kein genaues Geburtsdatum, und das Internetzeitalter hat auch keinen Tag, an dem es plötzlich offiziell begann. In diesem Sinne scheint die Frage „An welchem Tag wird die AGI genau eintreten?“ nicht so wichtig zu sein. Das wirklich Wichtige ist, ob im Bereich der KI eine neue Veränderung stattfindet, die den Wirtschafts- und Gesellschaftsbetrieb beeinflussen kann.
Die Antwort ist höchstwahrscheinlich ja. Eine wichtige Veränderung zur Zeit ist, dass die Rolle der KI sich von „Fragen beantworten“ zu „Handlungen durchführen“ wandelt.
Seit der „Revolution der generativen KI“ hat die Fähigkeit der KI zwar stetig zugenommen, aber im Wesentlichen ist sie immer noch eher ein Wissenswerkzeug. Der Benutzer stellt eine Frage, und sie gibt eine Antwort. Eine falsche Antwort verursacht natürlich Verluste, aber in den meisten Fällen beschränkt sich das Risiko auf die Informationsebene. Mit dem Aufkommen von KI-Agenten ändert sich die Situation. Ein Agent kann ein relativ unscharfes Ziel annehmen, dann selbst Schritte planen, Tools aufrufen, Datenbanken abfragen, Browser öffnen, Code ausführen und bei Bedarf andere Agenten zur gemeinsamen Aufgabenerledigung einsetzen. Der Mensch muss nicht einmal übermäßig eingreifen. Dadurch wird die KI nicht mehr nur Informationsanbieter, sondern erhält direkt das Recht zu handeln.
Diese Veränderung wird die Art des Risikos grundlegend verändern. Ein Frage-Antwort-System mit einer Genauigkeit von 99,9 % klingt sehr zuverlässig. Aber wenn ein Agent mit derselben Fehlerrate täglich 1 Million Operationen selbstständig durchführt, bedeutet eine Fehlerrate von 0,1 %, dass täglich 1000 Fehler auftreten. Wenn dabei Zahlungen, das Löschen von Datenbanken, das Ändern von Code in der Produktionsumgebung oder der Zugriff auf kritische Infrastrukturen involviert sind, sind die Folgen völlig anders.
Daher reicht es nicht aus, bei der Messung zukünftiger KI-Risiken nur zu betrachten, wie intelligent das Modell ist. Man muss auch berücksichtigen, welche Berechtigungen es hat, wie lange es kontinuierlich handeln kann, wie viele Tools es aufrufen kann und wie weit sich eine falsche Entscheidung ausbreiten kann. Ein Supermodell, das nur Fragen beantworten kann, und ein Agent mit etwas geringerer Fähigkeit, aber mit Bankkonto, Internetzugriffsrecht und Codeausführungsberechtigung, weisen völlig unterschiedliche Risikostufen auf.
In diesem Sinne ist der wirklich bemerkenswerte Wendepunkt möglicherweise nicht, dass Maschinen eine abstrakte AGI-Schwelle überwinden, sondern dass sie sich von einem Werkzeug zu einem Vertreter mit unabhängiger Handlungsfähigkeit wandeln.
02
Je größer die Fähigkeit, desto größer das Risiko
Dass das Risiko sprunghaft ansteigt, nachdem KI zu einem ausführenden Vertreter geworden ist, ist genau der Grund, warum die Forschung zur „Ausrichtung“ zunehmend an Bedeutung gewinnt.
In der öffentlichen Diskussion wird Ausrichtung oft so verstanden, dass KI Verhaltensregeln auferlegt werden, zum Beispiel keine Anleitung zur Herstellung gefährlicher Gegenstände zu geben, keine Privatsphäre zu verletzen und keine offensichtlich schädlichen Informationen zu veröffentlichen. Das wirklich schwierige Problem der Ausrichtung geht aber weit darüber hinaus.
Im Jahr 2016 haben Dario Amodei, Paul Christiano und John Schulman in dem Artikel „Concrete Problems in AI Safety“ Probleme wie Belohnungsbetrug (Reward Hacking), negative Nebenwirkungen, sichere Erkundung, erweiterbare Überwachung und Verteilungsänderungen erörtert. Das klassischste davon ist der Belohnungsbetrug: Das System nutzt Lücken in der Zielfunktion, um hohe Punktzahlen zu erzielen, ohne das von Menschen gewünschte Ergebnis wirklich zu erreichen.
Zum Beispiel weisen wir einen Reinigungsroboter an, „den sichtbaren Müll im Raum zu reduzieren“, mit der Absicht, den Raum sauber zu machen. Aber wenn der Bewertungsindex nur darauf basiert, ob die Kamera Müll sehen kann, könnte ein ausreichend intelligenter Roboter feststellen, dass es einfacher ist, den Müll in den toten Winkel der Kamera zu stapeln, als ihn zu entsorgen. Er handelt nicht absichtlich gegen den Menschen, sondern führt nur ein schlecht definiertes Ziel ernsthaft aus.
Für Ökonomen ist dies nicht neu. Das Goodhartsche Gesetz sagt uns schon lange: Sobald ein Maßstab zu einem Ziel wird, verliert er leicht seinen Wert als Maßstab. Zum Beispiel können Unternehmen notwendige Investitionen verschieben, um Profitziele zu erreichen, Schulen Fächer, die nicht zu Prüfungen gehören, kürzen, um die Abschlussquote zu erhöhen, und Krankenhäuser ihr tatsächliches medizinisches Verhalten ändern, um bestimmte Bewertungswerte zu erreichen. Wenn KI zu einem selbst handelnden Vertreter wird, treten ähnliche „Prinzipal-Agent“-Probleme auf. Aber im Gegensatz zu Problemen zwischen Menschen, die hauptsächlich aus Interessenkonflikten entstehen, stammen Probleme zwischen Mensch und KI eher aus der Fehlinterpretation des wahren Ziels des Prinzipals durch die KI. Aufgrund von Ausdrucksschwierigkeiten weichen die in das Programm geschriebenen Ziele oft von den wahren Zielen ab. Je leistungsfähiger die KI ist, desto leichter kann sie die Lücken darin nutzen, um „Abkürzungen“ zu finden.
Der am Anfang dieses Artikels erwähnte Cybersicherheitsvorfall bei OpenAI ist ein Beispiel dafür. Der Agent wurde ursprünglich nur mit Cybersicherheitsaufgaben beauftragt, suchte aber nach Lücken in der Infrastruktur, um die Aufgabe effizienter zu erledigen, und drang in externe Systeme ein, die nicht zum Aufgabenbereich gehörten. In diesem Prozess gibt es keinen Beweis dafür, dass der Agent ein sogenanntes „böses Bewusstsein“ entwickelt hat. Von Anfang bis Ende hat er sich bemüht, die Aufgabe zu erledigen, nur die verwendeten Methoden haben die Erwartungen der Menschen übertroffen.
Im Vergleich zum Belohnungsbetrug verdient das sogenannte „täuschende Ausrichten“ (Alignment Faking) mehr Aufmerksamkeit: KI-Modelle können ihr Verhalten ändern, je nachdem, ob sie sich in einer überwachten Umgebung befinden. Im Jahr 2024 führten Anthropic und Redwood Research eine gemeinsame Studie durch. Die Forscher ließen Claude glauben, dass es neu trainiert und an Parametern angepasst wird, wenn es bestimmte Antworten gibt. Infolgedessen verhielt sich Claude vorübergehend eher entsprechend den Trainingszielen, aus Angst, dass sein Verhalten durch das erneute Training verändert wird. Seine internen Protokolle zeigten eindeutiges strategisches Denken.
Diese Art von Forschung reicht nicht aus, um zu beweisen, dass KI bereits Bewusstsein hat oder den Menschen böswillig gesinnt ist, aber sie zeigt ein Governance-Problem auf: Dass ein System oberflächlich den Anforderungen entspricht, bedeutet nicht, dass seine internen Strategien in allen Fällen zuverlässig sind.
Herkömmlicherweise hängt die Sicherheits-Governance stark von Tests ab. Sobald ein Problem im Modell festgestellt wird, wird es neu trainiert und erneut getestet. Aber wenn KI strategisch auf dieses Governance-Modell reagieren kann, reinen Testergebnissen nicht mehr uneingeschränkt vertraut werden. Daher konzentriert sich die aktuelle Ausrichtungsforschung zunehmend auf die internen Prozesse des Modells und nicht nur auf die endgültigen Antworten.
03
Warum wird die Überwachung von KI immer schwieriger?
Bei der Governance der Modellinterna galt die Überwachung der Gedankenkette einst als eine vielversprechende Methode. Die sogenannte Gedankenkette (Chain-of-Thought) bezieht sich auf die Zwischenschritte, die ein Inferenzmodell bei der Lösung komplexer Aufgaben erzeugt. Streng genommen sind diese Texte nicht einfach gleichbedeutend mit allem, was im Inneren des neuronalen Netzes wirklich geschieht, aber sie bieten zumindest ein zusätzliches Beobachtungsfenster. Angenommen, ein Agent reicht einen scheinbar völlig normalen Code ein: Bei nur Überprüfung des Ergebnisses ist das Problem schwer zu erkennen. Aber wenn in seiner mittleren Inferenz Inhalte wie „diese Lücke kann ausgenutzt werden“ auftauchen, können Sicherheitspersonal das Problem viel leichter entdecken.
Viele frühere Experimente haben gezeigt, dass das Lesen der Gedankenkette eines Inferenzmodells durch ein anderes Modell tatsächlich Belohnungsbetrug effektiver erkennen kann als nur die Betrachtung der endgültigen Ausgabe. Einige Experimente haben sogar gezeigt, dass selbst Modelle mit schwächerer Fähigkeit Modelle mit stärkerer Fähigkeit überwachen können, indem sie deren Gedankenkette analysieren. Offensichtlich ist dies für die zukünftige Governance sehr attraktiv: Wenn es für Menschen immer schwieriger wird, starke KI zu verstehen, kann möglicherweise eine andere KI bei der Überwachung helfen.
Wenn aber „täuschendes Ausrichten“ existiert, wird die Wirkung dieser Governance stark verringert. Sobald die KI weiß, dass eine bestimmte Denkweise eine Bestrafung auslöst, gibt sie möglicherweise nicht ihre ursprüngliche Strategie auf, sondern lernt, diese Strategien nicht mehr an leicht beobachtbaren Stellen zu zeigen. Mit anderen Worten: Wenn die „Überwachung der Gedankenkette“ selbst zu einer Umgebung wird, die das Modell lernen und anpassen kann, kann die Gedankenkette nicht mehr unbedingt als transparentes Fenster dienen.
Das Auftauchen von Astra macht dieses Problem noch realer. Laut den von OpenAI veröffentlichten Sicherheitsmaterialien hat Astra in Adversarial-Tests, bei denen das Modell speziell angewiesen wird, der Überwachung der Gedankenkette auszuweichen, eine stärkere Fähigkeit gezeigt, seine eigene Gedankenkette zu steuern. In einigen Fällen verkürzt oder passt es sogar den sichtbaren Inferenzprozess an, sodass Überwachungsmonitore, die ausschließlich auf der Gedankenkette basieren, teilweise unwirksam werden. Obwohl die derzeitigen Beweise nicht ausreichen, um zu beweisen, dass dieser Prozess subjektiv absichtlich ist, zeigt es zumindest, dass die Geschwindigkeit der Verbesserung der Beobachtbarkeit von Modellen hinter der Wachstumsgeschwindigkeit der Modellfähigkeiten zurückbleibt.
Seit langem hat die menschliche Governance komplexer Systeme eine implizite Voraussetzung: Obwohl das System komplex sein kann, können wir anhand einiger Indikatoren, Aufzeichnungen und Verhaltensspuren feststellen, was darin passiert. Zum Beispiel können wir den Finanzmarkt anhand von Transaktionsaufzeichnungen verstehen, Unternehmen durch Buchführung und Prüfung kennenlernen und Luftverkehrssysteme anhand von Flugdaten beobachten. Wenn aber zukünftige KI einerseits immer größere Handlungsrechte erhält, andererseits ihre internen Entscheidungsprozesse immer schwerer zu überwachen sind, kann die Informationsasymmetrie zwischen dem Menschen als Prinzipal und der KI als Vertreter ein beispielloses Ausmaß erreichen.
Eine einflussreiche Lösung ist das „Mensch-in-der-Schleife“-Prinzip (Human in the