StartseiteArtikel

Warum setzt Google auf RSI?

深流研究所2026-10-09 15:38
Das viel diskutierte RSI, worüber streitet man sich eigentlich wieder?

„Unser Modell hat mich offiziell übertroffen. Ich habe ihm nichts mehr beizubringen.“

Das schrieb Zirui Wang, Forscher bei Google DeepMind, am 30. September in den sozialen Medien.

An diesem Tag veröffentlichte Google das erste Modell der Gemini-4-Serie, Gemini 4 Argon. Es handelt sich um die wichtigste Flaggschiff-Veröffentlichung von Google in diesem Jahr.

Diese halb scherzhaft geäußerte Ausruf führte schnell zu einer noch kühneren Vermutung: Hat Google bereits RSI erreicht?

RSI, die rekursive Selbstverbesserung, bedeutet, dass KI an der Verbesserung ihrer selbst oder an der Entwicklung der nächsten KI-Generation beteiligt ist.

Heutzutage haben viele Unternehmen RSI in ihre Forschungsziele und Investitionsnarrative aufgenommen. Entsprechende Arbeiten, Bewertungen und Produkte tauchen ebenfalls in dichter Folge auf.

Google gehört zu den Unternehmen mit den größten Investitionen und den aggressivsten Maßnahmen in diesem Bereich.

Allein im September veröffentlichte Google nacheinander vier entsprechende Fortschritte, die sich auf Modellentwicklung, Suchstrategien, Workflows von Agenten und andere Bereiche beziehen.

Hinter dieser dichten Anordnung von Maßnahmen steigt das Gefühl der Dringlichkeit von Google im Wettbewerb um große Modelle.

In weniger als einem Jahr rutschte Gemini von der Spitze der Rangliste ab und wird von manchen Nutzern scherzhaft als „amerikanisches Doubao“ bezeichnet.

Die Flaggschiff-Modelle wurden verzögert, Schlüsseltalente gingen verloren, und Schlüsselbereiche wie Programmieragenten wurden bereits von Konkurrenten definiert. Das Risiko, dem Google gegenübersteht, hat sich von einer einmaligen Rückständigkeit bei Modellen zu einem allmählichen Verlust des Branchenrhythmus gewandelt.

RSI wirkt wie ein Rettungsanker, den Google unbedingt ergreifen muss.

Laut einem Bericht von Business Insider ist der Mitbegründer von Google, Sergey Brin, mit dem Fortschritt von Gemini nicht zufrieden und drängt das Team, mehr Energie in RSI zu stecken.

Warum setzt Brin seine Hoffnungen auf RSI, angesichts der Vorwürfe, dass Google bei der KI hinterherhinkt?

Worum geht es eigentlich in den vielfältigen Debatten um RSI?

Auf den ersten Blick scheint RSI nichts anderes als „KI, die KI verbessert“ zu sein, aber bis heute hat die Branche keine einheitliche Definition dafür gefunden.

Die Debatten drehen sich hauptsächlich um drei Fragen:

Was genau kann KI verbessern? Kann eine Verbesserung die Kosten der nächsten Fortschrittsphase senken? Wie lässt sich nachweisen, dass die Verbesserung tatsächlich wirksam ist?

Erstens: Was KI verbessert, muss nicht unbedingt nur das Modell selbst sein.

Agenten können Prompts neu schreiben, Tools anpassen, Trainingscodes optimieren und auch experimentelle Abläufe neu gestalten.

Anthropic betrachtet Code-Agenten als Vorstufe von RSI. Claude wird zunächst zu einem Forschungshilfsmittel und übernimmt schrittweise die Ausführung von Programmen, den Aufruf von Agenten und Aufgaben mit langem Zyklus.

Nach Ansicht von Anthropic ist der Zyklus erst dann wirklich geschlossen, wenn das Modell in der Lage ist, Training, Bewertung und die Entwicklung nachfolgender Systeme relativ autonom abzuschließen.

OpenAI konzentriert sich darauf, in welchem Umfang Forschungsarbeiten automatisiert werden können.

Am 6. September gab OpenAI bekannt, das Etappenziel eines „automatisierten Forschungs-Praktikanten“ erreicht zu haben: Das System kann unter menschlicher Anleitung Aufgaben mit klar definierten Grenzen erledigen, für die normalerweise erfahrene Forscher mehrere Tage benötigen. Das nächste Ziel besteht darin, bis März 2028 zu einem „automatisierten KI-Forscher“ zu werden.

Das Verständnis von Google neigt mehr zum System-Engineering.

Solange KI in der Lage ist, Trainingscodes, Algorithmen, Toolchains, Chipdesign und die Planung von Rechenzentren kontinuierlich zu verbessern und diese Vorteile zur Verkürzung des Entwicklungszyklus für Modelle der nächsten Generation zu nutzen, kann ein rekursiver Effekt im gesamten Forschungssystem auftreten.

Zweitens: Wiederholte Iterationen bedeuten nicht gleich Rekursion.

KI kann ständig Codes schreiben und Tests durchführen. Wenn sich die Obergrenze der Fähigkeiten und die Arbeitsweise bei jeder Runde nicht ändern, wiederholt sie nur Arbeitsabläufe schneller.

Ein echter rekursiver Effekt erfordert, dass ein Erfolg die Effizienz nachfolgender Suchvorgänge, Experimente oder Forschungsarbeiten steigert.

Zum Beispiel kann die Beschleunigung von Trainingskernen die Trainingszeit von Modellen der nächsten Generation verkürzen; mehr Rechenleistung, die das Rechenzentrum freisetzt, kann mehr Experimente unterstützen; und ein optimierter Workflow von Agenten ermöglicht es demselben Modell, komplexere Aufgaben zu übernehmen.

Diese Verbesserungen verteilen sich auf Software, Hardware und organisatorische Abläufe. Wie Shunyu Yao, Forscher bei Google DeepMind, sagte: „RSI ist ein kontinuierliches Spektrum, kein plötzlich eintretender Moment.“

Schließlich, und das ist das schwierigste Problem: Wie lassen sich die Verbesserungen der KI überprüfen?

Ob der Code kompiliert werden kann, wie stark der Kern beschleunigt wird und wie viel Arbeitsspeicher eingespart wird, hat relativ klare Kriterien.

Es ist oft schwieriger zu beurteilen, ob ein Modell Fähigkeiten erworben hat, die auf neue Aufgaben übertragbar sind, oder ob eine automatisch generierte Trainingsmethode tatsächlich besser als die ursprüngliche Lösung ist.

Kürzlich haben der von Scale AI eingeführte RSI Bench, der sich auf Algorithmen-Design konzentrierende AI4AI-Bench sowie der Φ-Bench, der Bereiche wie GPU-Kerne, Training, Inferenz und Dienste abdeckt, die erforderlichen Vorläuferfähigkeiten für RSI getestet.

Das Objekt der Verbesserung, der Grad der Autonomie und der Überprüfungsmechanismus bilden den Kern der heutigen Debatten über RSI.

Die Antworten verschiedener Unternehmen entsprechen unterschiedlichen technischen Routen.

Wie gestaltet Google RSI – von Modellen bis zu Rechenzentren?

Die Investitionen von Google in RSI waren ursprünglich auf mehrere Glieder verteilt: Modelle, Agenten, Suchstrategien, Chips und Rechenzentren.

Im letzten Monat haben diese relativ unabhängigen technischen Routen begonnen, zusammenzulaufen.

Das am 2. September veröffentlichte Gemini 3.8 Flash sendete ein direktes Signal aus.

Google gab an, dass lang andauernde zyklische Abläufe von Agenten an der Entwicklung dieses Modells beteiligt waren. Bei komplexen Aufgaben plant, führt, prüft und repariert der Agent wiederholt und unterstützt das Team bei der Bewertung und Verbesserung des Modells.

Shunyu Yao bewertete dies als „kleinen Schritt“ für die Fähigkeiten des Modells, aber als „großen Schritt“ für RSI.

Der nächste Schritt besteht darin, nutzlose Versuche und Irrtümer in der Forschung zu reduzieren.

Am 14. September veröffentlichten Forscher von Google und zwei amerikanischen Universitäten Dream-RSI.

Um schnellere GPU-Programme zu finden, muss der Code-Agent mehrere Routen erkunden, von denen die meisten scheitern. Wenn die Rechenleistung nach einer festen Strategie gleichmäßig verteilt wird, verschwendet das System leicht Ressourcen wiederholt in aussichtslosen Richtungen.

Dream-RSI stattet den Agenten im Grunde mit einer ständig aktualisierten „Erkundungskarte“ aus.

Es protokolliert den Code jedes Versuchs, Fehlermeldungen, die Laufzeit und die endgültige Punktzahl und beurteilt dann anhand historischer Erfahrungen: Welcher Weg es wert ist, weiterverfolgt zu werden, und welcher rechtzeitig aufgegeben werden sollte.

Wenn die KI mit ähnlichen Aufgaben konfrontiert ist, kann sie Umwege vermeiden und mehr Rechenleistung für vielversprechendere Richtungen reservieren.

Eine Woche später, am 21. September, veröffentlichte das KI-Forschungsteam von Google Cloud gemeinsam mit drei amerikanischen Universitäten RRSI, um die Arbeitsweise von Agenten weiter zu verändern.

Ob ein Agent komplexe Aufgaben erledigen kann, hängt zu einem gewissen Grad von dem externen Harness ab.

Wie Prompts verfasst werden, welche Tools aufgerufen werden, wie Aufgaben aufgeteilt werden und wie mehrere Agenten zusammenarbeiten, beeinflusst alle das Endergebnis.

In der Vergangenheit wurde dieses „Bedienpult“ hauptsächlich von Ingenieuren manuell anhand fehlgeschlagener Fälle angepasst.

RRSI lässt die KI dagegen an der Anpassung ihres eigenen Bedienpults teilhaben: Sie ändert Prompts anhand von Aufgabenrückmeldungen, fügt Tool-Aufrufe hinzu oder entfernt sie, teilt Aufgaben neu auf oder passt die Arbeitsteilung zwischen mehreren Agenten an.

Dream-RSI löst das Problem „Wohin gehen“, RRSI löst das Problem „Wie man die Arbeit gut erledigt“.

Sie haben die Gewichte des Basismodells nicht verändert, ermöglichen aber demselben Modell, Erfahrungen, Tools und Rechenressourcen effektiver zu nutzen.

Das ist genau die Idee von Google, RSI in der aktuellen Phase voranzutreiben:

Man beginnt außerhalb des Modells, sammelt Verbesserungen in Bereichen, die leicht zu messen und zu überprüfen sind, und bringt dann die Vorteile zurück in die Modellentwicklung.

Das früher veröffentlichte AlphaEvolve hat diese Idee bereits in Produktionssysteme eingebracht.

Seine Betriebslogik ähnelt einem automatisierten Ingenieursteam. Gemini schlägt eine große Anzahl von Kandidatenlösungen vor, der Evaluator testet sie nacheinander, das System behält Versionen mit besserer Leistung und erforscht weiter um diese Versionen herum.

Derzeit ist AlphaEvolve bereits in die Rechenzentren, Chips und KI-Trainingsabläufe von Google integriert, um Algorithmen zu verbessern, das Training zu optimieren und effizientere Planungsregeln für Computing-Cluster zu finden.

Am 10. Juli dieses Jahres stellte Google AlphaEvolve offiziell für die kommerzielle Nutzung in Google Cloud bereit. Die automatische Optimierung wurde von einem internen Forschungswerkzeug zu einer externen Plattformfähigkeit erweitert.

Damit wurden die ursprünglich unabhängigen technischen Module von Google neu organisiert.

Modelle, Agenten und Infrastruktur beginnen, miteinander verbunden zu werden, und die im gesamten Unternehmen verstreuten Technologien und Ressourcen werden in denselben Iterationszyklus aufgenommen.

Eine Produktionslinie für die RSI-Forschung nimmt Gestalt an.

Warum muss Google unbedingt auf RSI setzen?

Für Google ist RSI eine technische Route, eine Logik für Kapitalrenditen und auch eine Gelegenheit, den Branchenrhythmus zurückzugewinnen.

Anfang August erklärte Jasjeet Sekhon, Chief Strategy Officer von Google DeepMind, auf dem Berkeley Agentic AI Summit, dass RSI eine der Kerninvestitionslogiken hinter den derzeitigen enormen Investitionen in KI ist.

Im Jahr 2026 hat Alphabet seine Kapitalausgabenprognose auf 195 bis 205 Milliarden US-Dollar angehoben, wobei der größte Teil der Mittel für Server, Rechenzentren und Netzwerkgeräte verwendet wird.

Google muss nachweisen, dass diese Ressourcen nicht nur Kerngeschäfte wie Suche und Werbung bedienen, sondern auch die eigene Forschungseffizienz kontinuierlich steigern können.

RSI bietet genau einen Zinseszinseffekt:

Erweiterte Rechenleistung steigert die Forschungskapazitäten, stärkere Modelle erledigen mehr Experimente, Experimente verbessern Software und Infrastruktur, und die aktualisierte Infrastruktur unterstützt dann wieder Modelle der nächsten Generation.

Google verfügt über einen vollständigen Technologie-Stack, der Hardware, Software und Anwendungsszenarien durchdringt, und beherrscht eine große Anzahl realer Geschäftsszenarien, die automatisch überprüft werden können.

In der Vergangenheit waren diese Geschäftssysteme der Skalenvorteil von Google. Im Zeitalter der Agenten können sie auch zu Versuchsfeldern für das Modelltraining und die Überprüfung von RSI-Fähigkeiten werden.

Darüber hinaus bietet RSI Google eine Gelegenheit für eine „Überholung in der Kurve“.

Der KI-Wettbewerb der letzten Jahre hat gezeigt, dass technische Akkumulation nicht automatisch zu Produktführerschaft führt.

Transformer wurde bei Google entwickelt, aber ChatGPT hat als erstes das Massenportal für generative KI definiert.

Google forscht seit langem an Verstärkungslernen und Schlussfolgerungsfähigkeiten, aber OpenAI hat Schlussfolgerungsmodelle früher zu einer unabhängigen Produktkategorie geformt.

Google verfügt über eine riesige Codebasis und ein Entwickler-Ökosystem, während Anthropic mit Claude Code als erstes das Produktbewusstsein für Programmieragenten aufgebaut hat.

Google stand immer an der technischen Spitze, hat aber den Branchenrhythmus selten langfristig beherrscht.

RSI wird nicht unbedingt dazu führen, dass eine bestimmte Gemini-Generation plötzlich überwältigende Vorteile erlangt. Aber es kann einmalige technische Fortschritte zu einem sich schrittweise aufbauenden Zinseszinseffekt in der Forschung machen.

Heutzutage sucht fast jedes führende KI-Unternehmen nach seinem eigenen Zinseszins-Motor, nur die Wege sind unterschiedlich.

Der Vorteil von Anthropic liegt in der kürzeren Software-Engineering-Kette.

Claude Code ist nicht nur ein Produkt, sondern erzeugt auch ständig Spuren echter Aufgaben. Benutzer lassen Claude Codebasen lesen, Dateien ändern, Tests ausführen und Fehlermeldungen bearbeiten. Diese Prozesse legen ständig die Fähigkeitsgrenzen des Modells offen und fließen zurück in das Training und das Design von Agenten.

Die Stärke von OpenAI liegt darin, dass um die Spitzenmodelle herum eine kürzere Produktentscheidungskette aufgebaut wurde.

Forschungsfortschritte können relativ schnell in ChatGPT, Codex und APIs einfließen. Es fehlt ihm an einem geschlossenen Kreislauf aus Chips und Rechenzentren wie bei Google, aber es kann Ressourcen konzentrierter auf das Ziel des „automatisierten Forschers“ ausrichten.

Die Schwäche von Google liegt in der großen Organisation und der komplexen Kette. Aber RSI kann diese Schwäche auch in einen Vorteil verwandeln.

Sobald die KI mehr Experimente, Ingenieur- und Koordinationsarbeiten übernehmen kann, kann das früher schwerfällig wirkende Full-Stack-System von Google zu einer längeren, vollständigeren und schwerer nachzubaurenden Feedback-Kette werden.

Laut einem Bericht von Reuters vom August drängt Brin dazu, mehr Ressourcen in RSI zu lenken, und fordert die zentralen KI-Mitarbeiter auf, sich voll und ganz auf Gemini zu konzentrieren.

Das bedeutet, dass RSI bei Google nicht mehr nur ein Forschungsthema ist. Es beeinflusst bereits wesentlich die Ressourcenallokation, die Produktprioritäten und den Forschungsrhythmus.

Google will nicht nur das derzeit stärkste Modell einholen, sondern auch die Fähigkeit, ständig das stärkste Modell zu entwickeln.

Natürlich ist das heutige RSI noch weit entfernt von der „intelligenten Explosion“, die I. J. Good vorgestellt hat.