HomeArticle

Was ist eigentlich das RSI, um das VCs sich reißen, um zu investieren? Yao Shunyu, Shi Tianlin und die Professoren der Tsinghua-Universität sowie der Shanghai Jiao Tong-Universität haben die Antwort geliefert.

王欣逸2026-09-21 23:42
RSI tritt nicht nur auf der Modellebene auf, sondern umfasst ein ganzes System.

Text | Wang Xinyi

Redaktion | Zhang Yuxin

RSI (Rekursive Selbstverbesserung) ist unglaublich populär geworden.

Am Samstag versammelten sich an der West Bank in Shanghai eine Gruppe der klügsten menschlichen Gehirne sowie Personen, die versuchen, KI die Fähigkeit zu verleihen, ebenfalls über intelligente Gehirne zu verfügen.

Auf der anderen Seite des Ozeans wartete Yao Shunyu, der seit Monaten nicht öffentlich aufgetreten ist und behauptet hat, Gemini 3.8 Flash sei „ein großer Schritt für RSI“, am anderen Ende der Telefonleitung; Shi Tianlin, Mitbegründer von Recursive Superintelligence – einem in dem Silicon Valley ansässigen KI-Startup mit einer Bewertung von 4,65 Milliarden US-Dollar nach einem halben Jahr seit seiner Gründung, das auf die selbstständige Evolution von KI setzt – nahm ebenfalls an dieser Diskussion teil.

Sie sind zu einem gemeinsamen Thema gekommen: Was passiert gerade in der RSI-Branche, in die Kapital strömt?

RSI, also Rekursive Selbstverbesserung, ist seit Mitte dieses Jahres das heißeste Thema. Es bedeutet, dass KI sich selbst verbessern kann: Sie kann aktiv von Code schreiben und Experimente durchführen bis hin zur Anpassung von Architekturen, Optimierung von Gewichtungen und sogar selbst neue Ziele für sich selbst finden.

Die meisten Anwesenden sind Forscher aus großen Technologieunternehmen, Universitäten und Laboren, außerdem sind viele bekannte Investmentinstitute, FAs und Inkubatoren vor Ort. Wir haben auch an dieser fünfstündigen Veranstaltung vollständig teilgenommen, wobei einige Visionen und Kontroversen immer wieder im Veranstaltungsraum aufkamen.

Alle stellen sich ein Endzustand vor, in dem Menschen nicht mehr in den Prozess eingebunden sind – also dass Menschen nicht mehr in den Zyklus der Selbstverbesserung des Modells eingreifen müssen – und überlegen, wie große Unternehmen, Labore und Startups diesen Endzustand erforschen und verwirklichen können.

Es tauchen auch unterschiedliche Stimmen auf: Ist die selbstständige Evolution eine pessimistische Zukunft? Wird man am Ende von Modellanbietern verschluckt? Soll RSI kein Pre-Training durchführen und kein vertikales Modell sein …

Zu Fragen wie der Definition, Bewertung und Überprüfung von RSI und wann sie verwirklicht wird, haben wir einige Ansichten von Forschern aus dem Silicon Valley wie Yao Shunyu und Shi Tianlin sowie von Assistenzprofessoren und Forschern von Universitäten wie der Tsinghua-Universität und der Shanghai Jiao Tong-Universität zusammengestellt, zur Referenz für alle:

1. RSI tritt ein, wenn KI-Unternehmen ihre Skalierung (z. B. die Fähigkeiten des Modells, die Anzahl der Kunden usw.) erweitern, ohne dass sie mehr die Größe ihres Teams skalieren müssen.

2. RSI ist kein einzelnes Ereignis, sondern ein kontinuierlicher Prozess.

3. Nach einigen Anzeichen seit Anfang dieses Jahres ist RSI verwirklichbar. Der große Grund ist, dass sowohl Codierung als auch Agent-Modelle ausgereift sind und einen Durchbruchspunkt erreicht haben. Auf die Art von Coding-Agent kann KI dazu gebracht werden, KI zu trainieren, ihre eigenen Ideen umzusetzen und sich selbst zu verbessern – einschließlich Architekturen, Datensätzen und ihren eigenen Trainingsmethoden usw. – um so die Verwirklichung von RSI voranzutreiben.

4. Es ist schwer zu sagen, ob der Unterschied zwischen RSI und dem Fine-Tuning von Modellen auf selbst generierten Daten qualitativ oder quantitativ ist. In gewissem Sinne ist die Generierung von Daten durch das Modell selbst die Anfangsphase von RSI.

5. Daten und Umgebungen sind ein gutes Geschäft für die Umsetzung von RSI.

6. Im Wettbewerb mit großen Unternehmen wie OpenAI und Anthropic liegen die Chancen von Gründern nicht in der allgemeinen Intelligenz, sondern im Fachwissen jenseits der Grundkenntnisse.

7. Es ist nicht notwendig, RSI-Modelle von Grund auf neu zu trainieren: Ihre Grundleistung kann kaum die allgemeinen großen Modelle übertreffen, und es ist auch schwer für sie, stärkere Fähigkeiten durch Selbstiteration zu entwickeln.

8. Bei der Bewertung von Intelligenz sollte man darauf achten, wie die Fähigkeit erlernt wurde, nicht darauf, was erlernt wurde.

9. Die endgültige Form der Überprüfung sollte nicht auf menschliche Arbeit angewiesen sein, aber kurzfristig muss die Beteiligung von Menschen beibehalten werden – insbesondere bei der Definition von Aufgaben und der Qualitätskontrolle sind nach wie vor menschliche Experten erforderlich, um hochwertige Bewertungen durchzuführen.

10. Die endgültige Version von RSI könnte ein Modell sein, das sich selbst verbessern kann; aber in der aktuellen Anfangsphase kann man sich auf externe Hilfsmodelle und das Sammeln von Feedbacksignalen stützen.

11. Das RSI, an das die meisten Menschen denken, könnte der Endzustand von RSI sein – in dem gesamten Zyklus ist überhaupt keine Person erforderlich. Aber in der Praxis ist es noch ungewiss, ob wir jemals diesen Tag erreichen werden und ob es notwendig ist, wirklich bis zu diesem Schritt zu streben.

Im Folgenden finden Sie einige praktische Inhalte der gemeinsam von AGI House, HSG und Research AI+ veranstalteten Veranstaltung mit dem Thema „Wenn KI beginnt, sich rekursiv selbst zu verbessern“, die extrahiert und bearbeitet wurden:

Zuvor stellen wir Ihnen einige Gäste vor –

  • Yao Shunyu: Leitender leitender Wissenschaftler bei Google DeepMind, konzentriert sich auf die Erkundung der Richtung Auto-Research, promovierte in theoretischer Physik an der Stanford University und arbeitete zuvor bei Anthropic.
  • Shi Tianlin: Mitbegründer von Recursive Superintelligence, Absolvent des Yao-Kurses der Tsinghua-Universität, war zuvor Forscher bei OpenAI und brach während seiner Promotion an der Stanford University das Studium ab, um gemeinsam ein KI-Unternehmen namens Cresta zu gründen.
  • Gu Yu: Mitbegründer von NeoCognition, Erstautor von ApprenticeBench
  • Zhou Xuanhe: Assistenzprofessor an der Shanghai Jiao Tong-Universität, Gründer von Theseus Labs
  • Meng Fanqing: Mitbegründer von Evolvent AI, Erstautor von RSI Bench Data
  • Liu Ziming: Assistenzprofessor an der Tsinghua-Universität, Gründer von Yuanhuan Intelligent, konzentriert sich auf die Richtung KI für KI.
  • Mu Yao: Assistenzprofessor an der Shanghai Jiao Tong-Universität, Gründer von SeeAct AI, arbeitet an der RSI-Richtung für verkörperte Intelligenz.

Darüber hinaus gehören zu den weiteren Gästen auch Forscher und Doktoranden von anderen Universitäten und Laboren im In- und Ausland. Es ist erwähnenswert, dass der Veranstalter AGI House, der im Silicon Valley aktiv ist, eine KI-Gründercommunity und ein Inkubator ist – dies ist auch ihre erste Veranstaltung in China.

Also kommen wir zum eigentlichen Thema.

Wie funktioniert die Rekursion? Wie funktioniert die Verbesserung?

Frage: Wie definiert man RSI?

Yao Shunyu: RSI ist möglicherweise nicht ein einzelnes Ereignis, sondern ein kontinuierlicher Prozess. Im Moment können wir nur darüber diskutieren, an welcher Stelle wir uns in diesem kontinuierlichen Prozess befinden.

Ein einfaches Beispiel: Modelle können bereits seit mehreren Jahren selbst Code schreiben. Die Fähigkeit, Code zu schreiben, hat tatsächlich auch den Forschungszyklus beschleunigt – das zählt bereits als Teil der Verwirklichung von RSI; später können Modelle den Fortschritt von Experimenten aktiv überwachen und neue Experimente vorschlagen, was ebenfalls als RSI gezählt werden kann.

Effektiv gesehen ist das RSI, an das die meisten Menschen denken, möglicherweise der Endzustand von RSI, in dem im gesamten Zyklus überhaupt keine Person erforderlich ist. Aber ob wir jemals diesen Tag erreichen werden und ob es notwendig ist, wirklich bis zu diesem Schritt zu streben, ist noch ungewiss.

Shi Tianlin: Aus der Perspektive von RSI muss das Modell selbst ein Bewusstsein für seine eigenen Beschränkungen haben. Es muss wissen, wo seine Mängel liegen, und in der Lage sein, sich selbst zu korrigieren, wenn es klar von dem Ziel abweicht. Das ist eine wichtige Fähigkeit von RSI selbst, also der Selbstverstärkung des Modells.

Natürlich reicht das Modell allein nicht aus: Man muss das Modell auch durch bestimmte Harness und Anwendungsszenarien beschränken.

Gu Yu: RSI ist ein sehr großes Thema, und das, was wir heute hier vor Ort tun, könnte völlig unterschiedlich sein.

Die Gemeinsamkeit aller kann in drei Kategorien unterteilt werden: Erstens findet die KI selbst das Ziel für die Verbesserung; zweitens bringt sich die KI ständig näher an dieses Ziel heran, was ein iterativer Prozess sein kann; drittens entspricht dieses Ziel möglicherweise einer sehr langfristigen Aufgabe. Zum Beispiel, wenn man große Modelle dazu bringt, große Modelle zu erstellen, ist ihr Ziel möglicherweise ein besseres Modell: Dabei muss die KI selbst Budgets festlegen, Modelle planen, Methoden zusammenfassen und am Ende ein neueres Modell erhalten.

Meng Fanqing: Wir sprechen heute oft gleichzeitig von Selbstverbesserung, kontinuierlichem Lernen und RSI.

Aus meiner Sicht ist RSI, dass das Modell in einer gegebenen Umgebung, Belohnung oder Belohnungsfunktion ständig etwas iteriert. Dieses Etwas kann sehr vielfältig sein, zum Beispiel Architekturen und Gewichtungen – sein endgültiges Ziel ist es, in dieser Umgebung eine höhere Belohnungspunktzahl zu erzielen.

In einem im wahrsten Sinne des Wortes vorhandenen RSI muss das Modell sich selbst optimieren und seine eigene Leistung verbessern, anstatt ein bestimmtes Produkt oder ein anderes Modell zu optimieren. Das gesamte System hat keine externen Faktoren außer sich selbst, nur sich selbst, die Umgebung und die Belohnung.

Zhou Xuanhe: Aus der Perspektive der Informatik sollte der Begriff „Rekursion“ auf die wesentlichste Ebene zurückgreifen. Für ein KI-System sind die wesentlichsten Ebenen seine Parameter und Architekturdesign; eine weitere Ebene außen sind verschiedene Codes und Skripte im Harness; die äußerste Ebene ist die Umgebung, mit der es interagiert, also verschiedene Dateien und Arbeitsbereiche.

Unsere Definition von RSI ist, es zuerst in industrielle Szenarien zu bringen, um zu sehen, wo es Schmerzpunkte im aktuellen Arbeitsablauf gibt. Nachdem die Schmerzpunkte gefunden wurden, muss es im nächsten Schritt Lösungen abrufen.

Die endgültige Version von RSI könnte ein Modell sein, das sich selbst verbessern kann; aber in der aktuellen Anfangsphase kann man sich auf externe Hilfsmodelle und das Sammeln von Feedbacksignalen stützen.

Hat RSI wirklich die selbstständige Evolution verwirklicht?

Frage: Wie bewertet man, ob RSI wirklich die Selbstverbesserung verwirklicht hat? Die Anwesenden haben auch einige Arbeiten zu Benchmarks durchgeführt, bitte teilen Sie die von Ihnen entwickelten Bewertungsmethoden.

Gu Yu: Es gibt zwei Punkte, auf die sich die Bewertung hauptsächlich konzentriert und warum sie zu diesem Zeitpunkt wichtig ist:

Erstens die ökologische Validität: Gute Leistungen auf einem Benchmark bedeuten nicht unbedingt, dass es die Probleme wirklich lösen kann, was direkt dem tatsächlichen Produktionswert oder wirtschaftlichen Wert entspricht. Wir wollen überprüfen, ob ein allgemeines großes Modell zu einem reifen Mitarbeiter werden kann, der wirklich in einer bestimmten Position arbeitet. Deshalb bauen wir eine Umgebung auf, die der echten Arbeit nahe kommt.

Zweitens: Was genau wollen wir bei der Intelligenz bewerten? Ich habe in vielen Situationen eine Ansicht zitiert: Intelligenz bedeutet nicht, wie viele Dinge du beherrschst, sondern wie du sie erlernt hast.

Zhou Xuanhe: Die Bewertung ist sehr wichtig. Insbesondere wenn chinesische Fachkräfte im Bereich KI eine Richtung festlegen, werden alle sehr schnell das Oberlimit dieser Richtung auf ein sehr hohes Niveau heben.

Das aktuelle Problem ist, dass die Benchmarks selbst nicht gut genug sind – selbst einige bekannte Benchmarks enthalten viele falsche Fragen. Wie sollte ein Benchmark für RSI aussehen? Neben den drei Fähigkeiten der traditionellen Agenten: Denken, Erkunden und Planen müssen wir auch darüber nachdenken, welche neuen Fähigkeiten RSI benötigt. Wir glauben auch, dass in Zukunft nicht nur die KI selbst iterieren muss, sondern dass wirklich hochwertige Benchmarks auch mit menschlichen Experten kombiniert werden müssen.

Die Überprüfung ist der Engpass für die kontinuierliche Weiterentwicklung von RSI

Frage: Wie definiert man die Überprüfung, oder können Sie einige Ihrer Überlegungen dazu teilen?

Yao Shunyu: Was bei RSI am schwierigsten zu verwirklichen ist: die Selbstverbesserung oder der Beweis, dass man sich wirklich verbessert hat – ich denke, es ist die Überprüfung, dass man sich wirklich verbessert hat.

Viele Menschen haben in der Vergangenheit ähnliche Dinge getan, die damals „Cyber-Kritik“ genannt wurden: Eine KI erstellt Aufgaben, eine andere KI löst sie. Diese Vorgehensweise gerät sehr leicht in ein lokales Optimum: Zum Beispiel erstellt eine KI immer sehr einfache Aufgaben, die die andere alle lösen kann; oder eine erstellt immer sehr schwierige Aufgaben, die die andere niemals lösen kann. Deshalb ist das Schwierigste daran, dass das Modell wirklich verstehen muss, bis zu welchem Grad es sich verbessert hat. Im Vergleich zum Lösen von Problemen ist das Definieren von Problemen definitiv das Schwierigste bei RSI.

Meng Fanqing: Sprechen wir zunächst nicht davon, ob die Überprüfung selbst richtig gestaltet ist – selbst wenn sie vollständig korrekt ist, führt sie zu einem großen Problem: der Reproduzierbarkeit.

Heutzutage werden die Umgebungen immer komplexer: Es geht um CPU-Modelle, Betriebssysteme wie Mac oder Windows, Arbeitsspeichergrößen – unterschiedliche physische Plattformen führen zu Lücken.

Außerdem geben die meisten aktuellen Benchmarks für jede Aufgabe eine absolute Punktzahl von 0 bis 1 an. Aber diese Punktzahlen haben keine starke physische Bedeutung, und die absolute Punktzahl allein sagt nichts aus.

Einer unserer Kooperationspartner hat ein anderes Bewertungssystem vorgeschlagen. Es unterteilt die Ebenen in verschiedene Schichten wie Agent-SOTA und Human-SOTA, wobei jede Schicht unterschiedlichen Produkten entspricht. Auf jeder neuen Plattform wird durch Ausführen dieser Produkte bestimmt, zu welcher Schicht die Ausgabe des Modells gehört. Dadurch lassen sich die oben genannten Probleme vermeiden, die durch die fehlende physische Bedeutung und Hardware-Lücken entstehen.

Zhou Xuanhe: Vor langer Zeit habe ich die Arbeit eines Teams der Tsinghua-Universität gesehen: Während des Inferenzprozesses fügen sie den Gewichtungen Störgeräusche hinzu, um zu überprüfen, dass unterschiedliche Störmethoden das Modell zu besseren Ergebnissen führen können. Das verwirklicht eigentlich das, was wir anstreben: die Fähigkeit, während des Inferierens zu lernen und gleichzeitig die Gewichtungen anzupassen.

Aus interner Sicht haben wir bereits Module entwickelt, bei denen Inferenz und Gedächtnis getrennt sind: Es gibt implizite Übergänge von Zwischenzuständen aus den Modulen für Gedächtnisverfolgung, und man kann sie auch durch externe Maßnahmen schützen.

RSI-Startups, die mit großen Unternehmen um ihre ökologische Nische konkurrieren

Frage: Wie denkt man über die Grenzen zwischen RSI-Startups und