StartseiteArtikel

Feng Shuo: Das Scaling Law der Weltmodelle liegt nicht in den Parametern, sondern in den Daten.

星连资本2026-09-28 10:51
Der Schlüssel zur Skalierung des Modells der physischen Welt liegt in skalierbaren, kostengünstigen physikalischen Daten

Um Weltmodelle zu skalieren, müssen zuerst die Datenprobleme gelöst werden. Die Parameterzahl kommt erst danach.

Am 17. September teilte Feng Shuo, außerordentlicher Professor am Fachbereich Automatisierung der Tsinghua-Universität, Doktorvater und stellvertretender Direktor des Instituts für Systemtechnik, im Rahmen des Themas »Das Scaling Law von Modellen der physischen Welt« eine von der Mainstream-Erzählung abweichende Einschätzung mit:

»Der Ausgangspunkt des Weltmodells ist nicht der Körper, sondern müssen die Daten sein.«

In den vergangenen Jahren wurden bei Diskussionen über Embodied Intelligence immer zuerst der Roboterkörper, VLA, End-to-End-Modelle und Generalisierungsfähigkeit thematisiert.

Aber Feng Shuo stellte eine noch frühere Frage: Woher stammen die Daten der physischen Welt? Wenn Daten immer teuer und knapp sind und Roboter nicht in großflächige reale Szenarien eindringen können, womit können Weltmodelle kontinuierlich trainiert werden?

Zuerst muss die Rechnung klar sein: Woher stammen die Daten, wer trägt die Kosten.

Ohne Lösung dieses Problems lassen sich Modelle der physischen Welt kaum wirklich skalieren.

01

Roboter können nicht wie Menschen zwanzig Jahre in der Realität »aufwachsen«

Go ist das einfachste Beispiel zur Verdeutlichung des Problems.

Das Go-Brett ist begrenzt, die Regeln sind klar, und es gibt eindeutige Zustandsübergänge für das, was im nächsten Schritt passieren wird. AlphaGo kann vor dem eigentlichen Setzen eines Steins intern massiv suchen und simulieren.

Selbst bei komplexeren Spielen sind die Kosten für einen Neustart nicht hoch. Charaktere können nach dem Tod neu starten, die Zeit kann beschleunigt werden, und die Umgebung kann wiederholt zurückgesetzt werden.

Die physische Welt entfernt diese Schutzschicht.

Die Zeit läuft nicht rückwärts, Geräte verursachen Kosten, und Fehlhandlungen können sogar Sicherheitsrisiken mit sich bringen. Wenn Roboter in reale Umgebungen gehen, um Daten zu sammeln, lassen sich die Vorgänge nicht per Knopfdruck unbegrenzt duplizieren.

Feng Shuo erwähnte, dass Menschen zwanzig Jahre lang wachsen, Fehler machen und Erfahrungen sammeln können, bevor sie in die komplexe Gesellschaft eintreten. Roboter können nicht so lange warten. Wir können sie nicht zwanzig Jahre in der Realität »aufwachsen« lassen, bevor wir sie in Fabriken, Haushalten oder öffentlichen Umgebungen zur Arbeit schicken.

Roboter müssen vor der Auslieferung bereits ein gewisses Verständnis für diese Welt haben.

Wenn ein Mensch an einen Fluss kommt, löst er nicht zuerst Strömungsgleichungen im Gehirn. Wir betrachten die Strömung, die Wassertiefe, das Flussbett und die möglichen Standpunkte und beurteilen nach Erfahrung, ob wir hindurchgehen können. Nach dem ersten Schritt passen wir unsere Beurteilung anhand der Rückmeldungen des Körpers an.

Das ist die Art und Weise, wie Menschen mit der physischen Welt umgehen.

Aus der Sicht von Feng Shuo müssen Maschinen auch zuerst wissen, was passieren könnte und welcher Schritt ein höheres Risiko birgt. Nach dem Eintritt in reale Szenarien korrigieren sie sich dann anhand von Rückmeldungen.

02

Können wir durch die weitere Vergrößerung von großen Sprachmodellen Weltmodelle umgehen?

Vor Ort stellte jemand die Frage klar und deutlich.

Heutige große Sprachmodelle und Multimodal-Modelle zeigen bereits ein gewisses physisches Verständnisvermögen. Können wir in Zukunft größere Modelle dazu bringen, Probleme zu verstehen, Code und Simulationen aufzurufen und dann die meisten Aufgaben in der physischen Welt zu lösen?

Feng Shuo äußerte sich nicht endgültig zu dieser Frage.

Dieser Weg könnte funktionieren.

Modelle können eine physische Aufgabe in ein Datenproblem, ein Programmproblem oder ein Simulationsproblem umwandeln. Bei Schwierigkeiten können sie mehr Rechenleistung zur Ableitung einsetzen. Videomodelle können auch einen Teil der physikalischen Gesetze aus einer großen Menge visueller Daten lernen.

Ihm geht es mehr darum, wie viele Umwege dieser Weg erfordert und wie viel Kosten er verursacht.

Wenn Modelle ständig durch Schichten wie Text, Bilder, Videos, Symbole und Programme laufen müssen, um die physische Welt zu verstehen, lässt sich die Antwort vielleicht berechnen, aber der Weg ist sehr umständlich.

Feng Shuo benutzte Platons Metapher der »Höhlenprojektion«, um diesen Unterschied zu beschreiben. Was wir sehen, ist vielleicht nur der Schatten, den die physische Welt wirft, und wir haben die Gesetze selbst noch nicht erfasst.

Das menschliche Verständnis der physischen Welt ist direkter.

Wenn wir einen Becher greifen, eine Treppe hinaufsteigen oder eine Tür öffnen, führen wir nicht jedes Mal eine strenge Berechnung durch. Viele Beurteilungen stammen aus Erfahrungen und bilden ein internes Modell. Nach der Handlung korrigieren wir es anhand von Rückmeldungen.

In Feng Shuos Vorstellung übernehmen Sprachmodelle und Weltmodelle jeweils ihren eigenen Aufgabenbereich: Ersteres behandelt Logik, Symbole und Schlussfolgerungen, Letzteres behandelt physische Intuition, Handlungsvorhersage und echte Rückmeldungen.

Erst wenn diese beiden Fähigkeiten verbunden sind, können Maschinen wirklich verstehen und handeln.

Damit kehrt die Frage zu den Daten zurück: Womit soll dieses Modell trainiert werden?

03

Das wirklich Knappe sind nicht Roboter, sondern skalierbare physische Daten

Rechenleistung, Algorithmen und Daten sind die drei am häufigsten verwendeten Elemente zur Erklärung des Wachstums der KI.

In der Vergangenheit stieg die Rechenleistung kontinuierlich gemäß dem Mooreschen Gesetz; Algorithmen hängen von der langfristigen Erforschung durch Wissenschaft und Industrie ab; Inhalte wie Texte, Codes und Bilder im Internet lieferten große Modellen riesige Trainingsmaterialien.

Das größte Problem der physischen Welt ist genau, dass Daten nicht von selbst anwachsen.

Internetdaten wurden von Menschen über lange Zeit erzeugt und natürlich abgelagert. Physische Daten müssen oft speziell gesammelt werden: Man kauft Geräte, baut Szenarien auf, stellt Personal ein, entwirft Aufgaben und muss zudem Kosten für Verschleiß und Misserfolge tragen.

Feng Shuo ist der Ansicht, dass der aktuelle zentrale Engpass von Embodied Intelligence und Modellen der physischen Welt die unzureichende Datenskala ist.

Das Problem liegt darin: Roboter können den Daten-Flywheel-Effekt des autonomen Fahrens kaum replizieren.

Feng Shuo verglich die Wege von Waymo und Tesla miteinander.

Auf der einen Seite stehen kostspielige spezielle Fahrzeuge, Sensoren und Testsysteme. Für jede zusätzliche gesammelte Dateneinheit müssen weiter Personal, Geräte und Zeit investiert werden.

Auf der anderen Seite stützt man sich auf Serienfahrzeuge. Selbst ohne erweiterte intelligente Fahrfunktionen werden die Fahrzeuge von Nutzern gekauft und genutzt. Die Daten, die bei täglichen Fahrten der Nutzer entstehen, fließen natürlich zurück in das System.

Der Grund, warum der letztere Weg Skaleneffekte erzielen kann, liegt darin, dass die Grenzkosten der Datenerzeugung niedriger sind.

Bei Robotern ist das schwieriger.

Ein Fahrzeug ohne intelligente Fahrfunktionen ist immer noch ein Fahrzeug. Ein Roboter ohne ausreichende Intelligenz kann oft nicht einmal stabile Aufgaben erledigen, geschweige denn in großem Umfang an echte Nutzer verkauft werden.

Ohne Nutzergröße lassen sich Daten kaum auf natürliche Weise erzeugen. Wenn die Datenmenge nicht mithält, lassen sich die Fähigkeiten des Modells kaum verbessern.

Diesen Zyklus kann man kaum durch den Kauf mehrerer Roboter durchbrechen.

04

Der Weg muss umgekehrt werden: Zuerst Daten erstellen, dann Modelle entwickeln, und schließlich den Körper befähigen

In der Vergangenheit haben die Menschen gewohnt, in dieser Reihenfolge vorzugehen:

Körper → Daten → Modell

Zuerst baut man Roboter, lässt sie in Szenarien gehen, um Daten zu sammeln, und trainiert schließlich Modelle mit den Daten.

Wenn der Körper noch nicht gut genug ist, kann er nicht in genügend viele reale Szenarien eindringen; wenn die Datenskala nicht ansteigt, lassen sich die Fähigkeiten des Modells kaum verbessern; wenn das Modell nicht ausgereift ist, kann der Körper kaum einen stabilen Wert erzeugen.

Feng Shuo schlug eine umgekehrte Reihenfolge vor:

»Zuerst Daten erstellen, dann Modelle entwickeln, und schließlich den Körper befähigen.«

Der Körper ist natürlich wichtig, aber in der frühen Phase sollte man zuerst das Datenquellenproblem lösen.

Welche Art von Daten lohnt sich zum Training von Weltmodellen?

Erstens: Die Grenzkosten müssen nahezu Null liegen.

Feng Shuo stellte eine Schlüsselfrage: Wenn wir kein Weltmodell entwickeln, würden diese Daten trotzdem natürlich entstehen?

Wenn ja, müssen die Kosten der Daten nicht vollständig vom Weltmodell-Projekt getragen werden. Fahrzeuge erzeugen bei der echten Fahrt auf natürliche Weise Fahrdaten. Eine wirklich nachhaltige Datenquelle sollte zudem in vorhandene reale Szenarien und echte Geschäftsvorgänge eingebettet sein.

Zweitens: Die Daten müssen grundlegende Kenntnisse der physischen Welt enthalten.

Sie müssen nicht alle Aspekte wie Tastsinn, Mechanik und komplexe Interaktionen abdecken, aber sie müssen dem Modell zumindest helfen, räumliche Beziehungen, Zustandsänderungen, Bewegungen von Objekten und mögliche Folgen von Handlungen zu verstehen.

Feng Shuo erwähnte besonders: Selbst wenn man vorübergehend kein vollständiges dynamisches Modell aufbauen kann, sind solche Daten wertvoll, solange sie dem Modell helfen, eine grundlegende Intuition für Bewegungsgesetze zu entwickeln.

Drittens: Die Datenquelle muss erweiterbar sein.

Zu Beginn des Projekts muss man sich fragen, ob dieser Weg sich zehntausend- oder hunderttausendfach vergrößern lässt.

Vorübergehend unausgereifte technische Glieder lassen sich schrittweise ergänzen. Aber wenn die Datenquelle selbst an unüberwindbare physische Kosten gebunden ist, lassen sich keine echte Skalierung erzielen, egal wie groß das Modell später wird und wie viel Finanzierung man bekommt.

Aus diesem Grund muss man bei diesem Scaling Law zuerst auf die Daten schauen, nicht auf die Parameter.

Man muss auf seine Grenzkosten achten, darauf, ob es physische Kenntnisse enthält, und darauf, ob es kontinuierlich erweitert werden kann.

05

Algorithmen können nicht getrennt von Daten diskutiert werden

Im Zeitalter großer Modelle beginnen viele Diskussionen mit der Modellstruktur, dem Parameterumfang und den Trainingsmethoden.

Feng Shuo zog das Algorithmusthema zurück zu den Daten: Algorithmen müssen um die Daten herum entworfen werden.

Wenn die Datenquelle von Natur aus teuer ist, eine enge Verteilung hat und schwer zu erweitern ist, können selbst die ausgefeiltesten Algorithmen das Skalieren des Modells langfristig kaum unterstützen.

Erst wenn man Daten mit niedrigen Grenzkosten, ausreichend hoher Dichte an physischen Kenntnissen und kontinuierlicher Erweiterbarkeit gefunden hat, haben Algorithmen den Raum, wirksame Trainings- und Iterationsmethoden um sie herum aufzubauen.

Die Daten bestimmen, ob dieser Weg weitergeführt werden kann.

Nachdem sich das Modell verbessert hat, kann es Robotern helfen, bessere Wahrnehmungs-, Vorhersage- und Handlungsfähigkeiten zu erwerben; Wenn ausgere