Gespräch mit Min Wei, Gründer von Yingshen Intelligence: Hinter der 8,2-Milliarden-US-Dollar-Übernahme von Li Feifeis World Labs durch AMD ist der Wendepunkt des 4D-Weltmodells bereits eingetreten.
Am 28. September verbreitete sich eine bahnbrechende Nachricht: AMD gab auf seiner offiziellen Website bekannt, dass es die Weltmodellfirma World Labs, die von der chinesischstämmigen KI-Wissenschaftlerin Li Feifei gegründet wurde, für etwa 8,2 Milliarden US-Dollar in einer reinen Aktientransaktion übernimmt. Die Kreise der verkörperten Intelligenz und der Weltmodelle auf beiden Seiten des Pazifiks wurden völlig aufgemischt.
Branchenkenner riefen erstaunt „Amazing“ aus. World Labs wurde vor weniger als zwei Jahren gegründet und hat nur zwei Produkte: die 3D-Szenengenerierungsplattform Marble und das Weltmodell Atlas. Das Unternehmen hat keine Einnahmen offengelegt, ganz zu schweigen von einem Geschäftsmodell. Die technische Route ist bei weitem noch nicht konsolidiert: Vertreter der 3D-Raumintelligenz, der nicht generativen latenten Raumtechnik und der Plattforminfrastruktur arbeiten alle auf ihre Weise, und niemand hat bewiesen, dass seine Lösung die endgültige Antwort ist.
Kontroversen tauchten fast gleichzeitig auf: Einige sagten, dies sei eine Allianz zweier starker Seiten, andere nannten es einen Verrat der „KI-Patin“ an der unabhängigen Forschung. Aus Sicht der Investoren ist diese Übernahme jedoch möglicherweise selbstverständlich, da der Übernehmer bereits ein früher Anteilseigner war und die tatsächliche Geschäftslage von World Labs besser verstehen kann.
Yingshen Intelligence, das wie World Labs im Bereich der Weltmodelle tätig ist, erkennt die dahinterstehende Logik noch deutlicher: Das 4D-Weltmodell hat den Wendepunkt für das Scaling-Up erreicht, genau wie der Entwicklungspfad großer Sprachmodelle zuvor. World Labs benötigt mehr Rechenleistung für die Skalierung, während AMD im Voraus ein Chip-Ökosystem auf Basis der 4D-Weltmodellarchitektur aufbauen will.
Min Wei, CEO von Yingshen Intelligence, geht davon aus, dass am Wendepunkt der Skalierung und angesichts des Wettbewerbs durch Konkurrenten wie GPT-6 World Labs keine Zeit mehr hat, als Startup in kleinen Schritten voranzukommen, sondern zu einer groß angelegten industriellen Entwicklung übergehen muss.
Im Juni 2024 gründete Min Wei, ehemaliger Leiter des Roboterteams von Alibaba, Yingshen Intelligence in Hangzhou gemeinsam mit Liu Yebin, einem langjährigen Professor an der Tsinghua-Universität, der sich seit mehr als 20 Jahren mit der dynamischen 3D-Rekonstruktion befasst. Am ersten Tag des Startups traf das Team eine „nicht-mainstreamige“ Entscheidung: Große Sprachmodelle verarbeiten eindimensionale Sprache, Videomodelle verarbeiten zweidimensionale Bilder, während Roboter sich in einer 4D-Welt aus dreidimensionalem Raum und eindimensionaler Zeit bewegen. Mit niedrigdimensionalen Daten kann man keine Intelligenz trainieren, die die hochdimensionale Welt versteht.
In den folgenden zwei Jahren ging Yingshen auf dem Weg zur Verfolgung großer Datenmengen einen „Subtraktionsweg“: Es reduzierte die hochpräzisen 4D-Erfassungsgeräte von einem „Erfassungskäfig“ mit 80 Kameras im Wert von mehreren Millionen Yuan auf 4 bis 6 gewöhnliche Kameras; zwei Server mit acht Grafikkarten auf eine Consumer-GPU; die Trainingswartezeit von einem Tag auf eine quasi-Echtzeit-Generierung in mehreren zehn Millisekunden. Auf dieser Basis brachte Yingshen Intelligence Anfang dieses Jahres das 4D-Weltmodell in Schuhfabriken, sodass Roboter, die die physikalischen Gesetze wirklich verstehen, Klebearbeiten und Sohlenpressen wie Menschen erledigen können. Im September dieses Jahres wurden die 4D-Live-Übertragung und das 4D-Spiel von Yingshen Intelligence erstmals auf der Chinesischen Internationalen Messe für Dienstleistungshandel vorgestellt. Zur gleichen Zeit veröffentlichte Li Feifei Atlas, der denselben Weg der 4D-Generierung aus spärlichen Perspektiven verfolgt.
Die beiden Routen haben sich unabhängig voneinander auf beiden Seiten des Pazifiks konsolidiert, aber ihr Schicksal ist unterschiedlich. Die Geschichte von Atlas bleibt in Demonstrationen stecken, während Yingshen bereits Roboter in Schuhfabriken eingesetzt hat: Mit einer Genauigkeit im Millimeterbereich und einer Ausbeute von 99,9 % werden in einer 45-köpfigen Produktionslinie nur 5 Gruppenleiter benötigt, um 40 Roboter zu verwalten. Im Inland hat Yingshen Intelligence Aufträge im Wert von mehreren hundert Millionen Yuan erhalten, im Ausland wurden die ersten hundert Roboter nach Vietnam exportiert, mit Aufträgen im Wert von mehreren zehn Millionen Yuan. Mit dem Geschäftsmodell „Verkauf von Geräten + Verkauf von Tokens“ kommen Kunden aus Ägypten, der Türkei und Südamerika nacheinander hinzu.
Welche Vertrauenserklärung gibt die Übernahme von World Labs durch AMD für diese Technologie? Hat ein unabhängiges Startup noch Chancen, nachdem die „KI-Patin“ in das System eines Großkonzerns eingetreten ist? Wie weit ist die groß angelegte Anwendung des 4D-Weltmodells noch entfernt? Nach dieser Übernahme führten wir ein Gespräch mit Min Wei. Im Folgenden das aufbereitete Gesprächsprotokoll.
8,2 Milliarden US-Dollar: Was kauft AMD eigentlich?
36Kr: Als die Nachricht von dieser Übernahme bekannt wurde, haben viele Leute aus dem Bereich der verkörperten Intelligenz in unseren Freundeskreisen das mit „Amazing“ beschrieben. Aber ehrlich gesagt haben wir immer eine Frage: Die Technologie der Weltmodelle ist bei weitem noch nicht konsolidiert. Warum setzt AMD so früh so viel Geld ein? Warum ist es bereit, so eine große Summe auszugeben?
Min Wei: Ich denke, AMD hat zwei Gründe für diese große Investition. Erstens war AMD in den vorherigen Runden bereits Großaktionär und Hauptinvestor von World Labs. Es kennt den Fortschritt von World Labs viel besser als wir. Zweitens veröffentlichte World Labs Anfang September dieses Jahres das neue Modell Atlas. Atlas hat einen entscheidenden Durchbruch: Im Vergleich zur vorherigen Generation von Marble kann es 4D-Daten über Kameras mit spärlichen Perspektiven generieren. Li Feifei hat dazu eine Demonstration gezeigt, bei der sie ein Kleidungsstück schüttelt, das Bild sich wie in einem „Bullet-Time“-Effekt frei bewegen lässt und in Echtzeit 4D-Generierung durchführt. Wir haben diese Technologie bereits im April dieses Jahres realisiert.
Damals haben wir bereits festgestellt, dass diese Technologie das Problem der groß angelegten Erfassung von 4D-Daten lösen kann. Früher erforderte die Erfassung von 4D-Daten viele Kameras und eine lange Verarbeitungszeit, sodass keine Echtzeitleistung möglich war und keine große Anzahl von Kameras in realen Szenen eingesetzt werden konnte. Als wir die Erfassung auf 6 Perspektiven reduziert hatten, erkannten wir scharfsinnig: Diese Technologie kann in der Industrie und im täglichen Leben massiv eingesetzt und massiv Daten erfasst werden. Sobald diese Hürde der massiven Datenerfassung überwunden ist, wird es sofort zu einem großen Scale-Up kommen. Das Weltmodell ist dann der Anwendung einen Schritt näher und wird von der grundlegenden Forschung in die Phase großer Datenmengen und Modelle mit großen Parametern übergehen.
Daher gehe ich davon aus, dass Atlas nach unserer Kenntnis dieser technischen Route und unseren vorherigen Arbeiten auch die Hürde der massiven Erfassung auf der 4D-Route überwunden hat, genau wie wir. AMD hat das auch erkannt und hat sich daher schnell zusammengeschlossen, um World Labs mit einer hohen Summe zu übernehmen. Es ist abzusehen, dass sie anschließend auf groß angelegte, industrielle Weise in der realen Welt mit Geräten wie Atlas mit spärlichen Perspektiven massiv Videos erfassen, beispielsweise mit 6 oder sogar 3 Perspektiven, dann Videos aus spärlichen Perspektiven in 4D umwandeln und mit 4D-Daten leistungsfähigere 4D-Weltmodelle trainieren.
36Kr: Das heißt, erst nach der Veröffentlichung des Atlas-Modells im September hat der Anwendungswert dieser Route einen großen Sprung gemacht?
Min Wei: Ja, es löst grundsätzlich das Problem der Erfassung massiver Daten. Das ist der erste Grund. Der zweite Grund ist die Veröffentlichung von GPT-6. Nach der Veröffentlichung von GPT-6 wird es ein Problem geben: Traditionelle visuelle Modelle, die Videos als Trainingsdaten verwenden, werden stark unter Druck geraten.
36Kr: Trotzdem scheint dieser Zug von AMD sehr riskant zu sein. Es könnte weiterhin strategisch investieren, statt so früh ein gesamtes Unternehmen in sein eigenes System zu integrieren. Wie sehen Sie die Entwicklung, bei der sich die beiden Seiten immer weiter annähern?
Min Wei: Die Kernaussage ist: Sobald die Datengenerierungstechnologie mit spärlichen Perspektiven funktioniert, hat sie den Wendepunkt erreicht und kann massiv ausgeweitet werden. Danach sind große Konkurrenten wie GPT-6 bereits auf dem Vormarsch. World Labs hat keine Zeit mehr, als Startup oder Einhorn in kleinen Schritten weiterzuforschen, sondern muss zu einer groß angelegten industriellen Produktion übergehen.
36Kr: Also gehen Sie davon aus, dass der Sektor den Wendepunkt von 0 auf 1 überschritten hat und bald in die Phase von 1 auf 10 eintritt.
Min Wei: Ja, technisch ist alles bereit. Wenn die Entwicklung nach dem eigenen Rhythmus abläuft, ist sie sicherlich nicht so schnell und effizient wie mit der hohen Investition eines Großkonzerns. Sie müssen auch erkannt haben: Sobald Atlas die Technologie der spärlichen Perspektiven veröffentlicht hat, werden andere Großkonzerne sicherlich nachziehen. Wenn sie also weiterhin die Vorherrschaft behalten wollen, müssen sie das Scale-Up mindestens in dem Jahr vorantreiben, bevor andere Großkonzerne aufholen. Das Zeitfenster ist sehr wichtig.
Drei Sprünge in zwei Jahren: Technologie zur Lösung von Engpässen in der Branche
36Kr: Dazu haben Sie früher eine bekannte Ansicht in der Branche vertreten: Bei Daten geht es nie um die Menge, sondern um die Dimension. Das ähnelt der Ansicht von Li Feifei. Warum hat Yingshen so früh mit der Arbeit an 4D-Daten begonnen?
Min Wei: Aus der Sicht des ersten Prinzips ist die Welt selbst 4D. Wenn man visuelle KI entwickeln will, die mehr Gesetze der physischen Welt verarbeiten kann, muss man zuerst die Raum-Zeit-Dimension an die reale Welt angleichen. Beim Pre-Training mit Videos ist es jedoch sehr schwierig, die Gesetze der Physik korrekt abzubilden.
Nehmen wir den Wind als Beispiel. Wind kann im Pixelraum nicht modelliert werden, er ist transparent und hat keine RGB-Informationen. Aber im 4D-Raum ist er ein Fluid im Raum, dessen Transparenz Null ist, und er kann sehr wohl modelliert werden.
Ein weiteres typisches Problem, dem wir früher begegnet sind: Änderungen des Hintergrunds und der Beleuchtung. Im Pixelraum gehören diese Änderungen zu Variationen der Schlüsselmerkmale. Das Modell kann diese Korrelationen nur durch Hinzufügen massiver Daten beseitigen, indem es dieselbe Aktion mit verschiedenen Hintergründen kombiniert und das Modell durch Daten lernt, dass der Hintergrund irrelevant und nicht kausal ist. Bei 4D ist dies sehr einfach zu realisieren. Außerdem sind Verdeckungen, Berührungen und Durchdringungen von Objekten, die im 2D-Raum sehr schwer zu erlernen sind, im 4D-Raum auf einen Blick klar.
Aus dimensioneller Sicht ist der grundlegende Grund: Alle echten physikalischen Gesetze sind in der vierdimensionalen Raumzeit definiert. Es ist sehr schwierig, physikalische Gesetze mit Daten zu erlernen, die durch die Projektion in den niedrigerdimensionalen 2D-Pixelraum entstanden sind.
36Kr: Yingshen hat früh Durchbrüche im Bereich der 4D-Daten erreicht. Können Sie uns erläutern, welche technischen Engpässe es zu Beginn gab und wie wir sie schrittweise überwunden haben?
Min Wei: Bei 4D-Daten waren die größten Engpässe bei der Gründung des Startups im Jahr 2024 die Erfassungskosten, die Hardware-Hürden und die Trainingsdauer. Unsere frühe Technologie verwendete etwa 80 Kameras für die hochpräzise 4D-Erfassung, erforderte zwei Server mit acht Grafikkarten und die Daten von wenigen Minuten brauchten einen ganzen Tag zum Trainieren. Damals haben wir die 4D-Generierung mit mathematischen iterativen Optimierungen realisiert, die kleine Mengen hochpräziser Daten erzeugen kann, aber nicht skalierbar ist. Erstens sind die Gerätekosten sehr hoch: 80 Kameras kosten mehr als eine Million Yuan. Zweitens können 80 Kameras nicht in großen Mengen in realen Produktionsumgebungen eingesetzt werden. Man kann zwar experimentelle Tische und einfache Szenen in den Erfassungskäfig bringen, aber die realen Szenen sind viel komplexer. Man kann keine Produktionslinien oder Werkzeugmaschinen hineinbringen, die Kosten wären absurd hoch.
In den letzten zwei Jahren haben wir uns daher auf drei Dinge konzentriert: Die Anzahl der Kameras schrittweise zu reduzieren, die Anforderungen an die Rechenleistung schrittweise zu senken. Drittens die Zeit für Erfassung, Training und Generierung zu verkürzen. Mit mathematischen Methoden der iterativen Optimierung und wiederholten Berechnungen haben wir die 4D-Daten, die früher einen Tag zum Rendern brauchten, auf Echtzeit-Rendering verkürzt.
Im letzten Jahr haben wir die Anzahl der Kameras von 80 auf mehr als ein Dutzend reduziert, die Erfassungs- und Trainingszeit von einem Tag auf mehrere Stunden, die Anzahl der Server von zwei auf einen verringert. Die Kosten sind stark gesunken. Im April dieses Jahres haben wir einen weiteren technischen Durchbruch erzielt: Die Anzahl der Kameras sank von mehr als einem Dutzend auf 4 bis 6, für den Server reicht eine gewöhnliche Consumer-GPU aus, die Zeit wurde auf Millisekunden komprimiert, sodass eine quasi-Echtzeitleistung erreicht wird. Damals haben wir zuerst ein Demo für 4D-Live-Übertragung erstellt, das im September auf der Chinesischen Internationalen Messe für Dienstleistungshandel in Peking vorgestellt wurde.
Mitte September haben wir plötzlich festgestellt, dass Li Feifei Atlas veröffentlicht hat, dessen technische Route mit unserer identisch ist: auch wenige Kameras mit spärlichen Perspektiven, auch 4D-Generierung. Ob ihre Lösung in Echtzeit funktioniert, muss noch überprüft werden.
Aus dieser Perspektive kann man, solange man 4D-Generierung mit spärlichen Perspektiven realisieren kann, in alle Szenen der realen physischen Welt eintreten: Wohnungen, Arbeitsplätze, Werkstätten, Restaurants. Die Installation von 6 Kameras ist kostengünstig, die Anforderungen an die Umgebung sind sehr niedrig, und es handelt sich um eine nicht-invasive Erfassung, bei der die erfassten Personen nichts bemerken. Das schafft die Voraussetzungen für eine groß angelegte industrielle Erfassung.
36Kr: Sie haben gerade erwähnt, dass die Anzahl der Kameras stark reduziert wurde. Wie wurde dieser Sprung erreicht?
Min Wei: Das frühe Modell mit 80 Kameras basierte im Wesentlichen auf einer mathematischen Formel, ohne historische Informationen und ohne Vor