StartseiteArtikel

PrimalVerse (Yuanhao Power) hat eine Seed-Finanzierungsrunde in Höhe von mehreren hundert Millionen Yuan abgeschlossen. Das Spitzenteam der Tsinghua-Universität hat das Basismodell des 4D-Weltmodells entwickelt.

光源资本2026-07-23 14:37
Wenige Teams weltweit, die die gesamte technische Kette des 4D-Weltmodells durchgängig beherrschen

Kürzlich gab PrimalVerse, ein Unternehmen für 4D-Weltmodelle, den Abschluss einer Seed-Finanzierungsrunde im Wert von mehreren hundert Millionen Yuan bekannt, an der bekannte Finanzinvestitionsinstitute wie Legend Star, Ginkgo Valley Capital, Qifu Capital und Zhuoyuan Asia gemeinsam teilnahmen, sowie eine strategische Investition von JinFeng Medical, einem führenden Industrieakteur im Bereich der Operationsrobotik. Diese Finanzierungsrunde wird hauptsächlich für die Entwicklung des Basismodells des 4D-Weltmodells und die Erweiterung des Teams verwendet und wird kontinuierlich die Anwendungsvalidierung in vertikalen Szenarien wie Embodied Intelligence, Spielen und Filmen, autonomem Fahren sowie medizinischen Operationen vorantreiben.

PrimalVerse wurde von einem Spitzenteam für Weltmodelle mit Hintergrund der Tsinghua-Universität gegründet. Das Team arbeitet seit langem tiefgreifend an 3D/4D-Rekonstruktion, neuronalem Rendering, physikalischer Simulation und Robotik und ist eines der wenigen Teams weltweit, das die gesamte technische Kette von 4D-Weltmodellen durchgängig beherrscht. Als Partner wird Lighthouse Capital PrimalVerse kontinuierlich dabei unterstützen, die technische Entwicklung des 4D-Weltmodells und die Validierung von Anwendungen in mehreren Szenarien voranzutreiben.

Definition der fünften Generation von Basismodellen: Von der Generierung von Inhalten zur Simulation der Welt

Große Sprachmodelle haben KI gelehrt, das nächste Wort vorherzusagen, und Videomodelle lassen KI beginnen, das nächste Bild eines Frames vorherzusagen. Aber wenn KI in Szenarien der realen physischen Welt wie Robotik und autonomes Fahren eindringt, müssen die Modelle weiter beantworten:

Was passiert mit der Welt nach einer Aktion?

Betrachtet man die Entwicklung der Basismodelle, so repräsentiert die erste Generation große Sprachmodelle wie GPT, die hauptsächlich Sprachverständnis, Schlussfolgerung und Dialog (Text-Token) lösen; die zweite Generation kombiniert Bild-Token und Text-Token, repräsentiert durch Nano Banana und GPT Image2.0, und realisiert Bild- und Textverständnis sowie Bildgenerierung; die dritte Generation, repräsentiert durch Sora und Seedance, führt Video-Token ein und beginnt, zeitliche Dynamik und Aktionskontinuität zu verarbeiten. Die ersten drei Generationen von Modellen modellieren hauptsächlich Sprache und zweidimensionale visuelle Inhalte und sind noch nicht wirklich in die dreidimensionale physische Welt eingetreten. Die vierte Generation nativer multimodaler Großmodelle mit 3D-Token wird beginnen, geometrische Strukturen und physikalische Eigenschaften darzustellen; in der nächsten Phase müssen Basismodelle Raum, Zeit, physikalische Gesetze und Aktionsinteraktionen weiter in eine einheitliche Darstellung einbeziehen.

Auf der Grundlage dieser Beurteilung schlägt das PrimalVerse-Team vor: Das fünfte Generation multimodaler Großmodell wird das Basismodell des Weltmodells mit nativem 4D-World-Token als Kern sein (4D = 3D-Raum + Zeit).

4D-World-Token kann als "neue Sprache" verstanden werden, mit der das Modell die physische Welt versteht: Es zeichnet nicht nur ein einzelnes Frame auf, sondern muss kontinuierlich darstellen, was die Objekte in der Szene sind, wo sie sich befinden, wie sie sich bewegen, welche physikalischen Eigenschaften sie haben und wie sie sich unter der Wirkung von Aktionen verändern.

Wenn Sprache, Bild, Video und 3D/4D-Weltzustände in demselben Modell gemeinsam trainiert werden können, wird KI nicht nur die visuelle Erscheinung der Welt lernen, sondern die Struktur, Gesetze und Aktionsfolgen der Welt selbst. Das Modell wird auch von "Generieren eines Videos" weiter zu "Betreiben und Simulieren einer Welt" übergehen.

Der Gründer von PrimalVerse erklärte:

"4D ist keine zusätzliche Fähigkeit des Weltmodells, sondern der grundlegende Ausdruck der physischen Welt selbst. Das erste Prinzipproblem des Weltmodells ist, ob es genau beschreiben kann, wie die Welt von einem Zustand zum nächsten übergeht, was gleichzeitig das Verständnis von Raum, Zeit, physikalischen Eigenschaften und Interaktionsbeziehungen erfordert. Wir glauben, dass die Beurteilung, ob ein Modell die physische Welt wirklich versteht, letztendlich an der 4D-Darstellung ausgerichtet sein sollte; nur wenn zuerst ein natives 4D-Weltmodell aufgebaut wird, kann ein einheitlicher und vertrauenswürdiger Maßstab für die physische Welt für verschiedene technische Pfade bereitgestellt werden."

PrimalVerse möchte direkt auf der untersten Ebene native 4D-Weltzustände aufbauen, in einem einheitlichen Modell gleichzeitig Raum, Zeit, Physik und Interaktion lernen und Geometrie, Material, Bewegung, Kontakt und physikalische Eigenschaften in den Zustandsänderungsprozess einbeziehen, um das Paradigma des 4D-Weltmodells zu definieren, das wirklich auf Physical AI ausgerichtet ist.

Weltweit seltenes Full-Stack-Team für 4D-Weltmodelle

Um das Basismodell des nativen 4D-Weltmodells aufzubauen, müssen vier Fähigkeitsstapel durchgängig beherrscht werden: Rekonstruktion, Simulation, Rendering und Robotik. Das Fehlen einer beliebigen Fähigkeit wird den vollständigen Aufbau, die kontinuierliche Evolution und die echte Interaktion der Welt einschränken. Weltweit sind Teams, die die vollständige technische Kette abdecken und durchgängig verbinden können, äußerst selten.

Das Kernteam von PrimalVerse stammt von Spitzenuniversitäten wie der Tsinghua-Universität, der Peking-Universität, der Shanghai Jiao Tong-Universität und der Hong Kong University of Science and Technology. Es arbeitet seit langem an Schlüsseltechnologien für 4D-Weltmodelle und hat international führende Ergebnisse in allen Kernabschnitten des 4D-Weltmodells erzielt:

In der Richtung des Echtzeit-neuronalen Renderings erhielt SlimmeRF das Best Paper auf der 3DV 2024; in der Richtung der steuerbaren Simulation erhielt MARS den Best Paper Runner-up auf der CICAI 2023, das auch der weltweit erste Open-Source-Simulator für hochgradig realistisches autonomes Fahren ist und das Paradigma des modularen neuronalen Renderings für die Simulation des autonomen Fahrens begründet; im Bereich der Robotik ist Dexora (ICRA 2026 Best Paper Finalist) das weltweit erste Open-Source-VLA-Modell für duale geschickte Hände mit hohem Freiheitsgrad; Automated Synthesis of Facial Mechanisms for Conversational Animatronic Robots (RSS 2026 Best Paper Finalist)

realisiert die automatische Generierung herstellbarer und kollisionsfreier mechanischer Gesichtsstrukturen von Robotern aus einem einzelnen Porträt und verkürzt die professionelle Entwurfszeit von 22,8 Stunden auf 11,7 Minuten; in der Richtung der Rekonstruktion und Darstellung erhielt TRELLIS.2 das Best Student Paper auf der CVPR 2026, das weltweit erste 8K-3D-Modell, das aus einem einzelnen Bild generiert wird, realisiert erstmals die native 3D-Generierung von Geometrie und Material und durchbricht den Pfad, in dem die Branche allgemein auf 2D-Diffusion zur Generierung von Materialien angewiesen ist.

Diese Ergebnisse bilden gemeinsam einen klaren Weg:

Die Welt verstehen, die Welt aufbauen, die Welt simulieren und schließlich Agenten antreiben, in der Welt zu handeln.

Das PrimalVerse-Team hat Dutzende von Ergebnissen auf Top-Konferenzen wie CVPR, ICCV, SIGGRAPH, 3DV, RSS, ICRA und ECCV vorgelegt und verfügt über Ergebnisse auf Best-Paper-Niveau in den vier grundlegenden technischen Stapeln: Rekonstruktion, Simulation, Rendering und Robotik. Die Gründung von PrimalVerse ist das erste Mal, dass die langjährigen Akkumulationen des Teams in verschiedenen zukunftsweisenden Richtungen zu einem einheitlichen Ziel zusammengeführt werden – die Entwicklung des fünften Generation multimodalen 4D-Weltmodell-Basismodells.

Einstieg über vertikale Weltmodelle zur Validierung der Fähigkeiten des allgemeinen Basismodells

Der Wert des fünften Generation 4D-Weltmodells wird zunächst in den Szenarien freigesetzt, die die höchsten Anforderungen an dynamischen Raum, physische Authentizität und Aktionsinteraktion stellen.

Im Bereich der Embodied Intelligence hat PrimalVerse mit mehreren führenden Unternehmen in Teilbereichen zusammengearbeitet, um gemeinsame Validierung in Bezug auf Generierung von Simulationsdaten, Vorhersage von Aktionsfolgen, Strategietraining und Sim2Real voranzutreiben. Unter anderem hat PrimalVerse gemeinsam mit Geek+ das Weltmodell Gravity 4D für echte Lagerarbeitszenarien entwickelt, das in End-to-End-Arbeitsabläufen wie Greifen mehrerer SKUs, Kistentransport und Kooperation mobiler Roboter validiert wurde. Die Fähigkeiten des Teams in dynamischer Vorhersage, Kraftfeedback-Modellierung und Bedienung mit hohem Freiheitsgrad, die in Ergebnissen wie Dexora und TA-VLA angesammelt wurden, werden auch kontinuierlich in Lösungen für Weltmodelle für echte Roboteraufgaben umgewandelt.

Im Bereich der medizinischen Operationen führen der strategische Investor JinFeng Medical und PrimalVerse tiefgreifende gemeinsame Forschung und Entwicklung in Richtungen wie dem speziellen Weltmodell für medizinische Szenarien, Operationsrobotern mit Embodied Intelligence und intelligenter Simulations-Trainingsplattform durch. Sie integrieren die Fähigkeiten des Weltmodells tiefgreifend mit dem Operationsroboter selbst, klinischen Szenarien, Fernoperationssystemen und dem Ausbildungssystem für Ärzte, um Operationsroboter von präzisen Ausführungswerkzeugen zu intelligenten chirurgischen Infrastrukturen aufzuwerten, die über Szenarienverständnis, Risikovorhersage und kooperative Betriebsfähigkeiten verfügen.

Im Bereich von Spielen und Filmen hat PrimalVerse eine tiefe strategische Zusammenarbeit mit einem führenden Filmunternehmen abgeschlossen und treibt gleichzeitig Kooperationsabsichten für virtuelle Filmstudios und Regieprojekte voran. Auf der Grundlage von Ergebnissen wie Light-X führt das Unternehmen industrielle Fähigkeiten zur Generierung von 3D-Assets, steuerbaren Kamerafahrten und steuerbarer Beleuchtung in den tatsächlichen Produktionsprozess ein, um die Produktion dynamischer Inhalte, virtuelle Aufnahmen und den Aufbau bearbeitbarer Szenarien zu unterstützen.

Im Bereich des autonomen Fahrens verfügt PrimalVerse über einen vollständigen Fähigkeitsstapel von hochgradig realistischer Simulation, Vorhersage von Weltzuständen bis hin zu dreidimensionaler Rekonstruktion auf Stadtebene: MARS unterstützt die steuerbare Simulation komplexer Straßenszenarien (der erste Open-Source-Simulator für hochgradig realistisches steuerbares autonomes Fahren, der den Grundstein für die neuronale Rendering-Simulation des autonomen Fahrens legt und von vielen großen Unternehmen übernommen wird), OmniNWM realisiert multimodale, langfristige Weltvorhersage und Strategiebewertung; TideGS, das das Team gemeinsam mit Great Wall Motors entwickelt hat, durchbricht das Grafikspeicherengpass bei der groß angelegten 3DGS-Training, unterstützt mehr als 1 Milliarde Gaussian Primitives auf einer einzelnen 24GB-GPU, was die Trainingsskala pro einzelner Karte um etwa eine Größenordnung im Vergleich zur Branche erhöht (im Vergleich zu World Labs Spark 2.0 mit etwa 100 Millionen) und liefert die grundlegende Unterstützung für den Aufbau des nativen 3D-Weltmodells auf Stadtebene.

Embodied Intelligence, medizinische Operationen, Spiele und Filme sowie autonomes Fahren sind keine vier völlig unabhängigen Geschäftslinien, sondern die Validierung einer Reihe von 4D-Weltmodell-Fähigkeiten in verschiedenen Szenarien: Das autonome Fahren bietet eine komplexe dynamische Welt, Embodied Intelligence bietet Aktionen und physisches Feedback, Spiele und Filme validieren die Generierung hochwertiger Welten und Echtzeit-Rendering, und medizinische Operationen prüfen das Verständnis und die Simulationsfähigkeit des Modells in Szenarien mit hohen Sicherheitsanforderungen, komplexen Verformungen und feinen Interaktionen. Mehrere Szenarienergebnisse und industrielle Kooperationen werden auch kontinuierlich Daten, Modelle und Systemfähigkeiten ansammeln, um das allgemeine 4D-Basismodell zu fördern.

In Zukunft wird PrimalVerse von den Anforderungen an Training, Simulation und Inhaltsproduktion in vertikalen Szenarien ausgehen und schrittweise ein allgemeines 4D-Weltmodell aufbauen, das über Szenarien und Branchen hinweg migriert werden kann, und zum Eingangstor des Basismodells werden, mit dem Physical AI die Welt versteht, trainiert und simuliert.