Er stammt aus derselben Alma Mater wie Liang Wenfeng. Der nach 2000 geborene Absolvent der Zhejiang-Universität entwickelt Weltmodelle und wird weitere 1 Milliarde Yuan an Finanzmitteln aufnehmen | Exklusive Erstveröffentlichung von 36Kr
Text von WANG Xinyi
Redaktion: ZHANG Yuxin
Auf der Strecke der Weltmodelle wird bald eine weitere große Finanzierungsrunde hinzukommen.
Laut exklusiven Informationen von „Intelligente Emergenz“ wird Moxin Technology, das sich auf den Bereich 4D-Weltmodelle spezialisiert, in Kürze eine neue Finanzierungsrunde abschließen. Das Finanzierungsvolumen könnte bis zu 1 Milliarde Yuan erreichen, und die Bewertung wird voraussichtlich auf fast 10 Milliarden Yuan steigen. Dies wird ihre fünfte Finanzierungsrunde in diesem Jahr und die zweite in dem vergangenen Monat sein.
Wie bekannt ist, belief sich die Bewertung von Moxin Technology nach Abschluss der letzten Finanzierungsrunde bereits auf fast 4 Milliarden Yuan. Das bedeutet, dass ihre Bewertung nach Abschluss der neuen Finanzierungsrunde innerhalb nur eines Monats auf das etwa 2,5-fache ansteigen wird.
Die bevorstehende neue Finanzierungsrunde von Moxin Technology facht die scheinbar langsam abkühlende Weltmodell-Branche erneut an. Nachrichten zufolge hat Moxin Technology vor kurzem die Umwandlung in eine Aktiengesellschaft abgeschlossen. Die neue Finanzierungsrunde behält das vorherige Merkmal der starken Beteiligung von Industriekapital bei. Zu den historischen Aktionären zählen Shen Venture Capital, Zhejiang Venture Capital, Huawei Hubble, Legend Holdings, Fuhan Micro, JinkoSolar, SMIC PE, JHICC, Prosperity7 Ventures, CDH Investments, Loongson Venture Capital usw.
Der Gründer und CEO CHEN Tianrun ist ein Mitglied der Generation nach 2000 und gleichzeitig Doktorand der Klasse 2022 an der Fakultät für Informatik und Technik der Zhejiang-Universität. Er studierte unter der Anleitung von PAN Yunhe, Akademiemitglied der Chinesischen Ingenieurakademie und ehemaliger Präsident der Zhejiang-Universität, und ist ein Mitstudent von LIANG Wenfeng, dem Gründer von DeepSeek. Seine Forschungsrichtungen umfassen 3D-Sehen, räumliche Intelligenz und Algorithmen für Weltmodelle. Er hat mehr als 50 Aufsätze in Zeitschriften wie *Science* und *Nature Photonics* sowie auf Konferenzen wie ICCV und CVPR veröffentlicht.
Moxin Technology wurde 2021 gegründet und begann ursprünglich mit der Herstellung von 3D-Druck-Hardware. Ursprünglich positionierte es sich als Anbieter von Verbraucher-Druckhardware, die hauptsächlich für Haushalte, Studenten und Kreativliebhaber bestimmt ist, und erzielte einen kumulierten Umsatz von mehreren zehn Millionen Yuan.
Die langjährige Erfahrung im 3D-Bereich ließ CHEN Tianrun erkennen, dass 3D-KI-Modellierung über ein eigenes Scaling Law verfügt. Daraufhin entwickelte sich eine mutigere Entscheidung: Ende 2024 beschloss er, mit seinem Team zu räumlicher Intelligenz überzugehen und 3D-Szenenmodellierung sowie Weltmodelle zu entwickeln. „Ob Roboter oder autonomes Fahren, letztendlich braucht es ein ‚Gehirn‘, das die physische Welt verstehen und simulieren kann. Genau dieses ‚Gehirn‘ entwickeln wir“, erwähnte CHEN Tianrun.
Die Ergebnisse wurden auch schnell vorgelegt. Im Dezember 2025 veröffentlichte Moxin Technology den Prototyp des interaktiven Weltmodells KOKONI-World. Im Juli dieses Jahres veröffentlichte Moxin gemeinsam mit dem Team von Akademiemitglied PAN Yunhe und Huawei Cloud das weltweit erste Flash World Model – MoWorld. Dieses Modell hat eine Parameteranzahl von 28B und verwendet die MoE-Architektur (Mixture of Experts). Es handelt sich um ein hochframerates interaktives Weltmodell, mit dem Benutzer durch Eingaben wie Bilder und Texte vollständige hochauflösende 3D-Szenen generieren können, die den realen physikalischen Logiken entsprechen. Es unterstützt die Kamerasteuerung mit sechs Freiheitsgraden (6-DoF) und kann Videos mit einer Länge von bis zu 2000 Frames generieren.
△ Auf der Grundlage eines Fotos oder eines Videos kann MoWorld ein 4D-Modell erstellen, das die reale physische Welt simuliert. Quelle: Unternehmen
Die hohe Framerate zeigt sich darin, dass es die Echtzeit-3D-Generierung mit 50 Bildern pro Sekunde realisieren kann. Echtzeit-Interaktion bedeutet, dass Benutzer die Perspektive und Aktionen über Tastatur, Maus usw. in Echtzeit steuern können. Das Modell generiert das nächste Bild sofort nach Erhalt der Eingabe und behält die Konsistenz der räumlichen Struktur, der Position von Objekten und des historischen Zustands bei.
In der Arbeit zu MoWorld wird erwähnt, dass im Bereich der Computergrafik und interaktiven Medien 30 FPS als der niedrigste Schwellenwert angesehen wird, um Echtzeit-Rendering zu realisieren und ein flüssiges Interaktionserlebnis zu bieten. Eine Framerate von 50 FPS bedeutet, dass jedes Bild nur 20 Millisekunden zur Generierung benötigt, um schnell auf Benutzerbefehle zu reagieren. Dies ist besonders wichtig in Szenen mit hoher Empfindlichkeit gegenüber Latenz wie verkörperte Intelligenz und autonomes Fahren.
Das Weltmodell von Moxin Technology erfordert keine hochwertigen GPUs. Der gesamte Stack basiert auf inländischen NPU und bildet ein Framework von Datengenerierung, Vortraining, Destillation bis hin zu effizienter Inferenz. Dieses Modell läuft vollständig auf den NPU-Superknoten von Ascend. In Bezug auf die Inferenzkosten kann seine Lösung die Kosten um etwa 70 % im Vergleich zu GPU-Lösungen gleicher Größenordnung senken, was nur 30 % bis 50 % der Kosten bestehender Weltmodelle beträgt.
Weltmodelle sind in diesem Jahr fast zu einem umkämpften Bereich für große Unternehmen und Startups im In- und Ausland geworden. Technologiegiganten wie NVIDIA, Google, Tencent, Alibaba und ByteDance haben ihre eigenen Weltmodelle eingeführt oder arbeiten an deren Einführung. Auch heißes Kapital strömt in die Startups für Weltmodelle: Jiajing Vision hat in diesem Jahr nacheinander drei Finanzierungsrunden mit jeweils über 1 Milliarde Yuan abgeschlossen, und Liber AI hat innerhalb von 8 Monaten fünf Finanzierungsrunden nacheinander abgeschlossen.
Auf dem Höhepunkt des Booms von Weltmodellen hat Moxin Technology auch schnell Runde für Runde Finanzierung erhalten. 20 Tage vor der bevorstehenden neuen Finanzierungsrunde im Wert von 1 Milliarde Yuan haben sie gerade die letzte Finanzierungsrunde im Wert von 500 Millionen Yuan bekannt gegeben, an der Shen Venture Capital, Zhejiang Venture Capital, Huawei Hubble, Legend Holdings usw. teilnahmen. Zuvor haben sie drei weitere Finanzierungsrunden im Wert von jeweils mehreren hundert Millionen Yuan abgeschlossen: die Pre-A+-Runde im Wert von fast 100 Millionen Yuan im März, an der Huawei Hubble teilnahm, die strategische Runde im Wert von fast 100 Millionen Yuan im Mai, an der Zhejiang Venture Capital und Legend Star teilnahmen, sowie die A-Runde im Wert von mehreren hundert Millionen Yuan im Juni, an der Huawei Hubble teilnahm.
Gleichzeitig gibt es unterschiedliche Wege zur Realisierung von Weltmodellen. Die Schule um LI Feifei ist der Ansicht, dass der Kern von Weltmodellen die räumliche Intelligenz ist. Man muss eine messbare, bearbeitbare und betretbare explizite dreidimensionale Struktur aufbauen, statt nur realistische Bilder zu generieren. Die Schule um Yann LeCun wählt den Weg der Vorhersage im latenten Raum und schlägt JEPA (Joint Embedding Predictive Architecture) vor, damit das Modell die Kausalität des Sehens verstehen und vorhersagen kann, wie der Zustand im nächsten Moment in einem abstrakten Raum aussieht.
Moxin Technology hat einen anderen Weg gewählt – den Weg der impliziten Struktur: Die KI generiert nicht direkt Bildpixel, sondern erstellt zuerst intern eine abstrakte Darstellung von „3D-Raum + Zeit“, aus der alle Szenen generiert werden. Darüber hinaus legen sie großen Wert auf die Echtzeit-Interaktion mit hoher Framerate und die technische Umsetzung der vollständigen Bereitstellung auf inländischen NPU.
Die Merkmale niedriger Kosten und hoher Echtzeitfähigkeit verleihen Moxin Vorteile bei den Kosten und der industriellen Umsetzung. In Branchen wie humanoiden Robotern und autonomem Fahren kann das auf MoWorld-3D aufgebaute digitale Simulations-Trainingsgelände eine große Anzahl von Trainingsszenen für das Robotertraining bereitstellen, sodass Roboter hochfrequente Aktionsübungen in virtuellen Produktionslinien, häuslichen Umgebungen und anderen Räumen absolvieren können, um die Infrastruktur für die Skalierung der verkörperten Intelligenz bereitzustellen.
Nach der Veröffentlichung des MoWorld-Modells beschleunigt Moxin die Erforschung und Umsetzung von Anwendungen in mehreren Szenen wie industriellem digitalem Zwilling, Training für verkörperte Intelligenz, Stadt- und Landschaftsplanung sowie Kultur- und Tourismuskonsum.
Moxin Technology liefert ein gutes Beispiel für Unternehmen, die nicht von Anfang an auf KI-Modelle spezialisiert sind. Allerdings steht Moxin unter dem Druck von Giganten und bekannten Unternehmen wie NVIDIA, Tencent und World Labs (dem Startup von LI Feifei). Ob es sich behaupten kann, die Antwort wird gerade erst geschrieben.