VAST sammelte innerhalb eines halben Jahres rund 5 Milliarden Yuan an Finanzmitteln: Der einst von dem allgemeinen Konsens abweichende Akteur ist zur „Grundlage der Welt“ geworden | Erste Veröffentlichung von Intelligenter Emergenz
Nach 3 Jahren der Unternehmensgründung, selbst nachdem er den gesamten Verlauf der großen Modell-Spur von der Entstehung bis zur rasanten Entwicklung erlebt hat, findet Song Yachen, Gründer und CEO von VAST, dass die jüngste Entwicklungsgeschwindigkeit immer noch „über die Erwartungen hinausgeht“ – der Konsens über Weltmodelle und UGC-interaktive Inhaltsplattformen hat sich extrem schnell gebildet. In seiner ursprünglichen Vorstellung „musste man vielleicht noch zehn Jahre lang darüber sprechen, bis die (3D-)Technologie reif ist und alle langsam verstehen, was das ist.“
Kürzlich hat sein von ihm gegründetes KI-Unternehmen VAST die Finanzierungsrunden B und B+ abgeschlossen, mit einem Gesamtbetrag von etwa 3 Milliarden Yuan, angeführt von Matrix Partners China.
Zu den weiteren Investoren gehören: erstklassige Industriekapitalgeber wie Perfect World, BlueFocus, Core Dynamic Investment, Extend Fun Games, ThunderSoft, State Radio and Television Investment, 37 Interactive Entertainment, sowie erstklassige Finanzinvestoren wie CDH VGC, CICC Capital, CMC Capital, Hongtai Fund, Sanzheng Health Investment, Zhongping Capital, Fujian Industrial Investment Fund, Fujian Venture Capital, ZuoYuan Asia, Jiangxi Financial Control.
Gleichzeitig haben die alten Aktionäre Dachen Caizhi, Chunhua Capital, 4399, Muhua Kechuang, Oasis Capital, Invision Capital und Huakong Fund weiterhin überproportional nachinvestiert.
In weniger als einem Jahr hat VAST insgesamt etwa 5 Milliarden Yuan an Finanzmitteln aufgebracht und damit den Rekord für das Finanzierungsvolumen im Bereich KI 3D neu aufgestellt.
Hinter dem rasanten Finanzierungsrhythmus ist es bemerkenswert, dass sich der Hintergrund der VAST-Investoren in den letzten Monaten immer vielfältiger gestaltet hat – Kapitalgeber aus zahlreichen Industrien wie Automobil, E-Commerce, Spiele, Unterhaltungselektronik, XR, Film und Fernsehen, Werbung, Kultur und Tourismus haben alle in diese Spur investiert.
So wie Salesforce in Anthropic investiert und Claude integriert hat, und BMW in Figure AI investiert und Roboter in die Produktionslinien einführt, bedeutet die Investition des nachgelagerten Industriekapitals oft, dass die technologische Entwicklung eine neue Phase erreicht: Die Technologie wird von „verfügbar“ zu „nutzbar“; die enormen kommerziellen Gewinne, die die Technologie mit sich bringt, verwandeln sich auch von Zahlen im Businessplan in sichtbare Vorteile für die Industriepartner.
Was das Industriekapital zuerst schätzt, ist die technische Fähigkeit von VAST.
Im August hat VAST gerade die neueste Generation des KI-3D-Basismodells Tripo P2.0 Preview vorgestellt, das weltweit das erste 3D-Großmodell ist, das innerhalb weniger Sekunden hochwertige Vierkantnetze generieren kann.
Verglichen mit der vorherigen Version P1.0 haben Fähigkeiten wie Generationsgenauigkeit und Flächenbereich von P2.0 einen qualitativen Sprung gemacht: Die Obergrenze der einseitigen Anzahl wurde von 20.000 Dreiecksflächen auf 50.000 Dreiecksflächen erhöht, gleichzeitig wurde ein nativer Vierkantflächen-Topologiemodus hinzugefügt, der maximal 25.000 Vierkantflächen unterstützt.
△Tripo P1.0 vs P2.0. Quelle: bereitgestellt von VAST
Die andere Seite der echten Investition der Industriepartner ergibt sich aus den herausragenden Implementierungs- und Kommerzialisierungsergebnissen von VAST.
Derzeit ist VAST eines der wenigen KI-Gründungsunternehmen, das sowohl selbst entwickelte Basismodelle besitzt als auch kommerzielle Ergebnisse in vertikalen Bereichen erzielt hat. Sein Kernprodukt Tripo Studio bedient derzeit Dutzende Millionen Nutzer weltweit, und das 3D-native Basismodell Tripo wurde bereits in die Arbeitsabläufe in- und ausländischer Unternehmen wie NetEase, Tencent, ByteDance und Microsoft integriert.
„3D ist die native Darstellung der Welt“, sagte Song Yachen einst. Dass VAST heute so stark umworben wird, liegt auch daran, dass es genau dort steht, wo die heutigen Investoren Vertrauen setzen: Der nächste Sprung des großen Modells wird im Verständnis, der Simulation und der Interaktion mit der physischen Welt stattfinden.
Um in jeder Phase weiterhin führend zu bleiben, müssen Modell und Anwendung gemeinsam vorangetrieben werden – das Grundmodell bestimmt die Grenze der Implementierungsszenarien, und die Plattform übernimmt die Anwendung und Kommerzialisierung.
Allerdings hat VAST nicht die Absicht, ein ideales Skript für sich selbst zu entwerfen. Zuvor hat Song Yachen mehrfach öffentlich zugegeben: Gleich nach der Gründung des Unternehmens wollte er eine UGC-interaktive Inhaltsplattform aufbauen, stellte aber schnell fest, dass die „Handykamera“ im 3D-Bereich noch nicht erfunden wurde – in einer Zeit, in der Technologie und Produkte in der Spur noch weit von der Reife entfernt sind, ist es selbst für ein einzelnes Unternehmen schwierig, einen geschlossenen kommerziellen Kreislauf für 3D-UGC-Inhalte zu erreichen.
Nachdem er das verstanden hatte, vollendete Song Yachen mit seinem Team den „Zweistufenplan“ vom Modell zur Plattform: Im ersten Schritt löste man das Problem des Basismodells und der neuen Produktivität, sodass jeder ohne Schwelle, kostenlos und in Echtzeit kreativ arbeiten kann; im zweiten Schritt baute man eine Plattform auf, um Inhalte und Erlebnisse an Endverbraucher zu verteilen und die Kommerzialisierung abzuschließen.
Song Yachen glaubt, dass KI 3D neue plattformweite Chancen bringen wird, deren potenzielle Marktgröße weit größer ist als die der Inhaltsplattformen, die wir heute kennen.
„Lassen Sie die KI sich an die industriellen Standards der Menschen anpassen, nicht umgekehrt“
„Wenn Ihnen jemand sagt, dass Sie an einem Tag 100.000 Assets generieren können, was würden Sie tun?“ Das ist eine Frage, über die Cao Yanpei, Chefwissenschaftler von VAST, in der letzten Zeit oft nachdenkt.
Solche Annahmen klangen vor einem halben Jahr noch wie ein unmögliches Märchen.
In der traditionellen 3D-Industriepipeline sind die zeitaufwändige Retopologie und das Rigging wenig von künstlerischer Kreativität geprägt, sondern im Wesentlichen komplexe manuelle Arbeit – die manuelle Retopologie eines einzelnen Assets dauert mehrere Stunden bis Tage und ist der größte Personalengpass in der gesamten Produktionspipeline. Sobald man bei Topologie und Rigging steckenbleibt, wird der gesamte Produktionsrhythmus verlangsamt.
Um KI-generierte 3D-Assets direkter in die Produktionspipeline einzubringen, muss die native Mesh-Generierung realisiert werden, d. h. 3D-Assets mit angemessener Flächenanzahl, regulärer Struktur und geeigneter Aufteilung werden direkt auf der Mesh-Darstellung generiert.
Nach dem Aufkommen der Ära der großen Modelle hat nicht niemand versucht, dieses Problem zu lösen.
Zurück ins Jahr 2024: Der besonders beliebte technische Konsens im KI-3D-Bereich war damals die Auto-Regression.
Der enorme Erfolg des autoregressiven Paradigmas bei großen Sprachmodellen hat den 3D-Bereich stark beeinflusst. Viele Forscher versuchten, die 3D-Darstellung zu serialisieren – Meshes, die ursprünglich keine natürliche lineare Reihenfolge haben, werden in geordnete Tokens codiert und dann nacheinander vorhergesagt, wie wenn man Sätze generiert.
In den letzten zwei oder drei Jahren hat die autoregressive Route der Branche tatsächlich „Vorteile“ gebracht. Praktiken von Projekten wie MeshGPT und MeshAnything haben gezeigt, dass auf Basis der autoregressiven Route 3D-Modelle native Meshes mit geringer Flächenanzahl, kompakter Struktur und bestimmtem Produktionswert generieren können.
Allerdings erkannte VAST sehr früh, dass die Auto-Regression für die native Mesh-Generierung nur einen „scheinbaren Wohlstand“ bringt. Wenn man das Mesh zwangsweise in eine serialisierte Darstellung einbringt, kommt es zu Informationsverlusten. Sobald man eine höhere Obergrenze anstrebt, treten Probleme wie die Akkumulation von Fehlern massiv auf.
„Das ist eigentlich ein sehr umständlicher Weg zwischen den Rohdaten und dem endgültig gewünschten Asset“, sagte Cao Yanpei, Chefwissenschaftler von VAST.
Diese der Branche vorauseilende Beurteilung stammt von dem Grundprinzip, an dem VAST seit seiner Gründung festhält: „Generieren, um es sofort nutzen zu können“. Mit den Worten von Cao Yanpei: „Lassen Sie die KI sich an die industriellen Standards der Menschen anpassen, nicht umgekehrt“.
„Um hochwertige Meshes innerhalb von Sekunden zu generieren, kann man nicht die autoregressive Route gehen – mit der heutigen Rechenleistung und dem heutigen Paradigma ist es unmöglich, innerhalb einer Sekunde zehntausende Tokens zu generieren, um zehntausende Flächen zu erzeugen“, sagte Cao Yanpei.
Das zwang VAST, einen schwierigeren End-to-End-Weg zu gehen: Direkt auf den ursprünglichsten Mesh-Daten des 3D-Modells trainieren und das gesamte Asset auf einmal generieren – das ist auch der zentrale Trainingsgedanke von VASTs heutigem Grundmodell Nexus.
Um dieses Ziel zu erreichen, hat VAST das gesamte Modell und die Datenpipeline neu aufgebaut, einschließlich einer weltweit umfangreichen 3D-nativen Datenassetbibliothek sowie einer selbst entwickelten Trainings- und Inferenzinfrastruktur. Gleichzeitig hat das Team ein Ingenieursystem aufgebaut, das Forschungsprototypen zu robusten und effizienten Onlinediensten weiterentwickelt – das bedeutet, dass die Technologie im Labor schließlich zu einem Produkt wird, das Nutzer stabil nutzen können.
Der Wendepunkt der Modellfähigkeitsiteration begann mit der Erforschung des selbst entwickelten Algorithmus-Frameworks Nexus durch VAST.
Verglichen mit der linear generierenden autoregressiven Route entkoppelt Nexus die Generierung von Knotenpunkten und Topologie, erzeugt Knotenpunkte global von grob zu fein durch hierarchische Diffusion und codiert beliebige Topologien durch „räumlich-zeitliche Intervalle“ – einfach ausgedrückt: Zuerst wird das Ganze generiert, dann werden die Details ergänzt.
Auf Basis dieses Pfades realisierte Nexus erstmals auf Basis eines Diffusionsmodells die native Mesh-Generierung, die vollständig ohne Sortierung auskommt. Die zugehörige Arbeit wurde von SIGGRAPH, der internationalen Top-Konferenz für Computergrafik, aufgenommen.
Dank des Vorsprungs auf dem Gebiet der Diffusionsroute, des scharfen Know-hows und der kontinuierlichen Investition in Trainingsressourcen steht VAST im KI-3D-Bereich weltweit an der Spitze der Algorithmen (SOTA): Tripo P1.0 ist das weltweit erste 3D-Großmodell, das innerhalb weniger Sekunden produktionsreife Meshes ausgeben kann – seine Geschwindigkeit ist hundertmal höher als die anderer marktüblicher Lösungen. Seit die P-Serie im März dieses Jahres online gegangen ist, gibt es in der Branche kein anderes Modellprodukt, das die gleiche Wirkung erzielt.
Die grundlegenden Algorithmusvorteile von Nexus wurden bald in der im August dieses Jahres online gestellten P2.0 Preview bestätigt.
Seit langem sind Vierkantnetze der Industriestandard für die Produktion in Branchen wie Spiele und Film. Aber viele traditionelle Retopologie-Routen können Generierungsgeschwindigkeit und Qualität von Vierkantflächen nicht miteinander vereinbaren.
Im Nexus-Framework ist die Generierung verschiedener Flächentypen (Ordnung der Flächen) eine eingebaute Fähigkeit des Modells; gleichzeitig muss man nicht den langwierigen Prozess durchlaufen, zuerst ein Hochmodell zu generieren und es dann umzuwandeln – Mehrkantnetze können in einem einzigen Generierungsschritt direkt erzeugt werden. Dadurch ist Tripo P2.0 das weltweit erste 3D-native Basismodell, das native Vierkantflächentopologie realisiert, und die generierten 3D-Assets können direkt den industriellen Produktionsstandards entsprechen.
Das ist der Sieg des Nicht-Konsenses und auch der Sieg des ersten Prinzips.
△Tripo 2.0 Preview. Quelle: VAST WeChat Video-Konto
Die Grenze der Modellfähigkeit schafft die Grenze der Welt
Aus der Sicht von Cao Yanpei besteht der Fortschritt der Modellfähigkeit in den letzten drei Jahren im Wesentlichen darin, das Problem der 3D-Asset-Versorgung auf der Modellseite zu lösen. Im Vergleich zu früher, als man ein Hauptcharakter-Asset erst nach einem halben Monat erhalten konnte, „werden die Inhaltskonsumenten sehr unterschiedliche Entscheidungen treffen, sobald die Inhaltsproduktion steigt“, was zu einer qualitativen Veränderung der Produktionsparadigmen und Denkweisen im Inhaltsbereich führt.
Auf der C-Seite haben die Praktiken von Modellanbietern bei der Videoerstellung und Vibe Coding gezeigt: Die Modellfähigkeit bestimmt die Grenze der Nachfrage. Dieses Gesetz gilt auch im KI-3D-Bereich.
Seit die Tripo P-Serie online gegangen ist, nutzen immer mehr Entwickler weltweit die Codierungsfähigkeit des Modells, um Produkte wie Webseiten und Spiele mit 3D-interaktiven Inhalten auf eine „sprechen und erzeugen“-Weise zu entwickeln.
Zum Beispiel hat der ausländische unabhängige Entwickler @thebuggeddev auf Basis von Tripo sowie Codierungsmodellen wie Claude Code und Codex mehrere exquisite 3D-interaktive Webseiten erstellt. Von der Generierung von 3D-Assets über die Webseiten-Erstellung bis hin zur Three.js-Codeerstellung und Renderung hängt der gesamte Erstellungsprozess nicht von traditionellen professionellen Tools wie Blender ab – Entwickler können den Aufbau vom Modell zur interaktiven Webseite nur durch natürliche Sprache und Code abschließen.
Kürzlich wurde die 3D-interaktive Anwendung für menschliche Anatomie, die er auf X veröffentlicht hat, von Greg Brockman, Präsident von OpenAI, weiterverbreitet, und der ursprüngliche Beitrag erhielt mehr als 10.000 Likes. Der Erstellungsprozess dieser exquisiten Webseite ist nicht kompliziert: Zuerst entwirft man mit GPT Image 2.0 die Konzeptzeichnung, generiert nacheinander Organbilder, wandelt sie dann mit Tripo jeweils in 3D-Modelle um und lässt schließlich Codex den Code zum Zusammenbau schreiben.
△ Greg Brockman hat die 3D-interaktive Webseite weiterverbreitet, die @thebuggeddev per Tripo Vibe Coding erstellt hat. Quelle: X