StartseiteArtikel

Mit nur einem Bild lässt sich dein ideales 3D-Traumhaus generieren, Tische, Stühle und Einrichtungsgegenstände lassen sich nach Belieben austauschen, ein weiteres Weltgenerierungsmodell ist erschienen.

智东西2026-09-01 16:43
Die Anwendungsszenarien umfassen Embodied Intelligence, Spiele, Film- und Fernsehproduktionen, XR und weitere Bereiche.

Bericht von Zhidx am 1. September: Heute hat die in Shanghai ansässige Firma für 3D-Generations-Großmodelle Yingshi Technology das Weltgenerationsmodell Hyper3D WorldGen veröffentlicht, das die 3D-Generationsentwicklung von „einzelnen Assets“ hin zu „vollständigen Szenen“ vorantreibt.

Nachdem der Nutzer ein Szenenbild hochgeladen hat, kann das Modell die Hauptobjekte im Bild automatisch erkennen und entsprechende 3D-Assets generieren. Es unterstützt auch die manuelle Auswahl von Zielbereichen zur Generierung, baut durch die selbst entwickelte CAST-Architektur des Yingshi Hyper3D-Teams die räumlichen und physikalischen Beziehungen zwischen Objekten wieder auf und erzeugt schließlich eine 3D-Szene, die aus mehreren unabhängigen, bearbeitbaren, austauschbaren und interaktiven Assets besteht.

CAST steht für „Komponentenausgerichtete 3D-Szenenrekonstruktion auf Basis eines einzelnen RGB-Bildes“, ein szenenebenes Generationsforschungsresultat, das das Yingshi Hyper3D-Team im Jahr 2025 veröffentlicht hat. Sein Kern besteht darin, die dreidimensionale Struktur verdeckter Objekte aus einem einzelnen Bild zu ergänzen, Beziehungen wie Kontakt, Stützung und Aufhängung zwischen Objekten zu erkennen und mehrere unabhängige Objekte in einen einheitlichen, physikalisch plausiblen dreidimensionalen Raum einzufügen. Diese Forschung wurde mit dem besten Papier der SIGGRAPH 2025 ausgezeichnet.

Es ist bemerkenswert, dass die Generationsfähigkeit von WorldGen bereits in echten Produktionsszenarien wie Simulationsausbildung für verkörperte Intelligenz, Filmproduktion, Spieleentwicklung und XR Einzug gehalten hat, wodurch die szenenebene 3D-Generierung von der visuellen Darstellung hin zu industriellen Arbeitsabläufen voranschreitet.

Vor der Veröffentlichung des Modells haben Medien wie Zhidx Wu Di, Gründer und CEO von Yingshi Technology, sowie Zhang Qixuan, Mitbegründer und CTO, interviewt und über Themen wie den technischen Weg von WorldGen, den Fortschritt der Anwendung und die Branchentrends der 3D-Generierung ausgetauscht.

01. Ein Bild erzeugt eine Szene, Assets in der Szene sind interaktiv

Auf dem Medienaustauschtreffen demonstrierte Zhang Qixuan den Generationsprozess von WorldGen: Nach dem Hochladen eines Bildes eines Bürowaschraums kann das System Hauptobjekte wie Wasserhahn, Teller und Obst automatisch erkennen, in etwa 2-3 Sekunden eine 3D-Vorschau einzelner Objekte erzeugen und innerhalb von etwa 2-3 Minuten die vollständige Szene wiederherstellen.

Diese Objekte sind unabhängige Assets, die ausgewählt, verschoben und ausgetauscht werden können. Nach Aktivierung der SimReady-Funktion kann das System physikalische Eigenschaften wie Masse, Größe und Reibungskoeffizient der Assets abschätzen, sodass Obst unter Krafteinwirkung in das Becken rollen kann.

Darüber hinaus können Nutzer entsprechend der Wichtigkeit der Objekte unterschiedliche Generationsgenauigkeiten wählen, um zuerst die Szenenstruktur schnell festzulegen und dann die Schlüssel-Assets detailliert zu bearbeiten.

Wu Di führte als Beispiel an: Wenn man mit einem Generationsmodell direkt ein Bild eines Konferenzraums in eine 3D-Szene umwandelt, werden Tische, Stühle, Wände und andere Objekte im Bild normalerweise miteinander verschmolzen, sodass sie schwer einzeln auszuwählen und zu bearbeiten sind. WorldGen kann während des Generationsprozesses die Hauptobjekte in der Szene aufteilen, unabhängige Assets jeweils generieren und gleichzeitig die räumlichen und physikalischen Beziehungen zwischen ihnen wiederherstellen.

Um die Szenenverfügbarkeit und die visuelle Integrität zu berücksichtigen, verwendet WorldGen eine gemischte Darstellungsweise: Für Objekte, die bearbeitet und interagiert werden müssen, werden Mesh-Modelle mit vollständiger geometrischer Struktur verwendet, was nachfolgende Anpassungen und das Hinzufügen von physikalischen Eigenschaften erleichtert; der Hintergrund verwendet 3D Gaussian Splatting, das auf die Wiederherstellung des Szenenaussehens abzielt, um mehr Umgebungsdetails zu behalten.

02. Vier Arten von Anwendungsszenarien abdecken, Fortschritte zuerst in Bereichen der verkörperten Intelligenz und der Filmproduktion

Zhang Qixuan erläuterte gegenüber Zhidx, dass WorldGen kein Modell ist, das für eine einzelne Branche entwickelt wurde. Seine Anwendungsszenarien erstrecken sich auf Bereiche wie verkörperte Intelligenz, Spiele, Filmproduktion und XR. Derzeit wird WorldGen in verschiedenen Richtungen für die praktische Anwendung eingeführt.

Im Bereich der verkörperten Intelligenz hat Yingshi Hyper3D bereits Kooperationen mit Digurobot und Moxianfei geschlossen, um Simulationsausbildungslösungen anzubieten: WorldGen ist verantwortlich für die Generierung von 3D-Szenen, die für die Simulation verwendet werden können, Moxianfei übernimmt die Simulationsanpassung und Digurobot stellt Rechenleistung und Entwicklungstoolketten zur Verfügung.

Zhang Qixuan sagte: „Generative 3D kann die Objektarten und Szenenlayouts schnell erweitern, wird aber echte Daten nicht vollständig ersetzen. Für das Robotertraining ist es in Zukunft wahrscheinlicher, Simulationsdaten und echte Daten gemischt zu verwenden.“

Im Filmbereich kann WorldGen das Problem lösen, dass Videomodelle die räumliche und positionsbezogene Konsistenz von Objekten in mehreren Aufnahmen nur schwer aufrechterhalten können. Ersteller können zuerst 3D-Szenen mit klarer räumlicher Struktur generieren, darin Aufnahmen anpassen, Objekte verschieben und Layouts ändern, dann an Videomodelle wie Seedance 2.5 übergeben, um Charakterdarstellungen, Materialien, Lichtschatten und Bildstile zu ergänzen.

In Bereichen der Spieleentwicklung und professionellen 3D-Produktion können die von WorldGen generierten unabhängigen Mesh-Assets in digitale Inhaltserstellungswerkzeuge (DCC) und Echtzeit-Engines wie Blender, Unity, PlayCanvas und Unreal Engine importiert werden, um weitere Materialanpassungen, Animationsbindungen, Level-Bearbeitungen und Leistungsoptimierungen durchzuführen. Im Juli dieses Jahres haben Yingshi Hyper3D und Unity China außerdem eine Kooperation angekündigt, um den Ablauf von der 3D-Generierung bis hin zu Echtzeit-Spielanwendungen zu verbinden.

Im XR-Bereich kann WorldGen Referenzbilder in bearbeitbare dreidimensionale Räume umwandeln. Nutzer können die Szene aus verschiedenen Perspektiven beobachten sowie Objekte und räumliche Layouts anpassen, was für Innendesign, räumliche Präsentationen und immersive Erlebnisse verwendet werden kann.

Zhang Qixuan teilte Zhidx mit, dass die Anwendungen von WorldGen in den oben genannten Branchen derzeit hauptsächlich in der Phase der internen Testung oder technischen Validierung sind. Das Team wird die nachfolgenden Schwerpunkte der Investitionen entsprechend den tatsächlichen Anforderungen der Kunden festlegen.

03. Hauptsächlich auf Starrkörpergenerierung ausgerichtet, Weiterentwicklung hin zu „Weltaufbau“

Während des Interviewaustauschs antwortete Zhang Qixuan auf Fragen zu den technischen Grenzen von WorldGen, dass die vom System generierten physikalischen Eigenschaften wie Masse und Reibungskoeffizient keine genauen Messungen echter Objekte sind. Sie werden hauptsächlich durch Kombination von Asset-Volumen, visuellen Informationen, Beziehungen zu umgebenden Objekten, traditionellen Schätzalgorithmen und visuellen Sprachmodellen über die Massenverteilung, den Reibungskoeffizienten und die Kollisionskörper abgeleitet.

Daher können diese Ergebnisse nicht als präzise Ingenieurdaten verwendet werden. Derzeit unterstützt WorldGen hauptsächlich die Generierung von Starrkörpern und deckt noch keine gegliederten Assets, weichen Körper oder Flüssigkeiten ab.

Bezüglich der Beziehung zwischen WorldGen und dem „Weltmodell“ sagte Wu Di, dass das Weltmodell sowohl Aktionsmodelle für Entscheidungen und Handlungen umfasst als auch Modelle, die interaktive und trainierbare Umgebungen generieren. WorldGen nähert sich eher Letzterem an. Yingshi Hyper3D wird sich deswegen nicht als Weltmodell-Firma definieren, seine Kernpositionierung bleibt die 3D-Generierung.

Wu Di ist der Ansicht, dass Videomodelle gut für die Darstellung des endgültigen Bildes geeignet sind, während 3D Objekte, räumliche Strukturen und physikalische Beziehungen eindeutig speichern können. Die beiden Wege ersetzen sich nicht gegenseitig, sondern werden in Zukunft wahrscheinlicher in gemischter Form kombiniert.

Von einzelnen Assets hin zu vollständigen Szenen verleiht WorldGen den Generationsergebnissen stärkere Steuerbarkeit, Bearbeitbarkeit und Kompatibilität mit Arbeitsabläufen. Da sich die 3D-Generierung von „gut aussehend“ hin zu „wirklich nutzbar“ entwickelt, wird die szenenebene Generierung auch zu einer neuen grundlegenden Fähigkeit, die Branchen wie Spiele, Filmproduktion, verkörperte Intelligenz und XR verbindet.

04. Schlussfolgerung: Der Wettbewerb in der 3D-Generierung richtet sich auf die Szenenverfügbarkeit

Die 3D-Generierungsfähigkeit von WorldGen beschränkt sich nicht nur auf die Generierung einzelner Assets oder eines 3D-Raums. Es kann mehrere unabhängige Assets aufbauen, räumliche Beziehungen und physikalische Eigenschaften verstehen und vollständige Szenen bilden, die weiter bearbeitet, interagiert und ausgeführt werden können. Der Schwerpunkt des Wettbewerbs in der 3D-Generierung verschiebt sich von der visuellen Qualität einzelner Modelle weiter hin zur Steuerbarkeit, physikalischen Plausibilität und Arbeitsablaufkompatibilität von Szenen.

Derzeit basiert WorldGen noch hauptsächlich auf der Starrkörpergenerierung, einige physikalische Eigenschaften hängen auch von der Modellableitung ab. In Bereichen wie verkörperte Intelligenz, Spiele, Filmproduktion und XR befindet es sich noch in der Phase der Validierung und frühen Implementierung. Ob sein nachfolgender Wert wirklich freigesetzt werden kann, hängt davon ab, ob die Generationsergebnisse stabil in professionelle Produktionsabläufe einfließen können. Die Entwicklung von „Generierung von Assets“ hin zu „Aufbau von Szenen“ ist jedoch bereits ein praktikabler Ansatz im Bereich der 3D-Generierung.

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Zhidx“ (ID: zhidxcpm), Autor: Yang Jingli, Redakteur: Li Shuiqing, veröffentlicht mit Genehmigung von 36Kr.