一张图生成3D梦中情房,桌椅摆件随心换,又一世界生成模型来了
智东西9月1日报道,今天,上海3D生成大模型公司影眸科技发布世界生成模型Hyper3D WorldGen,推动3D生成从“单个资产”走向“完整场景”。
用户上传一张场景图片后,模型可以自动识别画面中的主要物体,并生成对应的3D资产,也支持手动框选目标生成,并通过影眸Hyper3D团队自研的CAST架构,重建物体之间的空间与物理关系,最终生成由多个独立、可编辑、可替换、可交互资产组成的3D场景。
CAST为“基于单张RGB图像的组件对齐式3D场景重建”,是影眸Hyper3D团队在2025年发布的场景级生成研究成果。其核心是从单张图片中补全被遮挡物体的三维结构,判断物体之间的接触、支撑、悬挂等关系,并将多个独立物体放入统一、物理合理的三维空间。该研究曾获SIGGRAPH 2025最佳论文。
值得注意的是,WorldGen的生成能力已经进入具身智能仿真训练、影视制作、游戏开发与XR等真实生产场景,推动场景级3D生成从视觉展示走向产业工作流。
模型发布前,智东西等媒体采访了影眸科技创始人、CEO吴迪和联合创始人、CTO张启煊,围绕WorldGen的技术路线、应用进展及3D生成行业趋势等问题进行了交流。
01.一张图片生成场景,场景内资产可交互
媒体交流会上,张启煊演示了WorldGen的生成过程:上传一张办公室盥洗室的图片后,系统能够自动识别水龙头、盘子、水果等主要物体,约2-3秒生成单个物体的3D预览,并在约2-3分钟内还原出完整场景。
这些物体都是可以被选择、移动和替换的独立资产。开启SimReady功能后,系统可以为资产估计出物体质量、大小和摩擦系数等物理属性,水果能够在力的作用下滚入水池中。
此外,用户还可以根据物体的重要程度选择不同的生成精度,先快速确定场景结构,再对重点资产进行精修。
吴迪举例称,如果用生成模型直接将会议室的图片转化为一个3D场景,画面中的桌椅、墙壁和其他物体通常会被合并在一起,难以单独选择和编辑。WorldGen在生成过程中能够拆分场景中的主要物体,分别生成独立资产,同时还原它们之间的空间与物理关系。
为了兼顾场景可用性与视觉完整性,WorldGen采用混合表达方式:需要编辑和交互的物体使用具备完整几何结构的网格模型(Mesh),方便后续调整和添加物理属性;背景则采用侧重还原场景外观的3D高斯泼溅(3D Gaussian Splatting),保留更多环境细节。
02.覆盖四类应用场景,具身智能、影视领域率先推进
张启煊向智东西介绍,WorldGen并非针对某个单一行业开发的模型,其应用场景覆盖具身智能、游戏、影视制作和XR等领域。目前,WorldGen已经在不同方向上推进落地应用。
在具身智能领域,影眸Hyper3D已与地瓜机器人、谋先飞展开合作,推出仿真训练方案:WorldGen负责生成可用于仿真的3D场景,谋先飞则进行仿真适配,地瓜机器人提供算力与开发工具链。
张启煊称:“生成式3D可以快速扩充物体种类和场景布局,但不会完全替代真实数据,机器人训练未来更可能混合使用仿真与真实数据。”
在影视领域,WorldGen能够解决视频模型在多镜头中难以保持空间和物体位置一致的问题。创作者可以先生成空间结构明确的3D场景,在其中调整镜头、移动物体和修改布局,再交给Seedance 2.5等视频模型补充人物表现、材质、光影和画面风格。
在游戏和专业3D制作领域,WorldGen生成的独立网格资产可以进入Blender、Unity、PlayCanvas和Unreal Engine等数字内容创作(DCC)工具及实时引擎,继续进行材质调整、动画绑定、关卡编辑和性能优化。今年7月,影眸Hyper3D还与Unity中国宣布合作,尝试打通从3D生成到实时游戏应用的流程。
在XR领域,WorldGen可以将参考图片还原为可编辑的三维空间,用户能够从不同视角观察场景,并调整物体和空间布局,可用于室内设计、空间展示和沉浸式体验。
张启煊告诉智东西,WorldGen在上述行业的应用目前主要处于内测或技术验证阶段,团队将根据实际客户需求确定后续投入重点。
03.以刚体生成为主,向“构建世界”继续演进
在采访交流环节,针对WorldGen技术边界的提问,张启煊称,系统生成的质量、摩擦系数等物理属性并非对真实物体的精确测量,主要结合资产体积、视觉信息、周围物体关系、传统估计算法以及视觉语言模型,对质量分布、摩擦系数和碰撞体进行推断。
因而,这些结果不能作为精密工程数据使用。现阶段,WorldGen主要支持刚体生成,尚未覆盖关节化资产、柔体和流体等。
关于WorldGen与“世界模型”的关系,吴迪称,世界模型既包括面向决策和行动的行动模型(Action Model),也包括生成可交互、可训练环境的模型,WorldGen更接近后者。影眸Hyper3D不会因此将自身定义为世界模型公司,其核心定位仍是3D生成。
吴迪认为,视频模型擅长最终画面呈现,3D则能够明确保存物体、空间结构和物理关系,两条路线并非相互取代,未来更可能以混合方式结合。
从单个资产走向完整场景,WorldGen让生成结果具备更强的可控性、可编辑性和工作流兼容能力。随着3D生成从“看起来好看”走向“真正可用”,场景级生成也正在成为连接游戏、影视、具身智能和XR等行业的新基础能力。
04.结语:3D生成竞争转向场景可用性
WorldGen的3D生成能力,并不只是局限于生成单个资产或是一个3D空间,它能够构建多个独立资产、理解空间关系与物理属性,形成可继续编辑、交互和运行的完整场景。3D生成的竞争重点正在从单个模型的视觉质量,进一步转向场景的可控性、物理合理性和工作流兼容能力。
现阶段,WorldGen仍以刚体生成为主,部分物理属性也依赖模型推断,在具身智能、游戏、影视和XR等领域仍处于验证与早期落地阶段。其后续价值能否真正释放,还要看生成结果能否稳定进入专业生产流程,但从“生成资产”走向“构建场景”,已经成为3D生成领域可行性较高的方案。
本文来自微信公众号“智东西”(ID:zhidxcom),作者:杨京丽,编辑:李水青,36氪经授权发布。