PrimalVerse(元昊动力)完成数亿元种子轮融资,清华顶尖团队打造 4D 世界模型基模
近日,4D 世界模型公司 PrimalVerse 宣布完成数亿元种子轮融资,由联想之星、银杏谷资本、啟赋资本、卓源亚洲等知名财务投资机构联合参与,手术机器人领域头部产业方精锋医疗战略投资。本轮融资将主要用于 4D 世界模型基模研发及团队扩充,并持续推进其在具身智能、游戏影视、自动驾驶、医疗手术等垂直场景中的应用验证。
PrimalVerse 由一支清华背景的顶尖世界模型团队创立。团队长期深耕 3D/4D 重建、神经渲染、物理仿真与机器人,是全球少数能够贯通 4D 世界模型完整技术链条的团队。作为合作伙伴,光源资本将持续助力PrimalVerse 推进4D 世界模型的技术研发与多场景应用验证。
定义第五代基模:从生成内容,走向推演世界
大语言模型让 AI 学会了预测下一个词,视频模型让 AI 开始预测下一帧画面。但随着 AI 深入机器人、自动驾驶等真实物理世界的场景,模型需要进一步回答:
一次行动之后,世界将发生什么?
回看基础模型的发展,第一代以 GPT 等语言大模型为代表,主要解决语言理解、推理与对话(文本 Token);第二代融合了图像 Token 和文本 Token,以 Nano Banana、GPT Image2.0 为代表,实现图文理解与图像生成;第三代以 Sora、Seedance 等为代表,引入了视频 Token,开始处理时间动态与动作连续性。前三代模型主要建模语言与二维视觉内容,尚未真正进入三维物理世界。而第四代带有 3D token 的原生多模态大模型将开始表示几何结构和物理属性;下一阶段,基础模型需要进一步把空间、时间、物理规律与动作交互纳入统一表征。
基于这一判断,PrimalVerse 团队提出:第五代多模态大模型,将是以原生 4D World Token 为核心的世界模型基模(4D=3D 空间+时间)。
4D World Token 可以理解为模型理解物理世界的“新语言”:它不只记录某一帧画面,还需要持续表示场景中的物体是什么、位于哪里、如何运动、具备何种物理属性,以及在动作作用下将如何变化。
当语言、图像、视频、3D/4D 世界状态能够在同一模型中联合训练,AI 学习的将不再只是世界的视觉表象,而是世界本身的结构、规律与动作后果。模型也将从“生成一段视频”,进一步走向“运行和推演一个世界”。
PrimalVerse 创始人表示:
“4D 不是世界模型的一项附加能力,而是物理世界本身的基本表达。世界模型的第一性问题,是能否准确刻画世界从一个状态走向下一个状态,而这需要同时理解空间、时间、物理属性与交互关系。我们相信,判断模型是否真正理解物理世界,最终应当与 4D 表征对齐;只有先构建出原生 4D 世界模型,才能为不同技术路径提供统一、可信的物理世界基准。”
PrimalVerse 希望直接从底层构建原生 4D 世界状态,在统一模型中同时学习空间、时间、物理与交互,并将几何、材质、运动、接触和物理属性纳入状态变化过程,定义真正面向物理 AI 的 4D 世界模型范式。
全球稀缺的 4D 世界模型全栈团队
构建原生 4D 世界模型基模,需要贯通重建、仿真、渲染与机器人四大能力栈,任何一项能力的缺失,都会限制世界的完整构建、持续演化与真实交互。全球范围内,能够覆盖并打通完整技术链条的团队极为稀缺。
PrimalVerse 核心团队来自清华、北大、上海交大、港科等顶尖高校,长期深耕 4D 世界模型关键技术,已经在 4D 世界模型的各个核心环节形成国际领先成果:
在实时神经渲染方向,SlimmeRF 获得 3DV 2024 Best Paper;在可控仿真方向,MARS 获得 CICAI 2023 Best Paper Runner-up,这也是全球首个开源高拟真自动驾驶仿真器,开创模块化神经渲染自动驾驶仿真范式;在机器人领域,Dexora(ICRA 2026 Best Paper Finalist)是全球首个开源高自由度双灵巧手 VLA 模型;Automated Synthesis of Facial Mechanisms for Conversational Animatronic Robots( RSS 2026 Best Paper Finalist)
实现从单张人像自动生成可制造、无碰撞的机器人面部机械结构,将专业设计时间从 22.8 小时缩短至 11.7 分钟;在重建与表征方向,TRELLIS.2 获得 CVPR 2026 Best Student Paper,是全球首个单图生成 8K 3D 模型,首次实现几何与材质的原生 3D 生成,突破了行业普遍依赖 2D Diffusion 生成材质的路径。
这些成果共同构成了一条清晰的路径:
理解世界、构建世界、推演世界,最终驱动智能体在世界中行动。
PrimalVerse 团队已产出几十篇 CVPR、ICCV、SIGGRAPH、3DV、RSS、ICRA、ECCV 等顶级会议成果,并在重建、仿真、渲染、机器人四大底层技术栈拥有 Best Paper 级成果。 PrimalVerse 的成立,是团队将多年分布在不同前沿方向的积累,第一次汇聚为一个统一目标——打造第五代多模态 4D 世界模型基模。
从垂直世界模型切入,验证通用基模能力
第五代 4D 世界模型的价值,将首先在对动态空间、物理真实性和动作交互要求最高的场景中释放。
在具身智能领域,PrimalVerse 已与多家细分领域头部企业开展合作,围绕仿真数据生成、动作后果预测、策略训练与 Sim2Real 推进联合验证。其中,PrimalVerse 与极智嘉联合研发了面向真实仓储作业场景的世界模型 Gravity 4D,并已在多 SKU 抓取、料箱搬运及移动机器人协同等端到端作业中完成验证。团队在 Dexora、TA-VLA 等成果中积累的动力学预测、力反馈建模与高自由度操作能力,也不断转化为面向真实机器人任务的世界模型解决方案。
在医疗手术领域,战略投资方精锋医疗与 PrimalVerse 正围绕医疗场景专用世界模型、具身智能手术机器人及智能仿真训练平台等方向开展深度联合研发,将世界模型能力与手术机器人本体、临床场景、远程手术系统及医生培训体系深度融合,推动手术机器人由精准执行工具升级为具备场景理解、风险预判与协同操作能力的智能外科基础设施。
在游戏影视领域,PrimalVerse 与头部影视公司达成深度战略合作,同步推进虚拟影棚及导演项目的合作意向。基于 Light-X 等成果,公司将工业级 3D 资产生成、可控运镜与可控打光能力导入实际制作流程,服务动态内容生产、虚拟拍摄与可编辑场景构建。
在自动驾驶领域,PrimalVerse 具备从高拟真仿真、世界状态预测到城市级三维重建的完整能力栈:MARS 支持复杂道路场景的可控仿真(首个开源高拟真可控自驾仿真器,奠定自驾神经渲染仿真基石,被多个大厂采用),OmniNWM 实现多模态、长时序世界预测与策略评估;团队与长城汽车联合研发的 TideGS,则突破大规模 3DGS 训练的显存瓶颈,单张 24GB GPU 上支持超过 10 亿个 Gaussian Primitives,较行业单卡训练规模提升约一个数量级(对比 World Labs Spark 2.0 ,约 1 亿),为城市级原生 3D 世界构建提供底层支撑。
具身智能、医疗手术、游戏影视与自动驾驶并非四条完全独立的业务线,而是一套 4D 世界模型能力在不同场景中的验证:自动驾驶提供复杂动态世界,具身智能提供动作与物理反馈,游戏影视验证高质量世界生成与实时渲染,医疗手术则检验模型在高安全要求、复杂形变与精细交互场景中的理解和推演能力。多场景成果与产业合作,也将持续沉淀数据、模型和系统能力,反哺通用 4D 基模。
未来,PrimalVerse 将从垂直场景中的训练、仿真和内容生产需求切入,逐步构建跨场景、跨行业迁移的通用 4D 世界模型,成为物理 AI 理解、训练和推演世界的基础模型入口。