首页文章详情

世界模型,正在成为AI公司的“下一张船票”

娱乐产业2026-08-18 16:46
试图让AI真正进入世界

过去三年,大模型让人工智能学会了回答问题、生成图片、编写代码。但当AI真正走出屏幕,进入汽车、机器人、工厂与家庭时,仅仅“会说”远远不够。

一个机器人可以准确复述“如何把杯子放进橱柜”,却可能因为无法判断杯子的重量、柜门的位置和机械臂的运动轨迹,最终把杯子摔在地上;一辆汽车可以识别前方车辆,却未必能够推演几秒后行人、非机动车与其他车辆之间的复杂互动。

语言模型学习的是符号之间的关系,世界模型要学习的则是:世界如何运行,行动会带来什么结果。

进入2026年,世界模型迅速成为中国AI产业最拥挤的新赛道之一。据行业不完全统计,国内相关企业已经超过30家。腾讯、阿里、华为、百度等科技公司加快布局,蔚来等车企将世界模型装进量产汽车,极佳视界、流形空间、大晓机器人、星动纪元、拓元智慧、逆矩阵、LiberAI等创业公司密集获得融资。

继大语言模型和视频生成模型之后,中国AI公司开始争夺下一张船票:让机器不仅能够描述世界,还能够理解世界、模拟世界,并在世界中行动。

沿着四条道路进入物理世界

世界模型并不是某一种固定的模型架构,也没有统一的产业定义。

简单来说,它需要在内部建立一套关于外部环境的“数字表征”:理解空间结构、物体关系和基本物理规律,根据当前状态预测未来变化,并评估不同行动可能产生的结果。

如果说大语言模型解决的是“下一个词是什么”,世界模型试图回答的则是:“如果我这样做,接下来会发生什么?”

目前,中国公司的探索大致沿着四条路径展开。

第一条是从视频生成走向可交互世界。

视频模型已经能够生成逼真的光影、人物和运动,但一段看起来真实的视频,并不等于模型真正理解了物理世界。人物可能凭空改变位置,物体可能相互穿透,同一座建筑换一个视角就会变形。世界模型需要在视频生成基础上增加空间一致性、长时记忆和动作响应能力,让画面从“可以观看”升级为“可以进入和操控”。

快手可灵、字节跳动Seedance、生数科技Vidu、Sand.ai等公司积累的视频生成能力,正在成为这一方向的重要技术储备。它们掌握了海量视频数据和时空生成技术,一旦模型能够根据用户动作实时生成后续画面,视频模型便可能演化成一种隐式的世界模拟器。

第二条是从3D生成与空间重建进入。

腾讯在2025年发布并开源混元3D世界模型HunyuanWorld 1.0,可以通过文字或图片生成可漫游、可编辑和可导出的3D空间,随后又推出支持原生3D重建和长距离漫游的Voyager。过去需要建模团队工作数周的游戏场景,正在被压缩到分钟级生成。

群核科技、VAST等公司则拥有家装、建筑设计和3D内容生产积累。相比单纯生成“看起来真实”的视频,这条路线更强调几何结构、空间关系和物体属性。其商业价值也更加直接:游戏公司可以快速制作地图,影视公司可以生成虚拟场景,机器人可以在数字住宅和数字工厂中提前训练。

第三条,也是创业公司最集中的方向,是世界模型与具身智能结合。

机器人的核心瓶颈不是不会听懂指令,而是缺乏足够多、高质量的物理交互数据。语言模型可以从互联网获取万亿级文本,机器人却必须依靠真机采集:机械臂抓取一次物体,只能产生一条轨迹,成本高、速度慢,还存在设备损耗和安全风险。

世界模型相当于为机器人建立一座可以无限复制的“虚拟训练场”。机器人先在模型生成的环境中反复尝试,再把学会的策略迁移到真机,可以显著降低数据采集和试错成本。

极佳视界围绕GigaWorld世界模型、GigaBrain具身基础模型及机器人本体进行全栈布局;流形空间推出WorldScape系列,尝试以世界模型直接支撑机器人的感知、预测和动作;大晓机器人将理解、生成、预测与决策放进统一架构;星动纪元提出世界动作模型;拓元智慧选择Vision-World-Action路线,让模型在连续物理空间中进行预测和规划;LiberAI则试图将人类操作视频、UMI采集数据和物理先验结合起来。

智源研究院发布的RoboBrain、RoboOS等“悟界”系列平台也已开源,并与多家具身智能企业展开合作,为行业提供具身大脑和软硬件协作框架。

第四条是从智能驾驶切入。

汽车可能是目前最接近成熟商业化的世界模型载体。车企拥有大规模真实行驶数据,车辆本身具备传感器、计算平台和执行机构,而且安全、效率和用户体验都能转化为明确的产品价值。

蔚来2024年发布NIO WorldModel,2025年首个版本开始向超过40万辆Banyan平台车型推送,用于主动安全、高速领航、城市领航和泊车等场景。百度Apollo的ADFM、华为的世界动作模型,以及多家车企的端到端驾驶模型,也都在不同程度上加入对未来状态的预测和模拟。

由此形成了中国世界模型产业的基本版图:视频公司从像素进入,3D公司从空间进入,机器人公司从动作进入,汽车公司从道路场景进入。技术路线虽然不同,目标却高度一致——让AI获得对物理世界的连续认知与行动能力。

世界模型将在哪里最先赚钱?

世界模型的终极想象非常宏大,但它的商业化不会一步到位。

短期内,最先产生收入的并不是“通用机器人”,而是那些能够立刻降低内容生产、数据采集和测试成本的工具。

第一类商业化场景是游戏、影视和虚拟空间生产。

传统3D内容生产需要原画、建模、材质、灯光、动画等多环节协作,成本高、周期长。世界模型可以根据文字、图片甚至一段视频生成完整空间,让创作者进入其中漫游、修改和重新布置。

对游戏公司而言,它可以用于概念验证、地图生成、关卡设计和NPC训练;对影视公司而言,可以用于虚拟制片、分镜预演和数字场景搭建;对电商、文旅和房地产企业而言,则可以生成虚拟展厅、数字景区和可交互样板间。

这一阶段的商业模式与当前生成式AI相似,包括模型API调用、云端算力收费、软件订阅和企业定制。腾讯等拥有游戏业务的公司还可以先在内部生产流程中验证模型,再逐步向开发者开放。

第二类场景是自动驾驶仿真与安全测试。

真实道路很难重复制造极端情况:突然横穿的行人、被遮挡的非机动车、暴雨中的故障车辆,都属于低频但高风险事件。依靠实车行驶积累这些数据,不仅周期漫长,也可能付出巨大安全成本。

世界模型可以批量生成不同天气、道路和交通参与者组合下的长尾场景,让驾驶系统在虚拟世界中接受压力测试。相比面向消费者直接收费,这一市场更适合按软件平台、算力使用量、测试里程或项目授权收费。

仿真平台还可能成为智能驾驶行业的基础设施:一端连接车企积累的真实数据,另一端连接模型训练、系统验证与监管认证。中国汽研等机构也已将大规模合成数据、世界模型推演和长尾场景测试纳入自动驾驶仿真体系。

第三类场景是工业机器人、仓储和商业服务。

相比家庭,工厂和仓库的环境更加结构化,任务边界更加明确,也更容易计算投资回报率。机器人完成分拣、上下料、搬运、检测和装配后,企业可以直接衡量节省了多少人工、提高了多少效率。

因此,世界模型公司很可能先以“模型+机器人+场景解决方案”的方式进入工业客户,而不是单独出售一个基础模型。模型公司需要与机器人本体、传感器、工控系统和生产流程深度结合,通过现场数据不断优化。

这也是极佳视界、流形空间、大晓机器人等公司向全栈发展的原因:只有模型而没有本体和客户场景,很难形成数据闭环;只有机器人硬件而没有持续进化的模型,产品又容易陷入低价制造竞争。

第四类场景是家庭机器人,但它可能最晚成熟。

家庭环境看似简单,实际上比工厂更加复杂。每个家庭的户型、家具、物品和生活习惯都不相同,老人、儿童和宠物又带来大量不可预测因素。机器人不仅要理解任务,还要判断人的意图,并在陌生环境中安全完成长时操作。

这意味着家庭机器人需要的不是一个会演示叠衣服的模型,而是一套能够快速认识新住宅、预测行动结果、处理失败并持续学习的系统。商业空间虽然巨大,但在可靠性和成本跨越临界点之前,市场仍将主要停留在高端产品、科研平台和特定功能设备。

建立物理世界的数据飞轮

世界模型正在重演大语言模型早期的热潮:公司数量迅速增加,概念边界不断扩张,融资与估值先于收入增长。

但世界模型不能简单理解为“更高级的视频生成模型”。一段视频看起来越逼真,并不意味着它越懂物理规律。真正能够商业化的世界模型,至少要跨过四道门槛。

第一道是物理一致性。

模型不仅要生成杯子落地的画面,还要理解杯子为什么下落;不仅要复现汽车转弯,还要知道速度、道路曲率和轮胎状态之间的约束。否则,它生成的数据越多,可能给机器人和汽车带来的错误训练越严重。

第二道是长时一致性。

当前模型可以在短时间内维持场景稳定,但一旦任务延长,物体位置、空间结构和因果关系就容易漂移。机器人整理房间、汽车穿越复杂城区,都需要持续数分钟甚至更长时间的稳定记忆与预测。

第三道是实时性与成本。

如果模型推演一步需要几十秒,它可以制作视频,却无法控制高速行驶的汽车和持续运动的机械臂。世界模型最终必须在有限算力和功耗下进行低延迟推理,这会同时考验模型架构、芯片和软硬件协同能力。

第四道是真实世界的闭环验证。

未来衡量世界模型的标准,不应只是生成视频的美感或实验室榜单,而应是机器人任务成功率、自动驾驶接管率、仿真与现实的一致程度,以及部署后的安全性和经济性。大量“全球第一”的评测成绩仍需在更多本体、更多环境和更长时间中验证。

在这一轮竞争中拥有独特优势。国内拥有庞大的制造业、智能汽车和机器人供应链,也拥有工厂、仓库、住宅、道路和商业服务等密集场景。世界模型需要的恰恰不是单纯的互联网文本,而是来自传感器、机器和生产流程的真实物理数据。

但场景并不会自动变成壁垒。只有能够进入客户现场,完成数据采集、模型训练、仿真验证、设备部署和反馈更新的公司,才能把产业资源转化为真正的数据飞轮。

未来,世界模型行业可能出现三类长期玩家:一类掌握通用基础模型和云计算平台,向外输出API与开发工具;一类深耕汽车、机器人、工业等垂直领域,通过行业模型和解决方案变现;还有一类掌握3D资产、物理数据、仿真评测或本体设备,成为产业链中的基础设施提供者。

相反,只拥有模型演示、缺乏真实数据与交付能力的公司,很可能在融资热潮退去后率先出局。

大语言模型让AI学会了谈论世界,世界模型则试图让AI真正进入世界。

它未必会以一个独立App的形式出现在普通人面前,却可能隐藏在每一辆汽车、每一台机器人、每一座数字工厂和每一个虚拟空间背后。世界模型真正的商业价值,也不在于生成一个多么逼真的世界,而在于让机器能够在采取行动之前,先在内部“想象”一次未来。

当这种想象足够准确、足够快速,也足够便宜时,人工智能才算真正迈出了屏幕。

本文来自微信公众号 “娱乐产业”(ID:yulechanye),作者:大模型,36氪经授权发布。