首页文章详情

具身智能:从“未来产业”到“新增长点”,如何跨越万亿赛道的“死亡谷”

思策智库2026-08-27 10:24
2026年具身智能处临界点,待破数据瓶颈迎增长

2026年8月26日,国新办“开局起步‘十五五’”系列主题新闻发布会上,工业和信息化部明确提出,将“推动量子科技、生物制造、氢能和核聚变能、脑机接口、具身智能、第六代移动通信(6G)等未来产业成为新的经济增长点”。

在六大新兴支柱产业与六大未来产业的名单中,具身智能占据了一个独特的位置——它既被列为“未来产业”,又是最接近“新增长点”门槛的那一个。

这不是政策的偶然倾斜,而是产业现实的必然反映。2026年,全球人形机器人出货量预计达6.25万台,同比增长约247%,中国厂商出货占全球八成以上;广义具身智能市场规模2026年预计突破1万亿元;上半年国内赛道融资总额达935亿元,同比增长5倍。

数字不会说谎——具身智能正站在从“技术验证”迈向“规模化商用”的历史性临界点上。然而,从“未来”到“增长”,并非是一条坦途。

万亿赛道的三场战争

如果说2025年的具身智能还在比“谁能站起来走路”,那么2026年的竞争已经全面升级为三场并行的战争。

第一场:“大脑”之战。行业共识正在形成:具身智能的竞争正从“拼硬件”转向“拼模型、拼数据”。VLA(视觉-语言-动作模型)与世界模型成为两条主线技术路线,而越来越多的企业意识到,二者并非二选一的关系,而是存在明显的互补空间。

比如,擎朗智能发布的全球首个融合潜空间世界模型的服务行业VLA架构KOM 3.0,让机器人在执行动作前先在内部推演一遍物理结果;魔法原子展示的Magic-VLA K02通用具身大模型,则拆解出“场景出题—模型解题—数据反哺”的技术闭环。

但“大脑”仍是稀缺资产。行业数据显示,仿真榜单头部模型平均成功率仅8.80%,真机榜单仅12.8%。这意味着,即便在实验室里,绝大多数任务仍然无法被通用模型可靠完成。清华大学于超教授团队在7月发布的Harness VLA,试图通过引入Harness Layer解决VLA在接触密集操控中的失败后重置问题——这恰恰说明,当前的VLA模型距离“可靠”还有相当距离。

第二场:“肢体”之变。“大脑”在追赶,但“肢体”已经在奔跑。2026年以来,减速器、伺服系统、控制器三大核心零部件的国产化率已攀升至75%至90%。绿的谐波的谐波减速器、埃斯顿自研的控制器与伺服系统,均已批量配套国内外大型企业。宇树科技的核心零部件自研自产率已超过90%。中国制造正从“规模红利”迈向“技术红利”。

但“肢体”并非没有隐忧。整机与零部件供需错配、技术成果转化不畅、产融对接存在壁垒等现实难题依然突出。关节模组的平均故障间隔时间与传统工业设备相比仍有差距,温升控制仍是工程难题。一台国产人形机器人整机成本虽已降至10万元级别,但拆开审视其核心零部件——减速机、无框力矩电机、力传感器——会发现一个现实:躯干已就位,“大脑”还在等。

第三场:“场景”之争。如果说前两场战争决定“能不能做”,那么第三场战争决定“有没有人要”。2026年世界机器人大会上,一个清晰的信号浮出水面:行业正从“展示能力”转向“验证价值”。相比去年各家展示的叠衣服、做咖啡等Demo,今年大部分企业拿出的是真实订单或POC成果。

星动纪元宣布在物流行业率先跑通PMF(产品市场匹配),已与顺丰、中国邮政在5省市10多个物流中心实现常态运营;魔法原子的轮式人形机器人已在追觅智能制造工厂承担物料搬运、上下料等真实生产任务;京东未来5年计划采购300万台机器人。工信部与国资委联合开展的实景实训专项行动,目标到2026年底凝练百个以上高价值应用场景,带动形成万台级规模落地能力。

行业正从“研发态”快速切换到“部署态”。

卡在哪?

以上提到的三场战争打得虽热闹,整个行业却面临一个共同的“卡脖子”问题:数据。

这不是普通的“缺数据”。数字AI有互联网上近乎无限的文字、图像、视频数据可供训练,但具身智能需要的是真实物理世界的交互数据——机器人抓取一个杯子、拧一颗螺丝、叠一件衣服,每一个动作背后都涉及视觉理解、空间定位、接触判断与运动控制的复杂耦合。这些数据具有“不可替代性”,与互联网语言、视觉数据存在本质差异。

缺口有多大?数据显示,当前国内真实物理交互场景合规数据仅50万小时,而机器人商业化落地需要数千万小时数据,缺口超过99%。这是一个从“十万”到“千万”量级的差距。

数据采集的成本同样惊人。一条30秒的真机操作数据,采集成本10到15元;采集1小时要花1000元左右,凑够20万小时需要两亿元以上。若完成百万小时真机数据预训练,投入成本将达到10亿元量级。宇树科技创始人王兴兴直言,目前泛化能力不足是具身智能最大的瓶颈——“同类问题多次解决”,但换个场景就要重新训练。他把这称为“全世界具身智能最大的瓶颈”——不是某一家企业的技术短板,而是缺乏统一数据底座导致的全行业共性困境。

数据标准不统一,也导致大量原始数据无法直接用于训练,整个行业面临严重的“数据荒”。全国已建成超七十家具身智能训练场,但面临场景任务同质化、数据实际产能有限、数据多样性和流通性不足等共性挑战。“可采集数据规模”并不等同于“可训练数据规模”。

破局之道——三个关键信号

数据困境并非无解。2026年,三个关键信号正在改变游戏的规则。

一是实景实训专项行动。2026年6月,工信部与国务院国资委联合启动“人形机器人与具身智能实景实训专项行动”。行动聚焦工业、服务、特种等领域重点场景,部署打造实景实训空间、组建创新应用联合体、攻关实用化作业技能等6项重点任务。其核心逻辑是:让机器人在真实场景中“干起来”,在干的过程中积累数据、迭代模型、验证产品。

这一行动的意义不止于政策背书。通过集约化建设、标准化管理、资源共享的实训空间,可有效避免场景重复建设和资源浪费,推动场景、数据、算力与技术成果高效复用,大幅降低企业试错成本。从“能用”到“好用”,实景实训是关键的跨越手段。

信号二:数据共建共享机制探索。行业正在觉醒。京东宣布将在两年内采集超过1000万小时人类真实场景数据,同时采集超过100万小时机器人本体数据;仙工智能成立具身智能数据子公司,依托超50万小时真机数据打造真实世界数据基础设施。开放原子开源基金会理事长谢少锋呼吁“建立统一的数据底座”,解决数据格式异构性导致的数据孤岛问题。

原力灵机联合创始人范浩强提出的路径颇具代表性:核心突破口是“真机数据闭环+具身原生架构+仿真与合成数据联动”——以高质真机数据建立物理直觉,利用物理引擎生成海量极端场景补充长尾数据,在真实场景中先“跑起来”,持续吸纳反馈自我迭代。

信号三:“十五五”政策闭环初步形成。从6月的实景实训专项行动,到8月国新办新闻发布会上的明确表态,政策信号已经相当清晰:具身智能不再只是“前瞻布局”,而是“新增长点”。工信部副部长辛国斌在发布会上同时强调,将“攻关类脑智能、世界模型等前沿技术,推进人形机器人、脑机接口等智能终端迭代”。从技术攻关到场景落地,从数据采集到规模部署,政策的闭环正在形成。

如果要做个总结,那就是——具身智能的“十五五”故事,本质上是一个产业如何跨越“死亡谷”的故事。

所谓“死亡谷”,指的是新技术从实验室走向市场的那段最危险的旅程——技术尚未成熟、成本尚未下降、市场尚未接受,无数创新企业在这一阶段折戟沉沙。具身智能正处在这个关口:技术路线尚未收敛(VLA还是世界模型?),成本尚未降到经济性拐点(测算显示整机价格需降至40万元以内、作业效率达75%以上时才具备整体经济性),商业模式尚未跑通(硬件销售还是软件订阅?)。

但2026年的一切迹象表明,具身智能正在加速穿越这段死亡谷。出货量在放量,成本在下降,场景在打开,政策在加码。中商产业研究院预计,2030年中国人形机器人出货量有望达38万台、市场规模突破200亿元。广义具身智能市场已迈入万亿级赛道。

具身智能的突破,不只是多了一个新兴产业。它是唯一一个横跨“大脑”(AI模型)、“小脑”(运动控制)和“肢体”(精密零部件)三大技术体系的产业,它的突破将直接带动集成电路、智能机器人等多个支柱产业的协同升级。正如中国电子学会理事长徐晓兰所指出的,具身智能具有1:10的乘数效应。

当一台机器人从展台走进工厂、仓库、家庭,它改变的不仅是一个行业的估值逻辑,更是“中国制造”向“中国智造”跃迁的底层路径。从“未来产业”到“新增长点”,具身智能正在用行动回答那个最根本的问题:中国的下一代制造业,将由什么来定义?

本文来自“思策智库”,36氪经授权发布。