王兴兴自曝“宇树升值记”
上市后的第二天,王兴兴公开复盘了宇树“成长”的心路历程。
8月20日,王兴兴亮相“2026世界机器人大会”现场,发表《从展品到产品:人形机器人产业的下一个十年》演讲,从技术、产品到落地场景,系统性回顾了宇树在过去近十年的“跃迁”。
宇树的故事起点在2016年。王兴兴回忆,公司最早做的是四足机器人,最近几年才把重心转向人形机器人;2024年推出的G1,已经成为全球人形机器人领域一款标杆性产品——市面上绝大多数人形机器人,要么与它同源,要么外形极为相似。
但比起“做出来”,他更在意“用起来”。王兴兴透露,过去几年,宇树一直在推动机器人“真正的去走进生活,去工厂干活”。在这个过程中,王兴兴多次强调“真正的”。换句话说,宇树也认为,舞台表演不是人形机器人最核心的落地场景。
从预先录制、编排动作,走向多模态端到端、由语音实时生成动作,这是宇树近10年的技术跃迁路线。王兴兴坦言,过去那些看着流畅的演示,动作都是提前训练好的;而如今展示的能力,已经是基于实时语音生成。
“我们希望未来真正的机器人应用落地的时候,它的动作都是完全实时生成的,而不是提前做编程的。”
整个具身行业的共识在于:支撑机器人实时动作推理和执行这套能力的是数据。
在王兴兴的判断里,“目前的机器人都是AI驱动的,AI基本都数据驱动的,有多少数据,尤其有多少高质量的数据,就有多少AI。”
具体到数据类型上,预训练主要依赖海量的真人数据与互联网数据,再叠加机器人在物理世界的实测数据,而前者量大,后者刚需。“我们需要把机器人真正的跟物理世界进行匹配”。
王兴兴透露,公司在AI模型上的资金和人力投入“目前应该是最大的”。其中世界模型是一条迂回的路线:2020年初就开始做基于视频生成的世界模型,到年底因效果不理想一度搁置,直到2025年又重新大力投入。这种“先试、搁置、再发力”的节奏,折射出一家具身公司,在技术路线上的从0到1的反复摸索。
除了数据,从舞台走到工厂,是本体背后模型的泛化能力。客观情况是,今天的机器人能完成简单装配,效率却仍低于人类,且每来一个新任务就要重新训练。
“在一个固定场景上做足够的采集训练,成功率可以接近100%,但如果操作的物品或环境稍微换一下,成功率下降非常严重”。王兴兴说。
王兴兴认为,AI模型的输入输出与真实物理世界对齐不足导致了泛化能力的欠佳,“语言模型是纯数字编码,基本没有损失。而机器人的每一次输入输出都有偏差和损失。”
关于这个问题的解法,王兴兴的设想是“物理AI机器人自进化”——用最前沿的大模型驱动一个智能体:它自己上网搜最新论文与开源方案、编写控制代码,先在仿真环境验证,再部署到实物机器人;由AI自动打分叠加人的经验打分,形成正向循环。
对于外界很关心的“通用的机器人何时真正走进家庭?”的问题,王兴兴自己划定的临界点指标是一台机器人带到任意一个陌生环境,它能通过语音指令完成80%左右的任务,“这就是未来真正产业的临界爆发点”。
他预判,快则两到三年,慢则五到十年。而在AI大爆发的当下,整个机器人的进化速度已经被大幅拉高,“可能比我预估的还会更快一点点”,是一个“全新的起点”。
以下为王兴兴演讲实录全文(在不改变原意的情况下有删减调整)
大家好。首先回顾一下我们公司的情况:宇树是2016年成立的,到今年8月,差不多整十年。公司最早做四足机器人,最近几年做人形机器人。
我们近几年比较成功的一款,是2024年推出的G1。这款机器人推出以后,基本成了全球一款标杆性的产品;大家现在看到的我们绝大部分机器人产品,或者全球在用的很多机器人产品,基本上都跟它同源,或者外形非常相似。
今年年初比较有代表性的是我们的武Bot——我们把几十个中国经典功夫动作提前采集、做AI训练,再搬上舞台。这个节目最大的亮点是结合了全世界最顶尖的人形机器人技术与中国传统的功夫、舞狮文化,视频在海外传播非常好,有几百亿次的播放量,大家都非常喜欢。我觉得这是一个非常好的科技和文化交融的例子。
另外,我们在天坛也做过一场简单的演示,现场大概49台机器人全自动表演,非常震撼。天坛有几百年的文化历史,机器人在现场有一种穿越时空的感觉——过去几百年的文化和当前最新的技术交融在一起。
过去几年,我们一直在推动机器人真正走进生活、去工厂干活。2024年我们就跟汽车工厂合作,做落地应用;我们也在自己的工厂部署机器人做简单测试和落地。公司绝大部分AI团队,都在做机器人真正在家庭或工厂里干活。
为什么我们现在没有大规模推广?最主要的原因是目前的效率和泛化能力还不够。
虽然机器人能做一些简单装配了,但效率跟人比还是更低;而且每次有新任务过来,都要重新训练,效率相对更低。所以我们希望把技术做到泛化能力更好,再进行大规模推广——这是目前全球共同的最大瓶颈。
今年4月,我们刷新了一个记录,人形机器人奔跑最快超过10米每秒。这款机器人是我们2023年第一代人形机器人H1改制的,H1也是我们公司第一款人形机器人,非常经典;后面也可以装轮子,更灵活一些。
大家知道,目前的机器人都是AI驱动的,AI基本都数据驱动——有多少数据,尤其有多少高质量的数据,就有多少AI。我们自己在采集,也和第三方合作采集更多数据。真正的AI机器人训练数据,主要还是海量真人数据或互联网数据作为预训练数据,再加上部分真机数据,这是非常刚需的两部分。从量上来说,真人数据更多、更重要;但真机实际数据也非常关键,因为我们需要把机器人和真实物理世界做匹配。
今年5月,我们发布了全球第一款量产级的载人变形机甲GD01,身高三米多,载人后重量大概500千克。它有点像一个越野车,不是给你在家庭或城市里用的,而是户外徒步、复杂环境下的运输;最有意思的是它可以变形成四条腿模式,稳定性更好、越障能力非常强。
前几个月,我们演示了基于多模态端到端的自动AI动作生成。大家看到很多常规动作演示,都是提前训练好的;而这部分动作是基于实时语音生成的——正因为如此,中间会有几秒延迟:每句话说完,要语音识别、上传云端做AI动作生成、验证没问题再下发给机器人。但我们希望未来真正落地时,动作都是完全实时生成,而不是提前编程的。
我们也推动机器人真正在会议室里干活。我们公司的会议室经常乱糟糟的,整理会议室是非常刚需的事。我们主要采集训练的就是:把会议室任意打乱以后,恢复到干净整洁的状态。完全是端到端实现,大概布置了七八个不同任务,用一个模型自动切换、都能直接执行,而且可以抗干扰。这个功能我们最近一直在开发,因为像会议室整理这种既有实用价值、难度又不是特别大的场景,非常有意义。
在语音自动生成的基础上,我们又做了带干活能力的版本——语音驱动下,动作是可以干活的。比如搭载多模态模型后,让它“把第三层的蓝色药盒拿上来”,它能识别、执行,而且可以抗干扰,不是固定动作。
前段时间,我们发布了最新一代轮足机器人Go2-W,比较轻量化,自重只有20千克左右,但负载能力和续航非常强劲,基本防雨水,室内室外都能用。我们把一些人形机器人的技术重新放到四足机器人上,让四足机器人灵活性进一步提升,负载能力也非常强劲,非常希望落地到户外徒步等场景。
我们还升级了去年那款中小尺寸人形机器人R1,以及消费端的A2等产品,性价比非常高,在京东、淘宝就有预售或零售。前段时间我们预览了一款新机器人,开发时间很短,只花了三个多月;目前只是预览、不是正式发布,但它的速度最快已经到了12.65米每秒,超越了目前人类历史上的最快奔跑速度,跳高高度也基本超越了人类历史最高跳跃高度。
2025年,我本人、我们公司的产品都登上了《时代》杂志的榜单。
回顾最近几年具身智能AI模型的发展,主要流派目前是VLA模型和世界模型,今年大家听到最多的还是世界模型。我们对AI模型这块的投入一直非常大,应该是公司目前资金和人力投入最大的方向。2020年初我们就开始做基于视频生成的世界模型,但2020年底效果不理想,中间稍微搁置了一段时间;去年我们又大力发展了基于视频生成的世界模型这个方向。
很多人好奇,通用的机器人什么时候真正走进生活、走进家庭?最大的问题还是全世界目前的瓶颈——具身智能的泛化能力还不够。很多AI模型,在固定场景上做足够采集训练,成功率可以接近100%;但如果操作的物品或环境稍微换一下,成功率下降非常严重。
所以我希望,未来快则两到三年、慢则五年或十年,真正哪天大家能看到:把一台机器人带到一个任意陌生环境、带到你的家庭,它基本能实现80%左右的任务,就差不多实现了具身智能的临界点时刻,这就是未来真正产业的临界爆发点。评价指标非常简单:带一个机器人到80%左右的陌生场景,它通过语音和语言指令实现80%的任务,这是一个非常重要的临界点。
为什么达到这个点最难?因为目前AI模型的输入和输出,跟真实机器人对齐程度不够。你让它移动、把东西装配在一起、把物体搬到某个位置,大趋势没问题,大差不差能执行;但最后几厘米、最后几毫米的成功率或偏差,没办法很好跟真实世界匹配。我去拿东西时,眼看快拿住了,最后一点触觉、最后一点误差,没办法很好修正,成功率就暴跌得非常严重。这是目前全世界具身智能最大的瓶颈——AI模型的输入输出跟真实世界有偏差。
为什么机器人有这个问题,而语言模型或多模态模型没有?因为语言模型完全是数字编码,输入输出严格限制在向量空间里,基本没有大的偏差,而且没有损失——输入输出再倒回来,没有任何损失。而对机器人来说,每输入输出一次都有偏差和损失,所以泛化能力和成功率会差一些。但我觉得未来几年,这是必然可以解决的问题,只是需要一点时间。
我介绍一下我们最近在推动、昨天刚提出的一件事。过去几年,大家已经用AI做很多编程和开发,但AI在机器人领域的真正使用,其实还相对比较欠缺。
我们推动的是:直接让物理AI机器人模型自进化。用目前最前沿的顶尖大模型来驱动,我们自己定一些规则、经验、约束和工具,让它自己去网上搜索最新论文、最好的研究成果和各种开源方案,然后它自己去编程,生成自己的机器人控制代码;代码生成后,可以在仿真环境里运行,或者调用大模型状态去控制一个实物机器人。
如果部署到实物机器人上做测试,再进行评价和打分——这部分一部分是AI模型自己实现的,一部分也可以人参与打分,因为人的经验非常重要,人很容易判断好坏。这套逻辑一旦成体系运行起来,整个机器人的开发效率会高很多,迭代速度也会非常快;运行一段时间,真正可以实现机器人自我进化能力的提升。
(PPT)左下角就是一个coding智能体,它自己编写机器人控制代码。目前很多简单的深度强化学习算法,让coding程序自动编程的效果已经不错了。把编程效果放到仿真环境验证,训练好再放到实物机器人测试;测试好以后,做AI模型和人肉打分评价,确定效果,再反馈给编程智能体,形成正向循环。这是最简单的一个示例,真正使用会更复杂。
我觉得这是当下以及未来几年,全球非常值得做的一件事。原因很简单:第一,随着每个月、每年基础模型能力提升,这个自进化循环本身能力会进一步提升,能跟随全球AI技术进步;第二,可以更高效地使用多元数据——人肉用数据效率很低,自循环可以把各种训练数据、真实世界数据、人的数据都用起来;第三,可以有更多真机部署,部署越多,测试数据和评价指标越多,数据利用率和增长率有保障,能达到数据规模化,而且可以每天或每月累加一些技能,而不是今天开发一个技能、明天又把它浪费掉。
我觉得这是非常重要的一件事——让真正使用AI,把机器人开发效率、进化效率大幅提升。这也是可以开启物理AI机器人自进化的一个新的机缘,未来这个方向会是很多人都会推动的一件事。
我们公司最早大概2017、2018年第一次参加世界机器人大会,感受非常深刻。我觉得未来十年,在当下新的起点,尤其在AI大爆发、全球关注度非常高的时间,整个机器人进化速度已经大幅提升,可能比我预估的还会更快一点点,是一个全新的起点、全新的开始。
由于时间关系,汇报比较简单,谢谢大家,还请大家多多包涵。
本文来自微信公众号“腾讯科技”,作者:苏扬,编辑:徐青阳,36氪经授权发布。