首页文章详情

Science Robotics:机器人会空翻并不稀奇,伯克利、斯坦福团队搞定了“什么时候该空翻”

账号已注销2026-08-28 17:55
不只会学习,更懂技能组合。

人形机器人要真正进入为人类设计的环境,行走只是起点。它们还需要完成奔跑、跳跃、翻滚、转身、躲避障碍等高动态动作,并在任务变化时自然切换技能。更难的是,这些动作既要稳定,又要有类似人类的协调性与节奏感

传统方法通常依赖简化动力学模型、分层规划器或针对单一任务设计的奖励函数,容易产生“持续迈步”“膝盖长期弯曲”“身体冲击较重”等不自然动作;强化学习(RL)虽然已经让人形机器人掌握了平地行走、爬楼梯、奔跑和复杂地形穿越,但每增加一种行为,往往都需要新的奖励设计、参数调节,甚至从头训练。

而且,这些方法通常局限于特定动作或特定目标,缺乏组合多样化技能的通用性,尤其是在处理未见过的任务时。

如今,加州大学伯克利分校、斯坦福大学团队实现了新的突破

他们提出的基于强化学习的运动跟踪框架 BeyondMimic,能够让人形机器人先从人类动作学习再通过引导式扩散模型进行技能组合与任务适配。

基于这一框架,人形机器人可以在统一的训练设置下学习数百种动作,包括空中侧手翻、旋踢、翻踢、冲刺和舞蹈,并将这些技能迁移到真实硬件上。而且,一旦部署后,机器人还能处理训练阶段没有见过的路径导航、摇杆遥操作、障碍物躲避和动作插入任务。

研究团队表示,这项工作实现了从人类动作中可扩展地获取类人运动技能,以及能够超越训练设置进行泛化与适应的运动合成,BeyondMimic 的未来迭代版本有望发展出能够直接从人类示范中学习的模型,并使机器人在不同环境中实现多样化动作

相关研究论文也于近日发表在权威科学期刊 Science Robotics 上。

论文链接:https://www.science.org/doi/10.1126/scirobotics.adx8924

不只会学习,更懂技能组合

BeyondMimic 的目标,是让人形机器人在训练阶段未见过的下游任务中,合成多样化动作,同时保持持续的敏捷性和类人的自然感

如下图,BeyondMimic 框架包括以下两个阶段:第一阶段使用可扩展的强化学习运动跟踪,从多样化的人类动作中训练出一组具备高动态能力的运动技能;第二阶段使用统一的潜在状态-动作扩散模型,将这些技能整合到同一个运动分布中,并通过分类器引导(classifier guidance)在推理阶段根据新目标生成和组合动作。

图|BeyondMimic 概述。A.通过运动跟踪,从人类动作中实现可扩展、鲁棒的学习,获得敏捷的类人行为能力;B.借助引导扩散,利用已学习到的多样化运动技能,对未见过的下游任务实现多功能控制。

第一阶段:用统一配方学习人类动作

第一阶段的任务,是从人类示范中学习一组可迁移的运动技能。研究团队没有为每种动作设计独立的奖励和训练流程,而是让不同参考动作共享同一套运动跟踪公式、奖励设计、观察空间、动作空间和超参数。

以往方法通常面临两种选择。训练单个多技能策略具有较好的可扩展性,但强化学习探索不足时,容易产生不自然的动作。针对每种动作分别训练专门策略,则可以提高自然度,却需要针对动作逐一调参,难以扩展到大规模技能库。BeyondMimic 采用统一的运动跟踪流程和共享超参数,在可扩展性与动作自然度之间取得平衡,能够学习不同类型的人类动作,同时保留人类水平的敏捷性。

这一阶段还结合了精确的执行器建模、较少的域随机化、连续的方向表示、无历史观测和低延迟部署。研究团队认为,仿真到现实的迁移能力并不依赖某个单独组件,而是来自这些设计的整体配合。

训练数据包含约 2.5 小时的人类动作。机器人在高保真仿真中验证了全部动作,并将 21 个代表性动作片段部署到真实机器人上,总时长约 15 分钟。这些动作涵盖了单腿站立、从不同姿势起身等平衡行为,也包括单腿跳、转身踢、带 180° 或 360° 旋转的前跳、空中侧手翻等高动态动作。除此之外,系统还学习了老年人风格行走、舞蹈、网球、羽毛球、地面爬行和从地面起身等具有不同风格和接触模式的技能。

部分参考动作超过 3 分钟,并且与多种其他技能共同训练。即便如此,策略仍然保留了动作的敏捷性和风格细节。

第二阶段:用潜在扩散模型组合技能

在这一阶段中,研究团队训练了一个统一的潜在状态-动作扩散模型,将第一阶段得到的多种运动技能整合起来。

与只生成动作的扩散策略不同,潜在状态-动作扩散模型不仅预测动作,还隐式捕捉动作对未来状态的影响。这使模型能够在推理过程中对未来轨迹进行预判,为任务适配和技能切换提供基础。

模型的关键能力来自 classifier guidance。它是一种基于梯度的引导过程,可以在生成过程中使用任务相关的成本信号,将无条件动作生成引导为面向特定目标的条件生成。

在预测控制过程中,模型首先预测未来一段时间的状态和动作,再通过多轮去噪逐步修正预测结果,使轨迹朝指定目标收敛。目标可以是期望速度、路径点、关键姿态或障碍物距离。

这使规划和控制不再完全分离。传统解耦式方案通常由运动学扩散规划器离线生成参考轨迹,再交给独立的物理跟踪器执行。这样的流程容易重新引入规划器与跟踪器之间的不匹配,而且动作质量受到跟踪器能力的限制。

BeyondMimic 将规划与控制放进同一个潜在状态-动作模型中,允许 classifier guidance 直接在真实硬件上进行测试时调整。模型已经学习到一组可行的人类运动技能,因此新任务只需要提供相对简单的目标成本,就可以触发适合的动作组合。

在这一机制下,机器人能够根据速度指令在行走和奔跑之间切换,也可以从摇杆控制的行走状态平滑进入翻滚、旋踢或翻踢,再回到原来的运动模式。通过输入稀疏的未来关键帧,系统还能补全关键帧之间的中间动作,实现动作补全(motion inpainting)

两个阶段的部署都依赖实时 C++ 框架,即使只使用 CPU 和性能适中的移动 GPU,系统仍然实现了较强的仿真到现实迁移。

敏捷性、自然感全都要

研究团队从三个层面评估了 BeyondMimic:一是机器人能否在真实环境中还原多样、高动态的人类动作;二是通过用户研究,看看走路和跑步的姿态是否够自然;三是测试统一控制器能否依据速度、路径点、关键帧、障碍物这些目标,在推理阶段灵活切换动作、组合任务。

结果表明,BeyondMimic 不仅能把多种运动技能稳定地搬到真实硬件上,面对没见过的任务时,动作依然连贯流畅,也保留了明显的类人特征。

1.多样动作与人类水平的敏捷性

研究团队在室外软土、落叶和不平整地面上测试了机器人。这些接触条件没有出现在训练数据中,但机器人仍然完成了空中侧手翻、连续侧手翻、地面爬行、从地面跳起以及受武术启发的动作。

在空中侧手翻过程中,机器人峰值加速度达到 31 m/s²,骨盆角速度最高达到 15.7 rad/s,平均角速度为 7.01 rad/s。研究团队指出,熟练人类空中动作曾报告过约 7.75 rad/s 的平均角速度。机器人落地时保持了较好的姿态控制,几乎不需要额外恢复动作。

在连续动作方面,机器人能够连续完成五次 C 罗庆祝式跳转,并且没有明显失去稳定性或动作风格。这些结果表明,第一阶段学习到的运动技能不仅能够迁移到真实硬件,也能够在复杂、接触丰富的室外环境中保持较高的动态表现。

2.行走与奔跑的自然程度

为评估动作的自然程度,研究团队组织了 77 名参与者进行用户研究。参与者观看 BeyondMimic 与 Unitree 原生控制器的 20 组行走和奔跑片段,并选择哪一组看起来更像人类、更自然。

研究团队最终获得 1539 次有效选择。整体而言,BeyondMimic 获得了 70.8% 的偏好。分步态来看,行走动作中 BeyondMimic 的偏好率为 57.0%;奔跑动作中,BeyondMimic 的偏好率达到 84.7%。

机器人在行走过程中受到人为轻微扶持时,会保持一定柔顺性,暂停并稳定在原地;外力释放后,再平滑恢复行走。这种响应避免了僵硬或夸张的反应,也体现了控制器在自然运动之外对外部干扰的适应能力。

3.未见任务中的运动切换与技能组合

这项工作还关注 BeyondMimic 能否在推理阶段根据不同目标组织已经学到的技能。研究团队测试了速度命令、路径点导航、关键帧动作插入以及障碍物躲避等任务。

在命令条件运动实验中,系统接收线速度、偏航速度或路径点目标。面对不同初始位置,机器人能够生成平滑轨迹到达目标点。通过摇杆输入时,它可以跟踪全向速度指令,并在受到踢击等较大外部扰动后继续朝目标移动。

在更长距离的测试中,机器人沿赛道连续奔跑超过 50 米。仿真评估显示,行走和奔跑的平均速度跟踪误差分别为 12.14% 和 13.65%。在较低速度指令下,策略可以生成稳定行走,也可以生成轻快慢跑;随着目标速度变化,机器人能够从行走平滑过渡到奔跑,而不需要手动切换策略。

研究团队还使用 motion inpainting 测试动作插入能力。机器人原本处于摇杆控制的行走状态,系统每隔 0.2 秒插入翻滚动作的目标关键帧。扩散策略随后生成连续轨迹,使机器人从行走平滑进入空中侧手翻,完成动作后又回到命令控制的行走状态。同样的方法还支持从行走过渡到躺下,再起身站立,以及从行走切换到旋踢和翻踢等高动态动作。

在任务组合实验中,研究团队将路径点跟踪成本与障碍物躲避成本结合,实现了简单的场景感知导航。机器人面对正前方的障碍物时,在扩散去噪过程中利用障碍物距离信息调整未来轨迹,最终绕开障碍物并到达目标点。当路径点成本被替换为摇杆跟踪成本后,避障机制仍然有效,即使用户输入方向与安全路径并不完全一致,机器人也能够在一定程度上降低碰撞风险。

这些结果证明,BeyondMimic 并非只能按照训练数据中的完整动作进行复现。通过推理阶段的 classifier guidance,统一控制器可以在速度、路径点、关键帧和避障目标之间切换,并将多个已学习技能组合成新的连续行为。

不足与未来方向

当然,BeyondMimic 框架还有很多需要改进的地方。

研究团队表示,BeyondMimic 的扩散模型非常依赖底层状态估计系统的质量。如果本体感知出现误差,错误信息会直接传播到生成轨迹中。潜在扩散模型对噪声具有一定鲁棒性,但进一步结合传感器融合或学习式状态估计,仍然是提升性能的重要方向。

当前系统的预测时域足以支持反应式控制和局部避障,但不足以完成需要提前判断远距离目标或障碍物的长程规划

历史信息有助于稳定未来预测,但也可能让模型在引导过程中陷入重复动作模式。研究团队通过增大引导权重进行缓解,但过大的权重可能在模式切换或高方差状态下使去噪过程不稳定。因此,机器人在动作开始和结束阶段仍更容易出现绊倒。

此外,当前基于引导的优化更适合粗粒度目标,对精细控制的效果相对有限,且仍需要对引导权重进行轻量调节。研究团队认为,未来可以探索监督微调和适配器式控制层,从而支持更细粒度、可组合的轨迹控制,减少人工调参需求。

BeyondMimic 的价值不只在于让机器人完成某个翻滚或某段奔跑,而在于把高质量动作学习、技能切换、任务规划和实时控制放进同一个框架。

当新增的人类动作可以持续扩展技能库,而新的任务只需提供目标成本、不必为每项任务重新训练时,人形机器人就有可能从“按预设动作执行”走向“根据环境组织行为”

这也是 BeyondMimic 所指向的长期方向:让机器人直接从人类示范中学习,并在不同动作、环境和目标之间保持适应能力。

本文来自微信公众号 “学术头条”(ID:SciTouTiao),作者:学术头条,36氪经授权发布。