首页文章详情

硅谷今日最热具身模型,不用后训练,看一遍就学会

量子位2026-08-26 16:19
具身智能迎来GPT-3时刻?

具身智能的大结果,要来了!!!

自上周Generalist发布能够学习3到12秒动作的具身大脑Gen 1.5 以来~

刚刚,北美具身初创Skild AI又发布了全新机器人基础模型S1,直接把机器人上下文学习的任务长度拉到了10分钟往上

这次的S1主打上下文学习(in-context learning,ICL):

无需在后训练阶段专门学习新的操作数据,只需看一段人类示范视频,就能“照猫画虎”,直接完成一整套从未见过的复杂操作流程。

在官方演示里,机器人完成了煎饼、冲泡咖啡、给植物换盆,以及设备组装等长程任务。并且在未见过的任务上,把成功率干到了66%,远超基于语言提示的VLA(只有 9%)。

另外,哪怕是走传统后训练微调的路线,想追平S1只看一次演示的效果,大概也要喂进去380次左右的任务演示。

非常amazing!

可以说,最近这一波集中在上下文学习的工作,又给不少人重新燃起了对具身的希望。

有推特网友表示,通用机器人可能两年后就会出现,而不是七年。

还有网友表示,从Rhoda,到上周Generalist,再到现在Skild S1的10分钟任务,机器人真正的GPT时刻似乎正在出现。

因为一旦这种能力真的泛化,以后开发机器人技能,可能真的会变得像给ChatGPT 写 Prompt一样。

真有这么神吗?我们一起来看。

从BERT时代,迈向GPT时代

想要理解S1这次到底怎么个上下文学习,咱们得先看看,传统机器人是怎么学习一个新技能的。

在传统的pipeline里,机器人学习其实和大模型差不多:

先在海量数据上进行预训练,学会一些基础能力;然后到了具体场景,再针对某个任务收集数据,通过后训练,让机器人学会专有技能。

只不过问题在于,机器人和大模型虽然流程差不多,但数据成本却完全不是一回事。

大模型的预训练数据,大量来自互联网;哪怕到了编程、Agent这些专门场景,很多后训练数据也可以在线上快速获得,甚至自动生成。

但机器人就比较惨了。预训练数据得在现实世界里采,后训练数据还是得在现实世界里采。

所以,在技术博客中,Skild AI就直接开麦了:

如果一个机器人基础模型,每学一个新任务仍然需要几十、几百小时真机数据,再重新后训练,那我请问,这个“基础模型”,基础在哪儿?

他们甚至引用已有研究指出,如果针对一个新任务的数据已经足够多,那么从零训练的模型甚至都可能追平经过预训练再微调的基础模型。

所以,具身预训练的意义到底是啥?

对此,Skild给出的答案是:上下文学习

为了有一个参考坐标,Skild拉来了大模型的发展路线作为对照。

早期的BERT已经很强了,但每碰到一个新任务,往往还是得重新准备数据,再微调一遍。

真正改变游戏规则的,是后来GPT-3之后逐渐显现出来的上下文学习能力:

不用改模型权重,只要在Prompt里给几个例子,模型就能临时“学会”一个新任务。

基于此,Skild认为,机器人现在其实还困在类似的BERT时代,他们真正想要的是,是让机器人也完成同样一次范式转换。

也就是说,预训练真正的价值,不应该只是让后训练少采一点数据,而是让机器人最终获得“从上下文里直接学习”的能力。

上下文学习

那么,S1这次到底从上下文里学到了什么?

Skild认为,真正能检验机器人上下文学习能力的,其实就两个维度:

一个是,能不能学会训练时根本没见过的新技能;另一个是,能不能把已有技能重新组合起来,完成一个很长、很复杂的新任务。

比如,机器人只需观看一段翻煎饼的视频,就能学会如何制作煎饼——

即便这项技能此前从未出现在它的训练数据中。

与此同时,相较于上周Gen-1.5展示的秒级视频,S1这次直接把上下文学习拉到了最长10分钟

在植物换盆等任务中,每个任务都需要连续完成几十个操作步骤。在这些长程任务的演示中,机器人不仅需要做到照猫画虎,还需要知道:

我现在做到哪一步了,下一步该干嘛,技能之间怎么组合,中间搞砸了又该怎么继续。

也就是说,机器人需要真正理解视频演示里任务-动作的意图,见招拆招、随机应变,而不仅仅是行为克隆那么简单。

此外,在植物换盆任务中,从开始录演示,到机器人自己上手,只花了11分钟,直接在效率这一块,给传统后训练秒了。

最后,在整个过程中,S1没有用fine-tuning,也没上post-training,模型权重完全不变,用同一套权重,就完成了博客里展示的所有任务。

基本对齐了大模型从Bert需要特定场景微调,到GPT-3只看演示就能完成OOD任务的跨越。

唯一的不同就是,用的prompt不再是语言,而是用了能够更好对齐下游任务的动作视频。

实验:ICL到底是不是更能scale?

在实验部分,Skild先在(训练数据)见过的任务和未见过的任务上,对比了ICL视频Prompt和传统的语言Prompt VLA。

测试结果表明,当训练数据只有1000小时时,语言Prompt效果更好,而随着数据规模增加,ICL开始反超。

到了10万小时,训练时见过的任务上:ICL 96%,语言Prompt 89%。

而在真正关键的OOD任务上:ICL 66%,语言Prompt只有9%,直接拉开了7倍以上的差距。

为了验证S1的泛化性,Skild又在不同的实验条件下进行测试。

结果表明,语言Prompt VLA的性能下降幅度,最高达到ICL的3倍。

也就是说,ICL学到的不是固定场景里的动作复读,而是更能跟着当前环境重新规划怎么做。

最后,在One shot learning方面。

S1在新任务上完全不做post-training,只看一条视频演示,成功率就达到66%。

相较之下,传统VLA则大概要经过约380次演示的后训练,才能追到同样水平。

当然,继续堆到2000次演示后,传统post-training最终能做到86%。

所以结论可能不是“以后机器人不用训练了”,而是:

以前一个新技能可能得教几百遍,现在先看一遍,就能直接做到六七十分。

这也是Skild所谓的ICL scaling law:

数据越多,模型不只是会更多技能,而是越来越会“从演示里学技能”。

Skild AI是谁?

Skild成立于2023年,背后站着两个CMU机器人圈的老熟人:Deepak Pathak和Abhinav Gupta。

两人都是卡内基梅隆大学机器人研究所的教授,Deepak主要研究机器人学习、强化学习和计算机视觉,Abhinav则是计算机视觉、自监督学习领域的大神。

早在2022年,两人就合作过WHIRL,让机器人通过观看人类视频进行one-shot imitation,可以说S1这条路线,也不是突然从石头缝里蹦出来的。

作为北美具身圈的明星企业,2024年Skild刚走出隐身模式,就拿下3亿美元A轮、估值15亿美元;

到了今年1月,又完成14亿美元C轮融资,估值直接干到了140亿美元以上,SoftBank领投,英伟达、贝索斯等继续上桌。两年多时间,估值接近翻了10倍。

横向对比来看,Skild在北美具身圈的定位也相当特殊。

相比于PI更像是在搞“机器人GPT”,Generalist最近强调的是one-shot learner,以及Genesis AI、Sunday最近的全栈势头,Skild一直强调的是一句话:Any robot,any task, one brain

它更强调跨embodiment,希望同一个Skild Brain能够跑在机械臂、四足、人形等不同身体上。

说的通俗一点,就是想成为机器人时代的安卓:一个智能层,塞进各种不同的身体里。

这也由此决定了Skild的数据策略:全都要

Skild把机器人数据看成hardware proximity、diversity和scalability三个维度:

真机遥操最接近硬件,但贵;第一视角人类视频最容易规模化,但和机器人身体差得远;仿真便宜能猛造,却又有sim-to-real gap。

所以他们对于Robot Teleop、UMI、Egocentric Video、Simulation,基本上采取的就是都用的策略。

而S1的ICL,其实也是这条路线自然延伸:

2025年9月LocoFormer → 2026年2月首次In-Domain ICL → 5月第一次翻煎饼 → 8月S1发布,直接把上下文学习推到最长10分钟的OOD长程任务。

所以现在真正值得关注的问题,可能已经不是机器人还能不能学会更多技能,而是:

机器人学习一个新技能的成本,能不能真的从“教几百遍”,变成“你做一遍,它看一遍”。

如果这个scaling law还能继续成立,那所谓机器人的GPT moment,可能真的不只是又一个营销梗了。

参考链接:[1]https://www.skild.ai/blogs/s1

本文来自微信公众号“量子位”,作者:henry,36氪经授权发布。