8 月 25 日,机器人公司 Skild AI 发布其旗舰基础模型 S1:给机器人看一段人类第一视角的演示视频,它就能执行一个训练中从未见过、最长约 10 分钟、包含数十个操作步骤的任务——煎饼、手冲咖啡、盆栽换盆、套件组装——全程不微调、不后训练,权重保持不变。这是 Skild 所说的机器人版「上下文学习」(in-context learning,ICL):把给模型的提示从一句话换成一段视频。而它同步抛出的核心数字——未见过任务上 66% 对语言提示 9% 的成功率——来自 Skild 自己的内部基准,发布时没有给出权重、API 或技术论文。
视频为什么可能比语言多携带信息
Skild 的论点是:语言适合描述「把杯子递给我」这类原子动作,但任务一旦变得精细、微妙或长程,人就不再靠一句话教学,而是靠演示——没人靠读句子学会折床单、打发蛋白或打结。视频把空间和时间信息都编码进提示:物体在哪、以什么顺序、用什么力度。一句话可以对应上百种合法执行方式,一段演示则精确指定了其中一种。
S1 的训练配方在概念上很直接:在分幕式(episodic)数据上预训练,任务只通过一段上下文演示来指定。由于演示可能来自不同场景、视角甚至不同本体(embodiment),模型为了预测正确动作,就必须隐式学会演示者的意图、功能对应关系和任务进度。用元学习的说法,预训练是「外循环」,教会策略如何从上下文里学习;推理时由演示驱动「内循环」,权重不变。Skild 把这一步类比为语言模型从 BERT 到 GPT-3 的跃迁:机器人学习至今仍停留在「每个新任务都要采数据、微调专家策略」的 BERT 时代,S1 要复制的是 GPT-3 式的上下文学习。这套能力建立在英伟达 AI 基础设施之上。
66% 对 9%,只在曲线的某个角落成立
这个对比来自 Skild 自己设计的一项对照研究:两份模型用相同的数据、架构(除提示编码外)和算力,在 1 千到 10 万小时的预训练数据上分别训练「视频提示」和「语言提示」两个版本,唯一变量是提示方式。结果要分两条曲线看:
- 已见过的任务上,小数据量时语言提示反而领先(1 千小时时 53% 对 43%),视频提示的优势要等数据规模上去后才显现;
- 未见过的任务上,差距才真正拉开:10 万小时时语言提示只有 9%,视频提示达到 66%,约 7 倍。
也就是说,「66% 对 9%」这个被引用最多的数字,只存在于「未见任务、10 万小时规模」这一个角落。它衡量的还是「每步平均成功率」,且 Skild 在博客里写明,评估时用了人工干预从失败步骤中恢复、再继续跑完剩余步骤——所以「10 分钟自主」并不等于「10 分钟无人接管」。Skild 还给出一个更有参考价值的换算:一段视频演示在上下文里的价值,约等于 380 次后训练演示;而真要后训练,做到 2000 次演示能达到 86%,超过 S1 的单次演示。
四段演示能证明什么,不能证明什么
除基准外,Skild 展示的定性行为本身有信息量:把物体滑走、换掉、改光照,S1 仍能完成任务;出错后它会重试而不是硬着头皮继续;甚至出现过「常识」行为——提示里用喷壶浇水但现场只有杯子,它就改用杯子;提示里演示者打鸡蛋时失手弄脏台面,S1 却用受控动作完成了同一步,把演示当作目标规范、而非需要逐帧复刻的轨迹。在五档分布偏移测试里,语言提示的 VLA 在最难一档的退化幅度是 S1 的三倍。
但这些都停留在 Skild 单方面发布的博客和演示视频层面。独立科技媒体 DataNorth 的核查点很直接:没有权重、没有 API、没有许可证、没有定价,也没有技术报告;66% 出自一个未公开的内部基准,没有试验次数、误差棒、外部基线,参数量、预训练总时长、评测所用机器人平台全部未公布。四段演示是手工挑选的,而「从演示到自主执行只用 11 分钟」的盆栽任务里,大部分时间花在摆场景上。就证据等级而言,这是这个领域里最弱的一档:一篇博客、一项内部评测、四个精选任务。
站在 140 亿美元估值上的一个信号
S1 的分量,一半在模型,一半在它背后的公司。Skild 由卡内基梅隆大学教授 Deepak Pathak 与曾负责 Meta FAIR 机器人实验室的 Abhinav Gupta 于 2023 年创立;今年 1 月完成由软银领投的 14 亿美元 Series C,估值超过 140 亿美元,七个月内估值增至三倍,英伟达的风险投资部门 NVentures 也参与其中。它的打法是不做硬件,只卖「任何任务、任何硬件、一个大脑」的智能层,已公布的机器人 OEM 合作伙伴包括 ABB、Universal Robots 和 MiR。
这与同期的竞争对手形成对照:Generalist AI 在 8 月 24 日发布的 GEN-1.5 同样主打单次演示学习,但演示时长只有 3 到 12 秒;Physical Intelligence 的 pi-0.5 则属于更宽的 VLA 阵营。S1 的差异化在任务长度而非灵巧度——10 分钟、数十步远超多数已发表 VLA 的汇报范围。值得注意的克制来自 Skild 自己:联合创始人 Gupta 把当前阶段称作「GPT 时刻的开始」,并把这个时刻放到未来一到一年半,赌注押在工厂和仓库、而非家庭。
下一项可观察变量
对从业者而言,S1 现在只能「看」,不能「测」。真正能改变判断的不是更多演示视频,而是三件事:Skild 是否发布技术论文和可复现的评估协议;66% 的内部基准能否在公开任务或第三方环境里被复现;以及「视频提示」的泛化是否在四段精选演示之外、在更嘈杂的真实部署中仍然成立。在那之前,66% 对 9% 是一个有方向性、机制上也说得通的信号,而不是一个可以据此做采购决策的基准。