S2:视觉-语言-动作模型泛化能力大幅提升——"少看多描述"策略使真实机器人成功率提高24.8个百分点
- 日本Preferred Networks团队在arXiv发布S2(See Less, Specify More)框架,针对VLA(Vision-Language-Action)模型泛化瓶颈提出新解法:训练时对执行器施加显式视觉证据预算(Visual Evidence Budget)——强制策略仅依赖任务充分(而非冗余)的视觉信息做决策;同时将粗粒度任务指令细化为轨迹级与子任务级语言描述,消除"监督信号混叠"。
- 关键结果:在TX-G2(AgiBot G2兼容变体)和HSR共8个真实机器人任务上,S2将平均子任务成功率从pi0.5的54.2%提升至79.0%(+24.8pp)。实验覆盖干扰物、外观变化、语义相似任务等泛化挑战场景。
- 方法要点:与依赖原生注意力机制的传统VLA不同,S2将"指定更多"(Specify More)与"少看"(See Less)解耦——前者提供高质量局部引导但不替换高层目标,后者通过证据预算约束降低对无关视觉上下文的依赖。该接口可兼容现成VLM规划器做上下文学习。
- 可复现性:论文发布于arXiv(2606.02735),代码未在摘要中披露具体开源地址。结果来自论文作者自身实验,暂无第三方独立复现。
- 行业意义:VLA模型泛化是人形机器人从实验室走向真实部署的核心障碍。S2表明,改善执行器的训练接口设计(而非单纯扩大模型或数据)可显著提升泛化能力。在AgiBot硬件上的验证结果对正加速量产的中国机器人生态具有直接参考价值。
来源:arXiv(https://arxiv.org/abs/2606.02735)
机器人模仿学习的"假成功"问题:UC Berkeley量化本体感知 vs. 视觉在错误检测中的可恢复性
- UC Berkeley团队在arXiv发表研究(2606.03134),系统分析了机器人模仿学习中的一个隐蔽但普遍的问题:假成功(False Success)——机器人自身判定任务成功,但实际结果错误。这类被污染的数据若进入训练集,将系统性降低策略质量。
- 实验设计:在两个双臂ALOHA任务(方块转移、销钉插入)上,通过环境扰动(而非标签篡改)诱导失败,并用仿真器特权状态标注真实结果。然后对比仅依赖本体感知(proprioception)与加入视觉的检测器在纠正假成功标签上的能力。
- 核心发现:(1)方块转移任务中,本体感知数据几乎可完全恢复假成功;(2)销钉插入任务中,本体感知只能恢复部分,视觉检测器填补了大部分差距;(3)本体感知的可分离性依赖于远低于真实传感器噪声底限的速度差异,因此无噪声仿真器会夸大本体感知的实际可用性。代码与评估管线已开源。
- 行业意义:对Figure、Agibot、Tesla等正在规模化采集机器人操作数据的公司而言,该研究直接指向一个实操问题——若依赖机器人自带成功检测器(而非人工校验或更昂贵的外部视觉系统)来标注训练数据,不同任务类型的数据质量损失差异巨大。在精细操作场景中,仅靠本体感知的自动化标注可能系统性低估失败率。
来源:arXiv(https://arxiv.org/abs/2606.03134)
SeeTraceAct:跨形态单次演示VLA——从人类视频到Franka Panda机械臂的一次性技能迁移
- Georgia Tech与NVIDIA联合团队发布SeeTraceAct——一种基于单次演示视频条件化的VLA框架。核心创新是可见性感知的末端执行器轨迹预测:通过预测未来末端轨迹来鼓励精确的空间定位,而非仅依赖端到端模仿。
- 关键结果:在RoboCasa-DC(跨形态仿真基准,含人形视频)上四项设置全面领先基线;在真实世界中,Franka Panda机械臂以人类演示视频为条件,平均成功率提升12.5个百分点。
- 可复现性:论文发布于arXiv(2606.02745),同步开源RoboCasa-DC数据集——这是首个含人形视频的跨形态演示条件化基准。
- 行业意义:该工作直击VLA模型的最大痛点:每个新任务通常需要昂贵的遥操作数据。SeeTraceAct让机器人从单个(甚至是人类执行的)视频中学习新技能成为可能。如果该范式可规模化,将大幅降低人形机器人部署到新场景的数据采集成本。
来源:arXiv(https://arxiv.org/abs/2606.02745)
