Physical Intelligence 发布 π₀.₇:具备涌现式组合泛化能力的通用机器人基础模型
2026年4月29日 · 2026-04-29
技术进展
Physical Intelligence 发布 π₀.₇:具备涌现式组合泛化能力的通用机器人基础模型
RLT:用"RL Token"实现 VLA 模型的样本高效在线强化学习微调
- 发生了什么:2026年4月28日,Physical Intelligence 团队(含 Sergey Levine)在 arXiv 发布 RLT(RL Token)方法,提出一种轻量级机制,使预训练 VLA(视觉-语言-动作)模型能在仅数小时真实世界练习中完成在线 RL 微调。
- 关键技术:RLT 分两步:(1)改编 VLA 暴露一个紧凑的"RL Token"读出表征,保留预训练任务相关知识的同时作为在线 RL 的高效接口;(2)在此 RL Token 上训练小型 Actor-Critic 头来精化动作,同时将学习策略锚定在原 VLA 上。在四项真实机器人任务(螺丝安装、扎带紧固、充电器插入、以太网接口插入)中,RLT 将任务最难环节的速度提升最多 3 倍,在数分钟到数小时内显著提高成功率,部分任务甚至超越人类遥操作速度。
- 对比与影响:现有 VLA 模型"开箱"能力虽强,但精度和速度不足以满足真实部署需求;常规 RL 微调则因 VLA 参数量巨大而样本效率极低。RLT 在保持 VLA 泛化能力的同时,用极低成本实现任务级速度与精度飞跃,为 VLA 从"能完成任务"到"能高效完成任务"架设了关键桥梁。
- 可复现性:论文已公开,代码和模型权重未明确提及开源。
来源:arXiv(https://arxiv.org/abs/2604.23073)
MUSIC:基于肌肉驱动的仿生灵巧手控制——首次实现物理仿真下的钢琴演奏
- 发生了什么:2026年4月28日,斯坦福大学、哥伦比亚大学与 Steinway 公司联合团队在 arXiv 发布 MUSIC,提出数据驱动的、基于肌肉骨骼模型的灵巧手控制方法,首次在物理仿真中实现双手协调的精确钢琴演奏,且能泛化到参考数据集之外的陌生曲目。
- 关键技术:MUSIC 采用分层架构——低层用强化学习训练单手机肉-肌腱激活动态跟踪大规模参考运动数据集中的轨迹,再通过 VAE(变分自编码器)将跟踪策略蒸馏为平滑的结构化潜空间;高层则训练曲目特定策略在此潜空间中协调双手运动,根据乐谱音符事件合成演奏。此外团队构建了增强版肌肉骨骼手模型,支持手指精细控制。实验覆盖多种音乐风格和技术难度,模型生成的肌肉激活模式与实际人体 EMG(肌电图)记录高度一致。
- 对比与影响:此前的灵巧手控制研究大多基于简化的关节驱动模型,忽略了肌肉-肌腱的复杂动力学。MUSIC 首次在肌肉层面展示了高精度双手协调,且生理合理性得到 EMG 验证。这对假肢控制、遥操作和仿人机器人灵巧操作具有直接启发意义。
- 可复现性:论文已公开,代码未明确提及开源。
来源:arXiv(https://arxiv.org/abs/2604.23886)
ESPADA:基于语义感知的模仿学习数据下采样,实现 2 倍执行加速
- 发生了什么:2026年4月28日,首尔大学团队在 arXiv 更新 ESPADA 论文(v3),提出一种利用 VLM-LLM 流水线对模仿学习演示数据进行语义感知下采样的方法,在不重新训练、不修改架构的前提下实现约 2 倍执行加速。
- 关键技术:ESPADA 通过 VLM-LLM 流水线结合 3D 夹爪-物体空间关系对演示进行语义分段,仅对非关键段做激进下采样而保留精度关键段。为从单条标注片段扩展到全数据集,ESPADA 使用动态时间规整(DTW)在纯动力学特征上传播片段标签。在仿真和真实实验中,基于 ACT 和 Diffusion Policy 的基线策略均实现了约 2 倍加速且成功率不变。
- 对比与影响:模仿学习策略常继承人类演示中缓慢谨慎的节奏,限制实际部署效率。此前加速方法依赖统计或启发式线索,忽略任务语义。ESPADA 首次系统化地将语义理解用于执行加速,无需任何策略重训,具有极高的实用价值。
- 可复现性:论文已公开,代码未明确提及开源。
来源:arXiv(https://arxiv.org/abs/2512.07371)
SMP:可复用的评分匹配运动先验——为人形机器人控制提供通用"风格引擎"
- 发生了什么:2026年4月28日,多伦多大学、英伟达等联合团队在 arXiv 更新 SMP(Score-Matching Motion Priors)论文(v3),提出利用预训练运动扩散模型和评分蒸馏采样(SDS)创建可复用的、任务无关的运动先验,为人形机器人物理仿真控制提供通用"风格引擎"。
- 关键技术:SMP 可与任何控制策略或任务解耦预训练,训练后冻结并复用为通用奖励函数,引导新策略产生自然动作。单个大规模数据集训练的通用运动先验可被重新用于多种风格特定先验,SMP 还能组合不同风格合成原数据集中不存在的新风格。在多样化物理仿真人形角色控制任务中,SMP 产生的运动质量与 SOTA 对抗式模仿学习方法相当。
- 对比与影响:传统对抗式运动先验几乎每次新控制器都需重训,限制复用性。SMP 首次实现了"一次训练,随处复用"的模块化运动先验,且支持风格组合与迁移,对人形机器人运动合成和 sim-to-real 部署具有重要基础设施意义。
- 可复现性:演示视频公开(https://youtu.be/jBA2tWk6vzU),代码未明确提及开源。
来源:arXiv(https://arxiv.org/abs/2512.03028)
哥伦比亚大学发现:持续学习使机器人涌现"自我"表征
- 发生了什么:2026年4月27日,哥伦比亚大学 Hod Lipson 团队在 arXiv 更新论文(v2),首次以可量化方式证明:经受持续学习(continual learning)的机器人会在神经网络中自发形成稳定的不变子网络——这被研究者解释为"自我"的计算表征。
- 关键技术:研究将"自我"定义为认知过程中变化最慢的不变部分(因为自我是体验中最持久的一面)。两组对比实验中,一组机器人学习恒定任务,另一组在可变任务下持续学习。结果表明持续学习机器人形成的不变子网络稳定性显著高于对照组(p < 0.001),且该子网络功能重要——保留它助益适应,破坏它损害性能。
- 对比与影响:这是首次以"相对不变性"为操作化定义来量化和隔离机器人认知架构中的"自我"表征。尽管这一概念仍属探索性,但其方法论可能为理解 AI 系统中的自我意识提供新窗口。Hod Lipson 此前以"自我建模机器人"研究闻名。
- 可复现性:论文已公开,代码和实验细节在论文中描述。
来源:arXiv(https://arxiv.org/abs/2603.24350)
产品
Faraday Future 在旧金山发布 EAI Brain 开放开发者平台,宣告 2026 为"具身 AI 机器人教育元年"
生态
Schaeffler 与 Hexagon Robotics 达成战略合作:2032 年前部署 1000 台 AEON 人形机器人