Libra-VLA:粗到细双层 VLA 架构实现学习均衡,异步执行提升操控响应,获 ACL 2026 接收 2026年5月3日 · 2026-05-03
arXiv 技术进展 Libra-VLA:粗到细双层 VLA 架构实现学习均衡,异步执行提升操控响应,获 ACL 2026 接收
发生了什么 :2026 年 4 月 29 日,Libra-VLA 团队在 arXiv 发布论文,提出粗到细(Coarse-to-Fine)双系统 VLA 架构 ,将机器人操控动作在离散宏观意图与连续微观姿态对齐之间建立分层解耦,论文已被 ACL 2026 主会 接收。
关键技术 :Libra-VLA 由两个子系统构成——Semantic Planner 负责预测离散动作 token,编码宏观方向性意图(如"伸向目标区域");Action Refiner 以此粗粒度意图为条件,生成高频连续动作实现精确姿态对齐。核心发现是性能与动作分解粒度呈倒 U 曲线 关系:当两个子系统的学习难度达到均衡时性能峰值出现。该架构进一步采用异步执行策略 ——Planner 规划与 Refiner 执行可并行推进,提升了开放世界操控的响应速度。
对比与影响 :当前主流 VLA 模型(如 π₀、RT-2 等)采用单体生成范式 ——将视觉-语言特征直接映射为高频电机指令,忽略了操控任务天然的分层结构。Libra-VLA 的差异化在于显式建模操控层级 ,并以可验证的均衡准则指导分解粒度选择。类似思想曾在 DIAL(上周报道)中以 System-2/System-1 潜空间瓶颈形式出现,Libra-VLA 则从动作空间离散-连续混合的角度切入,二者构成互补。
可复现性 :论文已公开,项目主页 libra-vla.github.io 上线,获 ACL 2026 接收。来源 :arXiv(https://arxiv.org/abs/2604.24921)
Lifting Embodied World Models:用 2D 路标替代全关节搜索,世界模型规划效率提升 3.8 倍
发生了什么 :2026 年 4 月 30 日,UC Berkeley(Trevor Darrell、Pavel Izmailov、Amir Bar 等)在 arXiv 发布新工作,提出一种**"提升式"具身世界模型**——通过在冻结世界模型之上叠加一个轻量策略,将高维关节动作空间压缩为少量 2D 路标(waypoints),使基于搜索的规划方法(如 CEM)得以高效运行。
关键技术 :对于人形具身(human-like embodiment),动作空间通常涉及全身数十个关节角度的联合控制,CEM 等搜索方法在此维度下效率极低。该工作的方案是:训练一个轻量策略将高层次动作(在观测帧上标注的 2D 路标——分别指定骨盆、头部、双手的近端目标位置)映射为低层关节动作序列,将其与冻结世界模型组合,得到提升世界模型 (lifted world model),从单个高层动作直接预测未来观测序列。实验表明该方法相较直接搜索关节空间将目标姿态的平均关节误差降低 3.8 倍 ,且能泛化到策略未见过的环境。
对比与影响 :世界模型(如 Sora 类视频生成模型应用于机器人)的核心瓶颈之一就是复杂具身的动作控制。该工作证明通过在冻结模型上"提升"动作抽象层级,可以在不重新训练世界模型的前提下大幅改善其可控性。这种"冻结世界模型 + 可插拔抽象策略"的范式对行业有直接工程价值。
可复现性 :论文已公开,代码未明确提及开源。来源 :arXiv(https://arxiv.org/abs/2604.26182)
Egocentric Tactile:在人形机器人 H1-2 上以 RL 实现全身避碰,稀疏非方向性信号优于密集方向性信号
发生了什么 :2026 年 4 月 29 日,科罗拉多大学博尔德分校团队在 arXiv 发布论文,在 H1-2 人形机器人 上部署强化学习框架,实现基于本体触觉与接近传感器的全身碰撞避免,并以**躲避球(dodgeball)**为基准任务进行了系统消融实验。
关键技术 :研究系统性地探讨了传感器属性(覆盖范围、类型、感知距离)如何塑造学习到的避碰行为。核心结论:原始接近感知信号可在感知距离足够的情况下替代显式物体定位 ;且稀疏的非方向性接近信号在样本效率上优于密集的方向性替代方案 ——这一反直觉发现对硬件选型有直接指导意义。框架部署在真实 H1-2 硬件上。
对比与影响 :现有避碰方案主要依赖外部摄像头,但在遮挡场景下失效。本体传感器天然抗遮挡,但如何设置传感器属性以有效支持避碰行为此前缺乏系统研究。该工作首次在真实人形机器人上给出定量答案,为量产人形机器人的传感器配置提供了实用参考。
可复现性 :论文已公开,实验在 Unitree H1-2 上完成,代码未明确提及开源。来源 :arXiv(https://arxiv.org/abs/2604.25554)
产品 Meta 收购 Assured Robot Intelligence,Lerrel Pinto 与 Xiaolong Wang 携团队加入,加速人形机器人"Android 平台"战略
发生了什么 :2026 年 5 月 1 日,Meta 宣布收购 Assured Robot Intelligence(ARI),一家专注于人形机器人 AI 模型的初创公司。交易金额未披露。ARI 联合创始人 Lerrel Pinto (前 Fauna Robotics 联合创始人、NYU 教授)和 Xiaolong Wang (前 NVIDIA 研究员、UC San Diego 教授)将携团队加入 Meta Superintelligence Labs ,与 Meta Robotics Studio 紧密协作。
关键产品信息 :Meta 发言人称 ARI"处于机器人智能前沿,致力于让机器人理解、预测并适应复杂动态环境中的人类行为",团队将专注为机器人控制与自学习设计模型及前沿能力,直接服务于"全本人形机器人控制"。此次收购进一步明确了 Meta 的机器人战略——做**"人形机器人的 Android"**:提供传感器、软件和 AI 模型作为底层平台,让硬件制造商在此之上构建产品,而非亲自制造整机。
对比与影响 :当前人形机器人赛道中,Physical Intelligence、Generalist AI、Skild AI 等多家初创均聚焦于"机器人大脑"层。Meta 以平台化思维切入,凭借算力资源(Meta 同期大幅上调 2026 年资本支出)、开源生态(Llama 系列模型)和开发者社区,可能对人形机器人软件栈形成类似 Android 之于智能手机的整合效应。但这一策略的成败取决于 Meta 是否真正开放平台、模型是否足够通用。
可复现性 :收购已完成;Meta Robotics Studio 的人形硬件尚在内部开发中,未对外商用。来源 :TechCrunch(https://techcrunch.com/2026/05/01/meta-buys-robotics-startup-to-bolster-its-humanoid-ai-ambitions/)、Bloomberg、The Verge
MagicLab 硅谷发布 MagicBot X1 与 H01 灵巧手,宣布 5 年 10 亿美元开发者生态投资
发生了什么 :2026 年 4 月 29 日,MagicLab Robotics 在硅谷举办全球具身智能峰会(GEIS) ,发布新一代产品组合:旗舰人形机器人 MagicBot X1 (面向真实工业场景)、H01 灵巧手 、以及具身基础世界模型 Magic-Mix 。同时宣布"Co-Create 1000 倡议"——未来 5 年投资 10 亿美元建设机器人开发者生态。
关键产品信息 :MagicLab 定位为全栈自研 具身 AI 公司,产品生态横跨人形与四足机器人,覆盖工业制造、商业服务、家庭等九大场景。2025 年国际营收占比达 60%,业务覆盖 50+ 国家和地区,已实现规模化全球交付。公司公布远期路线图:目标 2036 年实现年收入 140 亿美元。峰会现场还展示了硅谷合作伙伴生态(Openmind、PrismaX AI 等),以及 MagicBot Z1 人形机器人与艺人 Lay Zhang 的联合表演。
对比与影响 :在国际人形机器人公司(如 Figure、Apptronik、1X)主要通过企业试点合作推进商业化时,MagicLab 已实现跨 50 国的直接销售——这与此前 IDC 报告指出的"中国厂商在 2025 年以超 18,000 台出货量领跑全球"趋势一致。10 亿美元的开发者生态投资规模在机器人行业极为罕见,可能加速二次开发和应用生态的成熟。
可复现性 :产品已进入全球市场;H01 灵巧手与 Magic-Mix 模型处于发布阶段。来源 :PR Newswire(https://www.prnewswire.com/news-releases/magiclab-robotics-unveils-its-embodied-ai-vision-in-silicon-valley-expands-global-reach-to-50-countries-302756797.html)
DAIMON Robotics 发布 Daimon-Infinity:全球最大全模态触觉机器人数据集,10,000 小时开源,提出 VTLA 架构
发生了什么 :2026 年 4 月 30 日,香港触觉传感器初创 DAIMON Robotics 正式发布 Daimon-Infinity ——据称为全球最大的全模态(omni-modal)机器人操作数据集,包含百万小时级多模态数据、超高分辨率触觉反馈,覆盖 80+ 真实场景和 2,000+ 人类技能,从家庭洗衣到工厂装配线。项目合作方包括 Google DeepMind、西北大学、新加坡国立大学、中国移动 等。
关键产品信息 :DAIMON 以视觉触觉传感器(单色视觉方案,指尖级模块集成 110,000+ 有效传感单元)为核心硬件,构建了全球最大的分布式离实验室数据采集网络,年产能百万小时级。公司同时宣布开源 10,000 小时数据 。首席科学家王煜教授(前港科大机器人研究所创始主任、IEEE Fellow)提出 VTLA(Vision-Tactile-Language-Action)架构 ,将触觉提升至与视觉平行的模态地位,解决当前 VLA 范式下机器人在暗光操作、滑移检测、精密力控等方面的"触觉不敏感"问题。
对比与影响 :当前所有主流 VLA 模型(RT-2、π₀、GR00T N1 等)均以视觉-语言为输入,触觉数据长期缺失。Daimon-Infinity 的发布补上了这一关键缺口——触觉信息本质上是视觉格式(指尖形变图像),天然适配 VLA 框架。DAIMON 的"3D"商业模式(Devices + Data + Deployment)——从硬件到数据到部署的垂直整合——代表了具身智能数据基础设施的一种新形态。10,000 小时的开源规模也为社区研究提供了可用资源。
可复现性 :10,000 小时数据已开源;触觉传感器硬件已进入量产,被多家人形机器人公司采用。来源 :The Robot Report / DAIMON Robotics(https://www.machinebrief.com/news/daimon-robotics-wants-to-give-robot-hands-a-sense-of-touch-vjmj)
生态 美国国会持续推进机器人供应链安全立法,《美国安全机器人法案》进入关键审议阶段
FAULHABER 推出 DualGear 双输出驱动系统,为自主物流机器人提供紧凑型动力方案
发生了什么 :2026 年 4 月 29 日,德国微型驱动系统制造商 FAULHABER 正式发布 DualGear ——一款专为自主物流系统设计的紧凑型双输出驱动系统,将 BX4 无刷电机与两端 GPT 行星齿轮箱集成为单一单元。
关键信息 :DualGear 以单个电机同时驱动两个同步输出 ,消除了对两套独立驱动系统的需求,显著减少系统集成复杂度、安装空间和成本。BX4 电机提供 42mm 和 68mm 两种长度,GPT 齿轮箱最高支持三级减速,输出轴连续扭矩 1.1 Nm、峰值 7 Nm。系统采用全焊接结构(无胶粘),适应 -30 至 120°C 工作温度。目标应用包括仓储堆垛机(AS/RS)和自主物流系统的紧凑型车轮驱动。
对比与影响 :当前自主移动机器人(AMR)和物流机器人对驱动系统的核心要求是"在极度受限的空间内释放极大力量"。DualGear 通过将双输出集成于同一壳体,解决了传统方案需两个独立电机+齿轮箱在空间和同步控制上的痛点。这一创新直接服务于 AMR 供应链的硬件层——随着人形机器人之外的物流机器人规模化部署加速(如中国酒店配送机器人已近 100% 覆盖),紧凑型高性能驱动系统的需求将持续增长。来源 :RoboticsTomorrow(https://www.roboticstomorrow.com/news/2026/04/29/innovative-faulhaber-drive-system-for-smart-logistics/26492/)、FAULHABER