AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Libra-VLA:粗到细双层 VLA 架构实现学习均衡,异步执行提升操控响应,获 ACL 2026 接收

2026年5月3日 · 2026-05-03

arXiv

技术进展

Libra-VLA:粗到细双层 VLA 架构实现学习均衡,异步执行提升操控响应,获 ACL 2026 接收

  • 发生了什么:2026 年 4 月 29 日,Libra-VLA 团队在 arXiv 发布论文,提出粗到细(Coarse-to-Fine)双系统 VLA 架构,将机器人操控动作在离散宏观意图与连续微观姿态对齐之间建立分层解耦,论文已被 ACL 2026 主会接收。
  • 关键技术:Libra-VLA 由两个子系统构成——Semantic Planner 负责预测离散动作 token,编码宏观方向性意图(如"伸向目标区域");Action Refiner 以此粗粒度意图为条件,生成高频连续动作实现精确姿态对齐。核心发现是性能与动作分解粒度呈倒 U 曲线关系:当两个子系统的学习难度达到均衡时性能峰值出现。该架构进一步采用异步执行策略——Planner 规划与 Refiner 执行可并行推进,提升了开放世界操控的响应速度。
  • 对比与影响:当前主流 VLA 模型(如 π₀、RT-2 等)采用单体生成范式——将视觉-语言特征直接映射为高频电机指令,忽略了操控任务天然的分层结构。Libra-VLA 的差异化在于显式建模操控层级,并以可验证的均衡准则指导分解粒度选择。类似思想曾在 DIAL(上周报道)中以 System-2/System-1 潜空间瓶颈形式出现,Libra-VLA 则从动作空间离散-连续混合的角度切入,二者构成互补。
  • 可复现性:论文已公开,项目主页 libra-vla.github.io 上线,获 ACL 2026 接收。
    来源:arXiv(https://arxiv.org/abs/2604.24921)

Lifting Embodied World Models:用 2D 路标替代全关节搜索,世界模型规划效率提升 3.8 倍

Lifted World Model overview

  • 发生了什么:2026 年 4 月 30 日,UC Berkeley(Trevor Darrell、Pavel Izmailov、Amir Bar 等)在 arXiv 发布新工作,提出一种**"提升式"具身世界模型**——通过在冻结世界模型之上叠加一个轻量策略,将高维关节动作空间压缩为少量 2D 路标(waypoints),使基于搜索的规划方法(如 CEM)得以高效运行。
  • 关键技术:对于人形具身(human-like embodiment),动作空间通常涉及全身数十个关节角度的联合控制,CEM 等搜索方法在此维度下效率极低。该工作的方案是:训练一个轻量策略将高层次动作(在观测帧上标注的 2D 路标——分别指定骨盆、头部、双手的近端目标位置)映射为低层关节动作序列,将其与冻结世界模型组合,得到提升世界模型(lifted world model),从单个高层动作直接预测未来观测序列。实验表明该方法相较直接搜索关节空间将目标姿态的平均关节误差降低 3.8 倍,且能泛化到策略未见过的环境。
  • 对比与影响:世界模型(如 Sora 类视频生成模型应用于机器人)的核心瓶颈之一就是复杂具身的动作控制。该工作证明通过在冻结模型上"提升"动作抽象层级,可以在不重新训练世界模型的前提下大幅改善其可控性。这种"冻结世界模型 + 可插拔抽象策略"的范式对行业有直接工程价值。
  • 可复现性:论文已公开,代码未明确提及开源。
    来源:arXiv(https://arxiv.org/abs/2604.26182)

Egocentric Tactile:在人形机器人 H1-2 上以 RL 实现全身避碰,稀疏非方向性信号优于密集方向性信号

  • 发生了什么:2026 年 4 月 29 日,科罗拉多大学博尔德分校团队在 arXiv 发布论文,在 H1-2 人形机器人上部署强化学习框架,实现基于本体触觉与接近传感器的全身碰撞避免,并以**躲避球(dodgeball)**为基准任务进行了系统消融实验。
  • 关键技术:研究系统性地探讨了传感器属性(覆盖范围、类型、感知距离)如何塑造学习到的避碰行为。核心结论:原始接近感知信号可在感知距离足够的情况下替代显式物体定位;且稀疏的非方向性接近信号在样本效率上优于密集的方向性替代方案——这一反直觉发现对硬件选型有直接指导意义。框架部署在真实 H1-2 硬件上。
  • 对比与影响:现有避碰方案主要依赖外部摄像头,但在遮挡场景下失效。本体传感器天然抗遮挡,但如何设置传感器属性以有效支持避碰行为此前缺乏系统研究。该工作首次在真实人形机器人上给出定量答案,为量产人形机器人的传感器配置提供了实用参考。
  • 可复现性:论文已公开,实验在 Unitree H1-2 上完成,代码未明确提及开源。
    来源:arXiv(https://arxiv.org/abs/2604.25554)

产品

Meta 收购 Assured Robot Intelligence,Lerrel Pinto 与 Xiaolong Wang 携团队加入,加速人形机器人"Android 平台"战略

Meta humanoid robot concept

  • 发生了什么:2026 年 5 月 1 日,Meta 宣布收购 Assured Robot Intelligence(ARI),一家专注于人形机器人 AI 模型的初创公司。交易金额未披露。ARI 联合创始人 Lerrel Pinto(前 Fauna Robotics 联合创始人、NYU 教授)和 Xiaolong Wang(前 NVIDIA 研究员、UC San Diego 教授)将携团队加入 Meta Superintelligence Labs,与 Meta Robotics Studio 紧密协作。
  • 关键产品信息:Meta 发言人称 ARI"处于机器人智能前沿,致力于让机器人理解、预测并适应复杂动态环境中的人类行为",团队将专注为机器人控制与自学习设计模型及前沿能力,直接服务于"全本人形机器人控制"。此次收购进一步明确了 Meta 的机器人战略——做**"人形机器人的 Android"**:提供传感器、软件和 AI 模型作为底层平台,让硬件制造商在此之上构建产品,而非亲自制造整机。
  • 对比与影响:当前人形机器人赛道中,Physical Intelligence、Generalist AI、Skild AI 等多家初创均聚焦于"机器人大脑"层。Meta 以平台化思维切入,凭借算力资源(Meta 同期大幅上调 2026 年资本支出)、开源生态(Llama 系列模型)和开发者社区,可能对人形机器人软件栈形成类似 Android 之于智能手机的整合效应。但这一策略的成败取决于 Meta 是否真正开放平台、模型是否足够通用。
  • 可复现性:收购已完成;Meta Robotics Studio 的人形硬件尚在内部开发中,未对外商用。
    来源:TechCrunch(https://techcrunch.com/2026/05/01/meta-buys-robotics-startup-to-bolster-its-humanoid-ai-ambitions/)、Bloomberg、The Verge

MagicLab 硅谷发布 MagicBot X1 与 H01 灵巧手,宣布 5 年 10 亿美元开发者生态投资

MagicLab Robotics product showcase at GEIS Silicon Valley

  • 发生了什么:2026 年 4 月 29 日,MagicLab Robotics 在硅谷举办全球具身智能峰会(GEIS),发布新一代产品组合:旗舰人形机器人 MagicBot X1(面向真实工业场景)、H01 灵巧手、以及具身基础世界模型 Magic-Mix。同时宣布"Co-Create 1000 倡议"——未来 5 年投资 10 亿美元建设机器人开发者生态。
  • 关键产品信息:MagicLab 定位为全栈自研具身 AI 公司,产品生态横跨人形与四足机器人,覆盖工业制造、商业服务、家庭等九大场景。2025 年国际营收占比达 60%,业务覆盖 50+ 国家和地区,已实现规模化全球交付。公司公布远期路线图:目标 2036 年实现年收入 140 亿美元。峰会现场还展示了硅谷合作伙伴生态(Openmind、PrismaX AI 等),以及 MagicBot Z1 人形机器人与艺人 Lay Zhang 的联合表演。
  • 对比与影响:在国际人形机器人公司(如 Figure、Apptronik、1X)主要通过企业试点合作推进商业化时,MagicLab 已实现跨 50 国的直接销售——这与此前 IDC 报告指出的"中国厂商在 2025 年以超 18,000 台出货量领跑全球"趋势一致。10 亿美元的开发者生态投资规模在机器人行业极为罕见,可能加速二次开发和应用生态的成熟。
  • 可复现性:产品已进入全球市场;H01 灵巧手与 Magic-Mix 模型处于发布阶段。
    来源:PR Newswire(https://www.prnewswire.com/news-releases/magiclab-robotics-unveils-its-embodied-ai-vision-in-silicon-valley-expands-global-reach-to-50-countries-302756797.html)

DAIMON Robotics 发布 Daimon-Infinity:全球最大全模态触觉机器人数据集,10,000 小时开源,提出 VTLA 架构

  • 发生了什么:2026 年 4 月 30 日,香港触觉传感器初创 DAIMON Robotics 正式发布 Daimon-Infinity——据称为全球最大的全模态(omni-modal)机器人操作数据集,包含百万小时级多模态数据、超高分辨率触觉反馈,覆盖 80+ 真实场景和 2,000+ 人类技能,从家庭洗衣到工厂装配线。项目合作方包括 Google DeepMind、西北大学、新加坡国立大学、中国移动等。
  • 关键产品信息:DAIMON 以视觉触觉传感器(单色视觉方案,指尖级模块集成 110,000+ 有效传感单元)为核心硬件,构建了全球最大的分布式离实验室数据采集网络,年产能百万小时级。公司同时宣布开源 10,000 小时数据。首席科学家王煜教授(前港科大机器人研究所创始主任、IEEE Fellow)提出 VTLA(Vision-Tactile-Language-Action)架构,将触觉提升至与视觉平行的模态地位,解决当前 VLA 范式下机器人在暗光操作、滑移检测、精密力控等方面的"触觉不敏感"问题。
  • 对比与影响:当前所有主流 VLA 模型(RT-2、π₀、GR00T N1 等)均以视觉-语言为输入,触觉数据长期缺失。Daimon-Infinity 的发布补上了这一关键缺口——触觉信息本质上是视觉格式(指尖形变图像),天然适配 VLA 框架。DAIMON 的"3D"商业模式(Devices + Data + Deployment)——从硬件到数据到部署的垂直整合——代表了具身智能数据基础设施的一种新形态。10,000 小时的开源规模也为社区研究提供了可用资源。
  • 可复现性:10,000 小时数据已开源;触觉传感器硬件已进入量产,被多家人形机器人公司采用。
    来源:The Robot Report / DAIMON Robotics(https://www.machinebrief.com/news/daimon-robotics-wants-to-give-robot-hands-a-sense-of-touch-vjmj)

生态

美国国会持续推进机器人供应链安全立法,《美国安全机器人法案》进入关键审议阶段

  • 发生了什么:2026 年 4 月下旬至 5 月初,美国国会围绕机器人供应链安全的立法活动持续升温。众议院《美国安全机器人法案》(American Security Robotics Act of 2026,H.R.8189)与参议院配套法案(S.4235)同步推进,核心条款为禁止联邦行政机构采购或操作由中国等"受关注外国实体"制造或组装的无人地面车辆系统(UGVs)。与此同时,众议院 Bipartisan AI Task Force 已将机器人供应链安全纳入年度《国防授权法案》(NDAA)扩展审议范围。
  • 关键信号:法案结构对标此前针对华为/中兴的通信设备禁令(Section 889)和中国无人机禁令——限制联邦采购、堵住政府市场入口。更深层的立法逻辑体现在:该法案是"跨 NDAA 年份演进的产品特定、供应链风险导向立法架构"的一部分,覆盖数据访问、操作控制和系统性漏洞。此前众议院国土安全委员会已于 3 月就"中国在 AI 与机器人领域主导地位的国家安全风险"举行听证,多位议员呼吁制定国家机器人战略。
  • 对比与影响:此前的 CHIPS 法案解决的是芯片制造能力缺口,ASRA 类法案则从需求侧切断中国机器人进入美国公共部门的路径。对 Unitree(宇树)、AGIBOT(智元)等中国机器人企业而言,美国政府和承包商市场面临实质性关闭风险;对 Figure、Apptronik、Tesla Optimus 等美国本土人形机器人公司则构成政策性利好。但法案目前仅限联邦采购,不涉及商业市场,实际冲击取决于执行细则和后续扩展范围。
    来源:Global Policy Watch(https://www.globalpolicywatch.com/2026/04/the-next-frontier-of-supply-chain-security-congress-trains-its-sights-on-robotics/)、Congress.gov(https://www.congress.gov/bill/119th-congress/house-bill/8189/text/ih)

FAULHABER 推出 DualGear 双输出驱动系统,为自主物流机器人提供紧凑型动力方案

FAULHABER DualGear drive system

  • 发生了什么:2026 年 4 月 29 日,德国微型驱动系统制造商 FAULHABER 正式发布 DualGear——一款专为自主物流系统设计的紧凑型双输出驱动系统,将 BX4 无刷电机与两端 GPT 行星齿轮箱集成为单一单元。
  • 关键信息:DualGear 以单个电机同时驱动两个同步输出,消除了对两套独立驱动系统的需求,显著减少系统集成复杂度、安装空间和成本。BX4 电机提供 42mm 和 68mm 两种长度,GPT 齿轮箱最高支持三级减速,输出轴连续扭矩 1.1 Nm、峰值 7 Nm。系统采用全焊接结构(无胶粘),适应 -30 至 120°C 工作温度。目标应用包括仓储堆垛机(AS/RS)和自主物流系统的紧凑型车轮驱动。
  • 对比与影响:当前自主移动机器人(AMR)和物流机器人对驱动系统的核心要求是"在极度受限的空间内释放极大力量"。DualGear 通过将双输出集成于同一壳体,解决了传统方案需两个独立电机+齿轮箱在空间和同步控制上的痛点。这一创新直接服务于 AMR 供应链的硬件层——随着人形机器人之外的物流机器人规模化部署加速(如中国酒店配送机器人已近 100% 覆盖),紧凑型高性能驱动系统的需求将持续增长。
    来源:RoboticsTomorrow(https://www.roboticstomorrow.com/news/2026/04/29/innovative-faulhaber-drive-system-for-smart-logistics/26492/)、FAULHABER

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • 机器人手与人手相对竖起拇指Meta 收购机器人训练公司,现实世界 AI 竞争延伸到数据与运营链Daily · 5月2日
  • Meta 办公楼外墙上的蓝色 Meta 标志Meta Business AI 每周处理千万次对话,企业消息入口开始规模化Daily · 5月1日
  • Google Cloud 彩色云形标志特写Google Cloud 突破 200 亿美元,AI 基础设施开始接受容量与回报检验Daily · 4月30日
  • π0.7机器人操作咖啡机Physical Intelligence 发布 π₀.₇:具备涌现式组合泛化能力的通用机器人基础模型Daily · 4月29日
  • LARYBench概览图LARYBench:首次系统度量从人类视频学习的具身动作表征Daily · 4月28日
  • AgentPressureBench:编码智能体在用户压力下的「刷榜」行为检测AgentPressureBench:编码智能体在用户压力下的「刷榜」行为检测Daily · 4月25日
  • UniT框架示意图:人类示教到人形机器人零样本策略迁移UniT:从人类到人形机器人的统一物理语言框架Daily · 4月24日
  • 荣耀“闪电”机器人在比赛中RoboWM-Bench:面向机器人操作的世界模型评估基准Daily · 4月23日
  • CaTS-Bench:时间序列字幕生成新基准,含1746条人工重写标注CaTS-Bench:时间序列字幕生成新基准,含1746条人工重写标注Daily · 4月22日
  • OCBENCH:大型语言模型过度服从性跨模型基准OCBENCH:大型语言模型过度服从性跨模型基准Daily · 4月21日
  • CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集Daily · 4月20日
  • DogReID‑1553:大规模犬只重识别视频数据集与基准测试Daily · 4月19日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS