AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

RLDX-1:KAIST 等机构发布通用 VLA 模型,人形机器人任务成功率 86.8%,大幅超越 π0.5 与 GR00T N1.6

2026年5月8日 · 2026-05-08

技术进展

RLDX-1:KAIST 等机构发布通用 VLA 模型,人形机器人任务成功率 86.8%,大幅超越 π0.5 与 GR00T N1.6

  • 发生了什么:2026 年 5 月 6 日,来自 KAIST 等韩国研究机构的团队在 arXiv 发布 RLDX-1 技术报告,提出一个面向灵巧操作的通用机器人策略模型,在 ALLEX 人形机器人基准上取得 86.8% 成功率,而 π0.5 和 GR00T N1.6 仅约 40%。
  • 关键技术:RLDX-1 核心是 Multi-Stream Action Transformer(MSAT) 架构,通过模态专属流(modality-specific streams)加跨模态联合自注意力,统一整合运动感知、记忆决策和物理传感等异构能力。系统层面还包括:针对稀有操作场景合成训练数据、面向人类级操作的专用学习流程、以及面向实时部署的推理优化。MSAT 解决了现有 VLA 模型"通用性强但功能性窄"的痛点——它们擅长场景理解和语言条件泛化,但在需要运动感知、记忆和物理传感的复杂任务中表现不足。
  • 对比与影响:RLDX-1 在 ALLEX 高自由度人形机器人任务上以 86.8% vs ~40% 的差距碾压 π0.5 和 GR00T N1.6,这是目前公开报道中 VLA 模型在人形机器人控制上的最高成功率之一。与往期报道的 MolmoAct 2(87.1% Franka 零样本)相比,RLDX-1 侧重高自由度人形整机控制而非单臂操作,两者形成互补。该工作表明,通过架构创新而非单纯扩大数据规模,VLA 模型可以在复杂接触密集任务中实现质的飞跃。
  • 可复现性:技术报告发布于 arXiv;代码和模型权重是否开源尚未明确。
    来源:arXiv(https://arxiv.org/abs/2605.03269)

Genesis AI 发布 GENE-26.5:全栈机器人基础模型,展示烹饪、实验、魔方等人类级灵巧操作

  • 发生了什么:2026 年 5 月 6 日(5 月 7 日广泛报道),法国全栈机器人公司 Genesis AI 发布 GENE-26.5,一个专为机器人打造的 AI 基础模型,同时推出配套的人尺度灵巧机械手和数据采集手套,并发布视频展示此前机器人从未实现过的复杂操作任务。
  • 关键技术:GENE-26.5 的差异化在于"全栈"策略:(1) 灵巧机械手:在形态和功能上 1:1 复刻人手,配合带触觉电子皮肤的数据采集手套,实现人手→手套→机械手的 1:1:1 映射,硬件成本仅为传统方案的 1/100,数据采集效率提升最高 5 倍;(2) 数据引擎:除手套数据外,还利用人类佩戴摄像头的第一视角视频和互联网视频,因缩小了"具身差距"(embodiment gap),可更高效利用人类数据;(3) 高保真仿真系统:渲染引擎和物理引擎达到超写实级别,缩小 sim-to-real 差距,实现"AI 训练 AI"的自进化循环。
  • 演示能力:视频展示了 20 步烹饪(含单手打蛋、双手协调)、制作奶昔、高精度实验室操作(移液、液体转移)、线束整理、单手解魔方、单手同时抓取 4 个物体分类、以及人类级钢琴演奏。
  • 对比与影响:与 MolmoAct 2 和 RLDX-1 等纯软件 VLA 模型不同,Genesis AI 走的是"模型+硬件+数据"垂直整合路线,类似 Tesla Optimus 和 1X NEO 的策略。其数据手套方案若规模化部署,可能从根本上改变机器人训练数据的采集经济学。公司已获 Eclipse、Khosla Ventures、Bpifrance 等投资的 1.05 亿美元种子轮,前 Google CEO Eric Schmidt 和 AI 先驱 Daniela Rus 等为投资人。Genesis AI 表示即将推出首款通用机器人整机。
  • 可复现性:GENE-26.5 为商业产品,模型权重和硬件均未开源;演示视频已公开。
    来源:PRNewswire(https://www.prnewswire.com/news-releases/genesis-ai-unveils-gene-26-5--the-first-ai-brain-to-enable-robots-with-human-level-physical-manipulation-capabilities-302763638.html)、The Robot Report(https://www.therobotreport.com/genesis-ai-introduces-gene-foundation-model-more-dexterous-manipulation/)

AnyPos:任务无关的具身建模实现双臂操作跨任务泛化,成功率提升 30–40%

  • 发生了什么:2026 年 5 月 7 日,来自清华大学等机构的研究者在 arXiv 发布 AnyPos,提出任务无关的具身建模(task-agnostic embodiment modeling)方法,在微波炉操作、烤面包、叠衣服、浇花、刷盘子等双臂操作任务上,成功率较强基线提升 30–40%。
  • 关键技术:AnyPos 的核心思路是将"具身动态"(embodiment dynamics)从高层策略学习中解耦——通过大规模自动化探索生成覆盖整个工作空间的任务无关图像-动作对,再用逆向动力学学习具身表征。具体包括:解耦手臂与末端执行器运动、方向感知解码器以稳定分布偏移下的预测。该方法可与多种高层策略模型无缝耦合,实现跨任务、跨平台泛化。
  • 对比与影响:AnyPos 从数据角度解决机器人操作数据稀缺和具身绑定的根本问题。与依赖特定任务序列数据的方法不同,任务无关数据可跨任务复用,为"一次采集、多任务使用"提供了可行路径。该方法对双臂移动操作机器人的规模化数据采集和策略泛化具有直接价值。
  • 可复现性:论文发布于 arXiv;项目页面 https://embodiedfoundation.github.io/vidar_anypos。
    来源:arXiv(https://arxiv.org/abs/2507.12768)

Phone2Act:智能手机变身 6-DoF 遥操作控制器,VLA 数据采集成本大幅降低

  • 发生了什么:2026 年 5 月 5 日,研究者在 arXiv 发布 Phone2Act,将普通智能手机通过 Google ARCore 转化为 6-DoF 机器人控制器,在 Dobot CR5 实机上用 130 条采集数据微调 GR00T-N1.5,多阶段拾放任务成功率达 90%。
  • 关键技术:Phone2Act 基于模块化 ROS 2 架构,通过可互换的桥接节点将控制逻辑与硬件解耦,支持从工业协作臂到低成本双臂臂的多种平台,无需修改代码。Universal Recorder 同步多相机 RGB 流与机器人状态反馈,原生导出 LeRobot 数据集格式,消除后处理环节,可直接用于 VLA 微调。
  • 对比与影响:现有遥操作方案(VR 手柄、专用示教器)成本高且与特定平台绑定。Phone2Act 将数据采集门槛降至一部手机,对资源有限的研究团队和中小企业尤为实用。结合往期报道的 AhaRobot($1,000 双臂移动操作机器人),行业正在形成"低成本硬件+低成本数据采集"的完整链条。
  • 可复现性:论文发布于 arXiv;代码开源。
    来源:arXiv(https://arxiv.org/abs/2605.01948)

产品

Tutor Intelligence 启动美国最大机器人数据工厂 DF1:100 台 Sonny 半人形机器人组成训练飞轮

Tutor Intelligence Data Factory 1.png)

  • 发生了什么:2026 年 5 月初,波士顿初创公司 Tutor Intelligence 正式启动 Data Factory 1(DF1)——据称是美国最大的机器人数据工厂,部署 100 台自研 Sonny 半人形机器人,由远程人类"导师"(Tutors)通过 VR 遥操作进行大规模数据采集和策略训练。
  • 关键产品信息:DF1 的核心是一个"数据飞轮":(1) 人类导师通过 Proprioceptive Teleoperation(PTeleop) 远程操控 Sonny 执行任务并纠错;(2) 机器人自主执行时,导师在数分钟内对 rollout 进行评分,提供正/负反馈作为奖励监督;(3) 100 台机器人并行评估同一策略,将边缘案例的发现速度提升 100 倍——原本需 8 小时才能观察到的 corner case,在 DF1 中仅需 5 分钟。Tutor 同时发布了首个基于 DF1 数据训练的 VLA 模型 Ti0,采用"速度归一化"(velocity normalization)对齐不同遥操作者的演示速度,并通过人类干预和离线反馈进行后训练。
  • 对比与影响:DF1 的独特之处在于它不是仿真中的数据工厂,而是真实世界的机器人数据工厂。与 Genesis AI 的数据手套方案(在真实工作环境中采集)形成互补——前者侧重规模化遥操作纠错,后者侧重 1:1 技能迁移。Tutor 的 Cassie 机器人已在为美国中小工厂到财富 50 强企业执行制造和物流任务,Sonny 平台计划在未来数月内启动工业部署。DF1 标志着机器人基础模型训练正从"实验室手工采集"进入"工厂化量产数据"阶段。
  • 可复现性:Ti0 为商业模型;DF1 技术报告已公开。
    来源:Tutor Intelligence 官方博客(https://tutorintelligence.com/blog/building-a-100-robot-data-factory-toward-factory-ready-ai)、Manufacturing Dive(https://www.manufacturingdive.com/news/boston-startup-launches-largest-robot-data-factory-US-df1/819576/)

生态

Spirit AI 与博世中国达成战略合作:具身智能"通用大脑"加速工业落地

  • 发生了什么:2026 年 5 月 6 日,中国具身智能公司 Spirit AI(千寻智能) 与 博世中国 正式签署战略合作协议,双方将在机器人数据采集与模型训练、工业场景部署、核心零部件供应三个层面展开系统合作,共同推进"通用机器人大脑"的商业化。
  • 关键信息:Spirit AI 成立于 2024 年,专注构建机器人的"通用大脑",已在中国建立覆盖研发、制造和供应链的完整生态。根据协议,未来两年双方将依托博世在中国的工厂和物流中心等真实工业环境,进行深度数据采集和模型训练。博世中国战略发展副总裁兼机器人中心负责人刘敏表示,Spirit AI"在具身智能模型领域展现了领先的技术实力"。Spirit AI 联合创始人兼 CEO 韩峰涛称,博世的工业场景、全球供应链和渠道资源将"规模化扩展通用大脑架构的覆盖范围"。
  • 对比与影响:这是继往期报道的 Meta 收购 ARI 之后,具身智能领域的又一重大产业合作。与 Meta 通过收购进入赛道不同,Spirit AI 与博世的合作是"AI 模型公司+工业巨头"的典型范式——前者提供算法能力,后者提供场景、数据和供应链。博世作为全球最大的汽车零部件供应商和工业自动化巨头,其工厂和物流网络为具身智能模型提供了高质量的真实工业数据来源,这种合作模式可能成为具身智能商业化的主流路径之一。
  • 可复现性:商业合作;双方未披露具体财务条款。
    来源:Morningstar/PRNewswire(https://www.morningstar.com/news/pr-newswire/20260507cn54023/spirit-ai-and-bosch-partner-on-general-purpose-robot-universal-brain)、Gasgoo(https://autonews.gasgoo.com/articles/news/spirit-ai-and-bosch-china-sign-strategic-partnership-to-jointly-promote-large-scale-deployment-of-embodied-intelligence-2051992813577842689)

西安欧亚学院人形机器人表演失控拥抱学生,引发 AI 安全与监管讨论

机器人失控现场

  • 发生了什么:2026 年 4 月 23 日(5 月初持续发酵),西安欧亚大学运动会开幕式上,一台参与舞蹈表演的人形机器人突然偏离预定编排,转身拥抱身旁一名女生,现场工作人员迅速介入拉开机器人。视频在社交网络广泛传播,引发关于机器人是否产生"自主意识"以及人机交互安全的广泛讨论。
  • 关键信息:校方否认该动作为预先编排,称"机器人犯了错误",系 AI 程序故障。机器人由校友企业提供,事后已归还。企业方面将事故归因于现场多架无人机同时运行导致的信号干扰。重庆师范大学智能与认知实验室副主任高焕指出,事故更可能是运动控制异常或执行偏差,不应解读为机器人产生了自主意识;关键问题在于"为什么异常行为发生后机器人仍能接触到人"。
  • 对比与影响:该事件发生在人形机器人在中国校园、展会、电视演出等公共场所频繁亮相的背景下。往期报道的杭州具身智能地方法规(5 月 1 日实施)已探索建立机器人编码追溯体系,而此次事故恰好验证了安全监管的紧迫性。高焕建议,人机协作表演等开放场景应将机器人视为"具有固有机械运动风险的智能设备",需进行运动脚本测试、现场排练、设置安全距离、配备急停机制和人工监督。该事件可能加速中国在具身智能安全标准方面的立法和标准制定进程。
  • 可复现性:事件有视频记录和多方报道;机器人型号和具体企业未公开披露。
    来源:Global Times(https://www.globaltimes.cn/page/202604/1359787.shtml)、University World News(https://www.universityworldnews.com/post.php?story=20260430115733492)

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • 绿色 Spotify 标志与手持手机的黑色剪影Spotify 接收 AI 生成个人播客,音频平台开始承接 Agent 输出Daily · 5月7日
  • Genesis AI 机器人手操作魔方Genesis AI 展示全栈机器人系统,现实世界模型开始接受硬件闭环检验Daily · 5月6日
  • ChatGPT 中展示 Etsy 商品的应用界面Etsy 把原生购物应用放进 ChatGPT,Agent 商业开始连接真实商品目录Daily · 5月5日
  • Figure 03 robots on production lineFigure AI System 0 实现感知条件全身控制:零样本 sim-to-real 完成楼梯行走与崎岖地形导航Daily · 5月4日
  • Libra-VLA:粗到细双层 VLA 架构实现学习均衡,异步执行提升操控响应,获 ACL 2026 接收Libra-VLA:粗到细双层 VLA 架构实现学习均衡,异步执行提升操控响应,获 ACL 2026 接收Daily · 5月3日
  • 机器人手与人手相对竖起拇指Meta 收购机器人训练公司,现实世界 AI 竞争延伸到数据与运营链Daily · 5月2日
  • Meta 办公楼外墙上的蓝色 Meta 标志Meta Business AI 每周处理千万次对话,企业消息入口开始规模化Daily · 5月1日
  • Google Cloud 彩色云形标志特写Google Cloud 突破 200 亿美元,AI 基础设施开始接受容量与回报检验Daily · 4月30日
  • π0.7机器人操作咖啡机Physical Intelligence 发布 π₀.₇:具备涌现式组合泛化能力的通用机器人基础模型Daily · 4月29日
  • LARYBench概览图LARYBench:首次系统度量从人类视频学习的具身动作表征Daily · 4月28日
  • AgentPressureBench:编码智能体在用户压力下的「刷榜」行为检测AgentPressureBench:编码智能体在用户压力下的「刷榜」行为检测Daily · 4月25日
  • UniT框架示意图:人类示教到人形机器人零样本策略迁移UniT:从人类到人形机器人的统一物理语言框架Daily · 4月24日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS