AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

LARYBench:首次系统度量从人类视频学习的具身动作表征

2026年4月28日 · 2026-04-28

技术进展

现在开始撰写日报。

LARYBench:首次系统度量从人类视频学习的具身动作表征

  • 发生了什么:2026年4月27日,美团正式发布LARYBench(Latent Action Representation Yielding Benchmark),一个用于系统评测隐式动作表征质量的标准化基准,覆盖超过100万段标注视频(总时长超1000小时)、151种动作类型、62万对图像和59.5万条运动轨迹,涵盖11种机器人形态。
  • 关键技术:LARYBench从本体动作回归和语义动作分类两个粒度分别评测表征质量。本体动作用MSE回归末端执行器位姿,语义动作用分类准确率衡量动作理解。覆盖数据集包括CALVIN、VLABench、RoboCOIN和AgiBotWorld-Beta。评测发现:通用视觉模型DINOv3在四个数据集上平均MSE低至0.19,显著优于具身专项模型LAPA(平均MSE 0.97);语义级表征(V-JEPA-2、DINOv3)整体优于像素级表征(Wan2.2 VAE、FLUX.2-dev VAE)。
  • 对比与影响:这是首个将动作表征质量与下游策略解耦的评测体系。核心结论是:有效的动作表征能在通用视觉预训练中自然涌现,而专门的隐式动作模型可能因数据规模有限面临表征坍缩。验证了从大规模人类视频学习跨形态动作表征的可行性,为VLA模型突破机器人数据瓶颈指明方向。
  • 可复现性:数据集、代码和模型已全部开源(GitHub/ModelScope/HuggingFace)。
    来源:美团技术团队(https://tech.meituan.com/2026/04/27/longcat-larybench.html)

学习增强型工业机器人自动化:电机产线5小时连续运行,良率99.4%

  • 发生了什么:2026年4月24日,arXiv发表论文《Learning-augmented robotic automation for real-world manufacturing》,在真实电动马达产线上部署了融合学习控制器和神经3D安全监控的混合系统,实现了可变形线缆插入与焊接的自动化——此前为人工工序。
  • 关键技术:系统只需每任务不到20分钟的真实数据训练,即实现了5小时10分钟连续运行,产出108台电机,无需物理围栏,产品级质检通过率99.4%。维持接近人工的节拍时间(takt time),同时降低焊点质量和循环周期的变异度。关键在于学习控制器具备适应环境变化的能力,神经3D安全监控则保障人机共线安全。
  • 对比与影响:此前大多数学习型控制方案仍停留在实验室演示,无法确认是否能在流水线上稳定运行数小时。本研究首次用实际产线数据证明:学习增强型自动化可以在真实制造约束下达到工业级可靠性。论文作者指出这一成果为"将基于学习的方案推广到工业自动化提供了可行路径"。
  • 可复现性:论文公开,代码未明确提及开源。
    来源:arXiv(https://arxiv.org/abs/2604.22235)

QDTraj:基于质量-多样性算法的铰接物体操作轨迹基元生成

  • 发生了什么:2026年4月27日,arXiv发布QDTraj,提出利用质量-多样性(Quality-Diversity)算法自动生成多样化的铰接物体操作轨迹基元,并通过仿真验证后在真实机器人上部署。
  • 关键技术:QDTraj利用稀疏奖励探索生成一组多样且高性能的轨迹基元。在合页和滑轨两类铰接激活任务上,QDTraj至少产生5倍于对比方法的多样化轨迹。在PartNetMobility数据集的30种铰接物体上验证了泛化性,每任务平均生成704条不同轨迹。核心优势在于多样化的轨迹库使机器人能在实时约束和意外变化下选择最优解。
  • 对比与影响:传统方法生成单条专家轨迹,缺乏应对环境变化的弹性。QDTraj的多样化轨迹库为服务机器人在开放环境中自主操作铰接物体提供了更鲁棒的基础方案。
  • 可复现性:代码已公开(https://kappel.web.isir.upmc.fr/trajectory_primitive_website)。
    来源:arXiv(https://arxiv.org/abs/2604.22551)

Wiggle and Go!:零样本动态绳索操作的系统辨识框架

  • 发生了什么:2026年4月27日,arXiv发布Wiggle and Go!,提出一种两阶段系统辨识框架,使机器人实现零样本(zero-shot)动态绳索操作,无需真实世界数据集或迭代尝试。
  • 关键技术:框架包含两个模块——系统辨识模块通过观察绳索运动预测描述性物理参数(如刚性、阻尼),再将参数输入优化模块进行目标条件动作预测,直接零样本在真实环境中执行。在3D目标击打任务中,使用绳索系统参数的平均精度达3.55 cm,而不使用参数时为15.34 cm。预测绳索与真实绳索的傅里叶频率Pearson相关系数达0.95。
  • 对比与影响:传统动态绳索操作需要大量真实数据集或迭代试错。Wiggle and Go!的任务无关系统辨识模块可在不同操作任务间无缝切换,单一模型支持多样化的操作策略,是柔性物体操作领域的显著进展。
  • 可复现性:项目网站已公开(https://wiggleandgo.github.io/),代码未明确提及。
    来源:arXiv(https://arxiv.org/abs/2604.22102)

MSDP:多感官自监督预训练框架实现接触丰富操作高效强化学习

  • 发生了什么:2026年4月27日(更新版),arXiv发布MultiSensory Dynamic Pretraining(MSDP),提出基于掩码自编码的多感官表示学习框架,使强化学习智能体在接触丰富的机器人操作任务中实现加速学习和鲁棒性能。
  • 关键技术:MSDP训练基于Transformer的编码器从部分传感器嵌入中重构多感官观测,实现跨模态预测与传感器融合。下游采用非对称架构——评论家(critic)通过交叉注意力从冻结的嵌入中提取动态任务特征,演员(actor)接收稳定池化表征指导动作。在多种接触丰富操作任务的仿真与真机评估中,仅需6,000次在线交互即在真实机器人上达到高成功率,且对传感器噪声和物体动力学变化具有强鲁棒性。
  • 对比与影响:强化学习智能体在多感官环境中难以协同利用视觉、力觉和本体感觉,尤其在感知噪声下表现退化。MSDP用自监督预训练实现多模态融合,大幅降低了接触丰富操作任务对在线交互样本量的需求。
  • 可复现性:项目网站已公开(https://msdp-pearl.github.io/)。
    来源:arXiv(https://arxiv.org/abs/2511.14427)

TRR:消费级EMG解码高维手指运动,实现机器人手实时控制

  • 发生了什么:2026年4月24日,arXiv发布Temporal Riemannian Regressor(TRR),提出端到端框架,仅用消费级8通道EMG臂带和网络摄像头即可连续解码15个手指关节角度,并在Raspberry Pi 5上以近10次/秒的速率实时控制机器人手。
  • 关键技术:框架包含自动同步流程和EMG Finger-Kinematics(EMG-FK)数据集——10小时、20名参与者的同步EMG与15维手指运动数据。TRR是基于GRU的轻量级模型,使用时序多频带黎曼协方差特征解码手指运动。在EMG-FK和公共emg2pose基准上均超越SOTA:EMG-FK上受试者内平均绝对误差9.79°±1.48,跨受试者16.71°±3.97。推理速度比现有方法快约一个数量级。
  • 对比与影响:现有方法大多依赖分类式ML,限制可控自由度。本工作仅用消费级硬件实现了连续高维手指运动解码,大幅降低了EMG控制的准入门槛,为假肢、AR/XR接口和遥操作提供了可行方案。
  • 可复现性:数据和代码已公开(GitHub、Zenodo),论文含2个演示视频链接。
    来源:arXiv(https://arxiv.org/abs/2604.22499)

LeHome:面向家庭场景可变形物体操作的仿真环境

  • 发生了什么:2026年4月27日,arXiv发布LeHome,一个专注于家庭场景可变形物体操作的综合仿真环境,覆盖衣物、食品等多种可变形物体类别,强调低成本机器人作为核心支撑平台。
  • 关键技术:LeHome提供高保真动力学和真实交互,弥补现有仿真器在可变形物体模拟上的不足。支持多种机器人形态,以低成本机器人为核心关注点,允许在资源受限的硬件上进行端到端任务评估。覆盖可变形物体的广泛种类(衣物、食品等),为家庭机器人研究提供可扩展的测试平台。
  • 对比与影响:家庭场景是可变形物体操作最富挑战也最具应用前景的领域,但现有仿真器对可变形物体的支撑不足。LeHome填补了这一空白,尤其关注低成本机器人形态,有望降低家庭机器人研究的硬件门槛。
  • 可复现性:项目网站已公开(https://lehome-web.github.io/)。
    来源:arXiv(https://arxiv.org/abs/2604.22363)

LLM驱动的机器人闭环自主学习框架

  • 发生了什么:2026年4月27日,arXiv发布一项研究,提出LLM驱动的闭环自主学习框架,使机器人能在开放环境中自主处理未被预定义覆盖的任务,并逐步将经验转化为可重用的本地知识。
  • 关键技术:框架首先检索本地方法库判断是否有已有方案;若无,则触发LLM作为高层推理组件进行任务分析、候选模型选择、数据采集规划和执行策略组织。机器人通过自我执行和主动观察两种方式学习,进行准实时训练与调整,将验证后的结果存入本地方法库。实验表明:重复任务中平均总执行时间从7.78s降至6.78s,每任务平均LLM调用次数从1.0降至0.2。
  • 对比与影响:现有方法遇未见任务时频繁依赖外部LLM交互,且执行经验不可积累。本框架让机器人从执行和观察中逐步积累可重用的本地能力,减少对LLM的依赖,是迈向持续自主学习机器人的重要一步。
  • 可复现性:论文公开,代码开源状态未明确提及。
    来源:arXiv(https://arxiv.org/abs/2604.22199)

产品

鸿海(Foxconn)在休斯顿工厂部署人形机器人组装NVIDIA GB300 AI服务器

  • 发生了什么:据2026年GTC大会期间披露,全球最大电子制造商鸿海(Foxconn)已在其休斯顿AI服务器工厂部署"不到10台"轮式人形机器人,用于支持NVIDIA GB300 AI服务器的装配线工作。
  • 关键信息:Foxconn高级机器人工程师Wei-Jiun Lee在GTC 2026上确认,机器人在4月中旬开始上线,承担部件转运、螺丝拧紧和物料处理等结构化重复任务。机器人采用轮式底盘形态,由NVIDIA Isaac GR00T平台驱动。这是人形机器人首次用于NVIDIA产品的制造,也是Foxconn 50年历史上首次在产线上部署人形机器人。据自动化公司Solomon's的销售运营总监Joseph Tsa估计,人形机器人要达到完全功能化可能需要约3年时间,瓶颈在于硬件限制和仿真与现实物理之间的差距。
  • 对比与影响:这是人形机器人在高端电子制造领域从"演示"走向"产线"的标志性节点。虽然在台数上仅为试水,但休斯顿工厂从设计之初就为人形机器人预留了空间,暗示大规模推广路径正在铺平。值得注意的是,中国国家电网此前也披露了500台人形机器人用于高压操作的计划,中美在人形机器人工业落地上正在加速赛跑。
    来源:Instrumental/Build Better(https://instrumental.com/resources/build-better-news/foxconns-humanoid-push-will-start-small-in-houston-engineer-says/)

生态

杭州发布具身AI机器人产业链强链补链行动计划(2026-2027)

  • 发生了什么:杭州正式发布《杭州市具身智能机器人产业链强链补链行动计划(2026-2027)》,设定清晰的"1134"目标,力争将杭州打造为全球具身智能机器人创新和产业高地。
  • 关键信息:核心目标包括——产品矩阵:开发3款以上量产的仿人机器人型号和5款以上仿生机器人型号;产业集群:推动滨江区升级为国家级具身智能机器人中小企业特色集群;三类服务平台:国家级具身智能产业应用试点基地、仿人机器人中试验证和应用推广中心、具身智能机器人制造业创新中心;四大指标:新增一批市场主体、实施15项以上重大科技项目并主导2-3项国际/国家标准、建设30个以上示范应用场景、2027年全市具身智能机器人主机企业总产出超200亿元、产业链总产出超500亿元。计划还部署了7个区的差异化平台布局,覆盖西湖、余杭、滨江、上城、萧山、钱塘和临平。
  • 对比与影响:这是中国城市级首个系统化具身智能机器人产业政策,将政策从"鼓励创新"推向"量化牵引"。相比此前各地泛泛的支持政策,杭州计划首次明确区分了产业产出目标、标准主导权和应用场景数量,标志着中国具身智能产业进入"地方政府量化竞争"阶段。
    来源:Gasgoo(https://autonews.gasgoo.com/articles/news/hangzhou-launches-initiative-to-bolster-embodied-ai-robotics-supply-chain-2008815483111649281)

POLITICO:美国被敦促加快国家机器人战略以应对全球竞争

  • 发生了什么:2026年4月23日,POLITICO报道称产业领袖和立法者正在美国国会推动一项国家机器人战略,警告美国在AI驱动的制造业中面临落后风险。
  • 关键信息:美国制造业联盟(Alliance for American Manufacturing)主席Scott Paul在国会听证会上表示,美国在制造业方面"危险地落后",其他国家正大力投资机器人产业。自动化结合AI现在是恢复竞争力和经济安全的关键。POLITICO在4月23日的另一篇报道《Tuning up the robotics supply chain》进一步指出,随着AI从聊天机器人向物理环境迁移,机器人产业警告美国供应链"准备不足",尤其在核心零部件如减速器、伺服电机和高精度传感器方面依赖进口。
  • 对比与影响:与中国杭州同日发布的具身AI供应链计划形成鲜明对比——中国已经有城市层面的量化政策,美国仍在国会辩论阶段。这种节奏差可能影响两国在物理AI产业化的时间窗口竞争。
    来源:POLITICO(https://www.politico.com/newsletters/digital-future-daily/2026/04/23/tuning-up-the-robotics-supply-chain-00889228)、POLITICO Pro(https://subscriber.politicopro.com/article/2026/04/us-urged-to-move-faster-on-robotics-as-global-race-heats-up-00883551)

《具身AI最大的风险是治理滞后》论文发表

  • 发生了什么:2026年4月27日,arXiv发表论文《The Biggest Risk of Embodied AI is Governance Lag》,作者刘绍山(Shaoshan Liu)指出具身AI的核心风险不是就业替代,而是治理滞后——公共机构无法跟上技术通过实体经济扩散的速度。
  • 关键信息:论文认为治理滞后表现为三种形式:观测滞后(observational)——监管者无法及时观测到技术部署的范围和影响;制度滞后(institutional)——现有制度框架无法适应物理AI的新特性;分配滞后(distributive)——技术收益的分配机制缺失。随着可复用机器人平台与日益通用的AI模型结合,具身AI可能在制造、物流、照护和基础设施领域比治理系统更快规模化。
  • 对比与影响:当前大多数关于具身AI的讨论集中于技术突破或就业替代,本文首次系统化地提出治理层面的结构性风险。与上述杭州政策和美国国会讨论相互印证——不同治理体系正在以不同速度响应同一挑战。
    来源:arXiv(https://arxiv.org/abs/2604.21938)

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • AgentPressureBench:编码智能体在用户压力下的「刷榜」行为检测AgentPressureBench:编码智能体在用户压力下的「刷榜」行为检测Daily · 4月25日
  • UniT框架示意图:人类示教到人形机器人零样本策略迁移UniT:从人类到人形机器人的统一物理语言框架Daily · 4月24日
  • 荣耀“闪电”机器人在比赛中RoboWM-Bench:面向机器人操作的世界模型评估基准Daily · 4月23日
  • CaTS-Bench:时间序列字幕生成新基准,含1746条人工重写标注CaTS-Bench:时间序列字幕生成新基准,含1746条人工重写标注Daily · 4月22日
  • OCBENCH:大型语言模型过度服从性跨模型基准OCBENCH:大型语言模型过度服从性跨模型基准Daily · 4月21日
  • CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集Daily · 4月20日
  • DogReID‑1553:大规模犬只重识别视频数据集与基准测试Daily · 4月19日
  • 斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%Daily · 4月18日
  • Claude Design 名称与橙色 Claude 标志Claude Design 把快速视觉生成带入可编辑工作流Daily · 4月17日
  • GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限Daily · 4月16日
  • Adobe Firefly 创意工具的彩色视觉画面Adobe 让 Firefly 助手跨应用执行,创意 AI 进入工作流编排Daily · 4月15日
  • OpenAI 标志叠在蓝色二进制数字背景前OpenAI 收购 Hiro,通用助手开始进入高信任个人财务场景Daily · 4月14日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS