现在开始撰写日报。
LARYBench:首次系统度量从人类视频学习的具身动作表征
- 发生了什么:2026年4月27日,美团正式发布LARYBench(Latent Action Representation Yielding Benchmark),一个用于系统评测隐式动作表征质量的标准化基准,覆盖超过100万段标注视频(总时长超1000小时)、151种动作类型、62万对图像和59.5万条运动轨迹,涵盖11种机器人形态。
- 关键技术:LARYBench从本体动作回归和语义动作分类两个粒度分别评测表征质量。本体动作用MSE回归末端执行器位姿,语义动作用分类准确率衡量动作理解。覆盖数据集包括CALVIN、VLABench、RoboCOIN和AgiBotWorld-Beta。评测发现:通用视觉模型DINOv3在四个数据集上平均MSE低至0.19,显著优于具身专项模型LAPA(平均MSE 0.97);语义级表征(V-JEPA-2、DINOv3)整体优于像素级表征(Wan2.2 VAE、FLUX.2-dev VAE)。
- 对比与影响:这是首个将动作表征质量与下游策略解耦的评测体系。核心结论是:有效的动作表征能在通用视觉预训练中自然涌现,而专门的隐式动作模型可能因数据规模有限面临表征坍缩。验证了从大规模人类视频学习跨形态动作表征的可行性,为VLA模型突破机器人数据瓶颈指明方向。
- 可复现性:数据集、代码和模型已全部开源(GitHub/ModelScope/HuggingFace)。
来源:美团技术团队(https://tech.meituan.com/2026/04/27/longcat-larybench.html)
学习增强型工业机器人自动化:电机产线5小时连续运行,良率99.4%
- 发生了什么:2026年4月24日,arXiv发表论文《Learning-augmented robotic automation for real-world manufacturing》,在真实电动马达产线上部署了融合学习控制器和神经3D安全监控的混合系统,实现了可变形线缆插入与焊接的自动化——此前为人工工序。
- 关键技术:系统只需每任务不到20分钟的真实数据训练,即实现了5小时10分钟连续运行,产出108台电机,无需物理围栏,产品级质检通过率99.4%。维持接近人工的节拍时间(takt time),同时降低焊点质量和循环周期的变异度。关键在于学习控制器具备适应环境变化的能力,神经3D安全监控则保障人机共线安全。
- 对比与影响:此前大多数学习型控制方案仍停留在实验室演示,无法确认是否能在流水线上稳定运行数小时。本研究首次用实际产线数据证明:学习增强型自动化可以在真实制造约束下达到工业级可靠性。论文作者指出这一成果为"将基于学习的方案推广到工业自动化提供了可行路径"。
- 可复现性:论文公开,代码未明确提及开源。
来源:arXiv(https://arxiv.org/abs/2604.22235)
QDTraj:基于质量-多样性算法的铰接物体操作轨迹基元生成
- 发生了什么:2026年4月27日,arXiv发布QDTraj,提出利用质量-多样性(Quality-Diversity)算法自动生成多样化的铰接物体操作轨迹基元,并通过仿真验证后在真实机器人上部署。
- 关键技术:QDTraj利用稀疏奖励探索生成一组多样且高性能的轨迹基元。在合页和滑轨两类铰接激活任务上,QDTraj至少产生5倍于对比方法的多样化轨迹。在PartNetMobility数据集的30种铰接物体上验证了泛化性,每任务平均生成704条不同轨迹。核心优势在于多样化的轨迹库使机器人能在实时约束和意外变化下选择最优解。
- 对比与影响:传统方法生成单条专家轨迹,缺乏应对环境变化的弹性。QDTraj的多样化轨迹库为服务机器人在开放环境中自主操作铰接物体提供了更鲁棒的基础方案。
- 可复现性:代码已公开(https://kappel.web.isir.upmc.fr/trajectory_primitive_website)。
来源:arXiv(https://arxiv.org/abs/2604.22551)
Wiggle and Go!:零样本动态绳索操作的系统辨识框架
- 发生了什么:2026年4月27日,arXiv发布Wiggle and Go!,提出一种两阶段系统辨识框架,使机器人实现零样本(zero-shot)动态绳索操作,无需真实世界数据集或迭代尝试。
- 关键技术:框架包含两个模块——系统辨识模块通过观察绳索运动预测描述性物理参数(如刚性、阻尼),再将参数输入优化模块进行目标条件动作预测,直接零样本在真实环境中执行。在3D目标击打任务中,使用绳索系统参数的平均精度达3.55 cm,而不使用参数时为15.34 cm。预测绳索与真实绳索的傅里叶频率Pearson相关系数达0.95。
- 对比与影响:传统动态绳索操作需要大量真实数据集或迭代试错。Wiggle and Go!的任务无关系统辨识模块可在不同操作任务间无缝切换,单一模型支持多样化的操作策略,是柔性物体操作领域的显著进展。
- 可复现性:项目网站已公开(https://wiggleandgo.github.io/),代码未明确提及。
来源:arXiv(https://arxiv.org/abs/2604.22102)
MSDP:多感官自监督预训练框架实现接触丰富操作高效强化学习
- 发生了什么:2026年4月27日(更新版),arXiv发布MultiSensory Dynamic Pretraining(MSDP),提出基于掩码自编码的多感官表示学习框架,使强化学习智能体在接触丰富的机器人操作任务中实现加速学习和鲁棒性能。
- 关键技术:MSDP训练基于Transformer的编码器从部分传感器嵌入中重构多感官观测,实现跨模态预测与传感器融合。下游采用非对称架构——评论家(critic)通过交叉注意力从冻结的嵌入中提取动态任务特征,演员(actor)接收稳定池化表征指导动作。在多种接触丰富操作任务的仿真与真机评估中,仅需6,000次在线交互即在真实机器人上达到高成功率,且对传感器噪声和物体动力学变化具有强鲁棒性。
- 对比与影响:强化学习智能体在多感官环境中难以协同利用视觉、力觉和本体感觉,尤其在感知噪声下表现退化。MSDP用自监督预训练实现多模态融合,大幅降低了接触丰富操作任务对在线交互样本量的需求。
- 可复现性:项目网站已公开(https://msdp-pearl.github.io/)。
来源:arXiv(https://arxiv.org/abs/2511.14427)
TRR:消费级EMG解码高维手指运动,实现机器人手实时控制
- 发生了什么:2026年4月24日,arXiv发布Temporal Riemannian Regressor(TRR),提出端到端框架,仅用消费级8通道EMG臂带和网络摄像头即可连续解码15个手指关节角度,并在Raspberry Pi 5上以近10次/秒的速率实时控制机器人手。
- 关键技术:框架包含自动同步流程和EMG Finger-Kinematics(EMG-FK)数据集——10小时、20名参与者的同步EMG与15维手指运动数据。TRR是基于GRU的轻量级模型,使用时序多频带黎曼协方差特征解码手指运动。在EMG-FK和公共emg2pose基准上均超越SOTA:EMG-FK上受试者内平均绝对误差9.79°±1.48,跨受试者16.71°±3.97。推理速度比现有方法快约一个数量级。
- 对比与影响:现有方法大多依赖分类式ML,限制可控自由度。本工作仅用消费级硬件实现了连续高维手指运动解码,大幅降低了EMG控制的准入门槛,为假肢、AR/XR接口和遥操作提供了可行方案。
- 可复现性:数据和代码已公开(GitHub、Zenodo),论文含2个演示视频链接。
来源:arXiv(https://arxiv.org/abs/2604.22499)
LeHome:面向家庭场景可变形物体操作的仿真环境
- 发生了什么:2026年4月27日,arXiv发布LeHome,一个专注于家庭场景可变形物体操作的综合仿真环境,覆盖衣物、食品等多种可变形物体类别,强调低成本机器人作为核心支撑平台。
- 关键技术:LeHome提供高保真动力学和真实交互,弥补现有仿真器在可变形物体模拟上的不足。支持多种机器人形态,以低成本机器人为核心关注点,允许在资源受限的硬件上进行端到端任务评估。覆盖可变形物体的广泛种类(衣物、食品等),为家庭机器人研究提供可扩展的测试平台。
- 对比与影响:家庭场景是可变形物体操作最富挑战也最具应用前景的领域,但现有仿真器对可变形物体的支撑不足。LeHome填补了这一空白,尤其关注低成本机器人形态,有望降低家庭机器人研究的硬件门槛。
- 可复现性:项目网站已公开(https://lehome-web.github.io/)。
来源:arXiv(https://arxiv.org/abs/2604.22363)
LLM驱动的机器人闭环自主学习框架
- 发生了什么:2026年4月27日,arXiv发布一项研究,提出LLM驱动的闭环自主学习框架,使机器人能在开放环境中自主处理未被预定义覆盖的任务,并逐步将经验转化为可重用的本地知识。
- 关键技术:框架首先检索本地方法库判断是否有已有方案;若无,则触发LLM作为高层推理组件进行任务分析、候选模型选择、数据采集规划和执行策略组织。机器人通过自我执行和主动观察两种方式学习,进行准实时训练与调整,将验证后的结果存入本地方法库。实验表明:重复任务中平均总执行时间从7.78s降至6.78s,每任务平均LLM调用次数从1.0降至0.2。
- 对比与影响:现有方法遇未见任务时频繁依赖外部LLM交互,且执行经验不可积累。本框架让机器人从执行和观察中逐步积累可重用的本地能力,减少对LLM的依赖,是迈向持续自主学习机器人的重要一步。
- 可复现性:论文公开,代码开源状态未明确提及。
来源:arXiv(https://arxiv.org/abs/2604.22199)