ICRA 2026揭晓最佳论文奖:FP3以3D相机姿态驱动视角不变策略学习,获机器人学习最佳论文
- 6月4日,ICRA 2026在维也纳举行颁奖午宴,揭晓12项最佳会议论文奖。其中机器人学习最佳论文奖(Best Paper Award on Robot Learning)授予《FP3: A 3D Foundation Policy for Robotic Manipulation》(Yang Rujia、Chen Geng、Wen Chuan、Gao Yang),该工作证明将3D相机姿态信息融入策略学习,可使机器人在不同相机视角下保持一致的操控表现,强化了3D几何理解在机器人操控中的基础地位。
- 其他获奖亮点包括:自动化最佳论文奖授予《IMR-LLM: Industrial Multi-Robot Task Planning and Program Generation using Large Language Models》(Su Xiangyu等),利用LLM实现工业多机器人任务规划;另一篇自动化最佳论文入围作品《ETac》提出了轻量高效触觉仿真框架用于灵巧操控学习。
- 可复现性:FP3项目页面公开(fp3.github.io),论文在arXiv(2503.08950)可查;ICRA 2026全部获奖论文均通过IEEE Xplore开放获取。
- 行业意义:ICRA 2026(6月1-5日,约8000人参会)是本年度机器人学术界的风向标。FP3获奖传递了一个明确信号:在VLA(Vision-Language-Action)模型大行其道的当下,学术界主流仍认为3D空间理解是机器人策略泛化的必要条件——这与部分工业界"纯2D视觉+语言即可"的路线形成方法论张力。
来源:ICRA 2026官网(https://2026.ieee-icra.org/awards) / Digg(https://digg.com/ai/6kck8yq4)
SCOPE:面向机器人边缘部署的实时自然语言相机智能体,19组规划-感知模型组合横向评测
- 6月3日,arXiv发表SCOPE论文(Nikolaj Hindsbo等),提出一个面向PTZ(云台变焦)相机控制与视觉场景理解的模块化智能体,全部感知、规划、控制均在边缘设备本地执行,支持自然语言指令。
- 核心贡献:发布一个536任务基准测试集,覆盖QA、单步/多步指令、计数、空间推理、描述和OCR;在Blender仿真环境和实体PTZ相机上完成sim-to-real验证。评测19组"Qwen3 SLM + Moondream/Qwen VLM"组合后发现:更强的SLM显著减少幻觉并改善工具路由;一旦SLM足够强,感知成为性能瓶颈;MoE模型在延迟和内存占用上匹配或超越密集模型,量化带来额外效率增益。
- 可复现性:基准数据集已公开,论文在arXiv(2606.02951)可获取。
- 行业意义:SCOPE是"语言驱动机器人智能体在边缘运行"的实用参考设计——它回答了"小模型+量化+边缘部署"能否在真实机器人任务中可靠运行的问题。对于仓储巡检、安防监控等需要低成本、实时响应的机器人感知场景有直接工程参考价值。
来源:arXiv(https://arxiv.org/abs/2606.02951)
PF-OPSD:世界模型与语言模型互补推理框架,在物理预测基准上提升超10%
- 6月3日,arXiv发表论文《World Models Meet Language Models》(Zhou Yucheng等),提出**PF-OPSD(Privileged-Future On-Policy Self-Distillation)**方法,让模型学习何时调用、如何验证、怎样整合视觉未来仿真与抽象推理。
- 方法要点:训练时使用真实未来视频作为教师侧特权信息来评估策略轨迹,但部署时的学生模型在测试阶段完全不接触真实未来。在两个人工验证基准上(VRQABench空间前瞻推理、OpenWorldQA开放域物理预测),PF-OPSD分别超越基线10.6%和10.9%,同时提升对噪声/冲突rollout的鲁棒性。
- 可复现性:代码与数据集已在GitHub开放(github.com/yczhou001/PF-OPSD)。
- 行业意义:该工作直接回应了具身智能领域的一个核心矛盾——世界模型生成的视觉rollout虽然"看起来合理"但可能"任务上错误"。PF-OPSD提供了在训练阶段利用特权信息教会模型辨别rollout可信度的方案,对机器人策略学习中的数据高效利用有参考价值。
来源:arXiv(https://arxiv.org/abs/2606.03603)
