UniT:从人类到人形机器人的统一物理语言框架
2026年4月24日 · 2026-04-24
技术进展
UniT:从人类到人形机器人的统一物理语言框架
- 发生了什么:2026年4月21日,XPENG Robotics联合清华大学、香港大学在arXiv发布UniT(Unified Latent Action Tokenizer via Visual Anchoring),提出通过视觉锚定建立跨形态统一物理语言,同时支持策略学习和世界建模。
- 关键技术:UniT采用三分支交叉重构机制——动作预测视觉以锚定运动学到物理结果,视觉重构动作以过滤无关干扰,融合分支将两种纯化模态编码到共享离散潜空间。在策略学习(VLA-UniT)上,通过预测统一token实现从人类数据到人形机器人的零样本任务迁移;在世界建模(WM-UniT)上,以统一token为条件实现人→人形机器人动作迁移。在RoboCasa GR1基准上,VLA-UniT以66.7%总成功率超越FLARE达11.7个百分点;在真实IRON-R01-1.11人形机器人上,加入人类数据共训练后Pick & Place达78%、Pouring达75%,并展示了零样本任务迁移。
- 对比与影响:人形机器人基础模型受限于机器人数据稀缺,但人类数据丰富。UniT的核心洞察是异构运动学共享一致的视觉物理后果,通过交叉重构提取形态无关的物理意图。t-SNE证实人类与人形机器人特征收敛到共享流形。代码已开源(xpeng-robotics/UniT)。
- 可复现性:代码和论文均已公开。
来源:arXiv(https://arxiv.org/abs/2604.19734)
EmbodiedMidtrain:桥接视觉语言模型与视觉语言行动模型的中间训练方法
- 发生了什么:2026年4月23日,arXiv发布论文《EmbodiedMidtrain》,提出一种在VLM预训练与VLA微调之间插入中间训练阶段的方法。
- 关键技术:研究者先刻画了VLM与VLA的数据分布差距——VLA数据占据紧凑区域且高度分离于VLM分布。EmbodiedMidtrain用轻量级可学习邻近性估计器从大规模VLM池中筛选最VLA对齐的候选,然后进行中间训练。在三个机器人操作基准上,不同VLM骨干的VLA性能获得一致提升,与更大规模模型和更大预算的专家VLA相竞争。增益从训练最早期出现并持续扩大。
- 对比与影响:多数VLA直接使用现成VLM而未经具身适配。EmbodiedMidtrain是低成本高收益的标准化预适配流程。代码、数据和模型将开源。
- 可复现性:论文承诺发布所有代码、数据和模型。
来源:arXiv(https://arxiv.org/abs/2604.20012)
VTouch++:基于视觉触觉增强的双臂操作多模态数据集
- 发生了什么:2026年4月22日,arXiv发布论文《VTouch++》,提出VTOUCH数据集,利用基于视觉的触觉传感为双臂操作提供高质量物理交互信号。
- 关键技术:采用矩阵式任务设计实现系统化学习,通过自动化数据采集管道覆盖真实场景。在跨模态检索和真实机器人评估上验证,并展示了多机器人、多策略、多任务泛化能力。
- 对比与影响:双臂接触丰富操作因缺乏高质量物理交互信号数据集而进展缓慢。VTOUCH填补空白,自动化采集管道可扩展至大规模数据生成。
- 可复现性:论文未明确提及代码发布。
来源:arXiv(https://arxiv.org/abs/2604.20444)
HELM:面向VLA长时程操作的长时记忆与恢复框架
- 发生了什么:2026年4月20日,arXiv发布论文《HELM》,揭示VLA模型在长时程操作中的系统性失败模式并提出解决方案。
- 关键技术:HELM是模型无关框架,含三个学习组件:情景记忆模块(EMM)通过CLIP索引关键帧检索历史;状态验证器(SV)在执行前预测动作失败;框架控制器(HC)执行记忆回滚与重规划。在LIBERO-LONG上,HELM将OpenVLA成功率从58.4%提升至81.5%(+23.1pp),而单纯延长上下文窗口至H=32仅提升5.4pp。
- 对比与影响:揭示了三个结构性失败模式(记忆缺口、验证缺口、恢复缺口),为VLA长时程部署提供了可行方案。
- 可复现性:附带LIBERO-Recovery协议,未明确代码是否开源。
来源:arXiv(https://arxiv.org/abs/2604.18791)
产品
Sony AI乒乓球机器人Ace登Nature封面,首次击败人类职业选手

Tesla Q1 2026财报:聚焦Optimus机器人,开支因AI和机器人大幅增长
生态
Tesla披露20亿美元AI硬件公司收购协议
AGIBOT发布新代具身AI机器人及基础模型,宣布2026为规模化部署元年
