AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

UniT:从人类到人形机器人的统一物理语言框架

2026年4月24日 · 2026-04-24

技术进展

UniT:从人类到人形机器人的统一物理语言框架

  • 发生了什么:2026年4月21日,XPENG Robotics联合清华大学、香港大学在arXiv发布UniT(Unified Latent Action Tokenizer via Visual Anchoring),提出通过视觉锚定建立跨形态统一物理语言,同时支持策略学习和世界建模。
  • 关键技术:UniT采用三分支交叉重构机制——动作预测视觉以锚定运动学到物理结果,视觉重构动作以过滤无关干扰,融合分支将两种纯化模态编码到共享离散潜空间。在策略学习(VLA-UniT)上,通过预测统一token实现从人类数据到人形机器人的零样本任务迁移;在世界建模(WM-UniT)上,以统一token为条件实现人→人形机器人动作迁移。在RoboCasa GR1基准上,VLA-UniT以66.7%总成功率超越FLARE达11.7个百分点;在真实IRON-R01-1.11人形机器人上,加入人类数据共训练后Pick & Place达78%、Pouring达75%,并展示了零样本任务迁移。
  • 对比与影响:人形机器人基础模型受限于机器人数据稀缺,但人类数据丰富。UniT的核心洞察是异构运动学共享一致的视觉物理后果,通过交叉重构提取形态无关的物理意图。t-SNE证实人类与人形机器人特征收敛到共享流形。代码已开源(xpeng-robotics/UniT)。
  • 可复现性:代码和论文均已公开。
    来源:arXiv(https://arxiv.org/abs/2604.19734)

EmbodiedMidtrain:桥接视觉语言模型与视觉语言行动模型的中间训练方法

  • 发生了什么:2026年4月23日,arXiv发布论文《EmbodiedMidtrain》,提出一种在VLM预训练与VLA微调之间插入中间训练阶段的方法。
  • 关键技术:研究者先刻画了VLM与VLA的数据分布差距——VLA数据占据紧凑区域且高度分离于VLM分布。EmbodiedMidtrain用轻量级可学习邻近性估计器从大规模VLM池中筛选最VLA对齐的候选,然后进行中间训练。在三个机器人操作基准上,不同VLM骨干的VLA性能获得一致提升,与更大规模模型和更大预算的专家VLA相竞争。增益从训练最早期出现并持续扩大。
  • 对比与影响:多数VLA直接使用现成VLM而未经具身适配。EmbodiedMidtrain是低成本高收益的标准化预适配流程。代码、数据和模型将开源。
  • 可复现性:论文承诺发布所有代码、数据和模型。
    来源:arXiv(https://arxiv.org/abs/2604.20012)

VTouch++:基于视觉触觉增强的双臂操作多模态数据集

  • 发生了什么:2026年4月22日,arXiv发布论文《VTouch++》,提出VTOUCH数据集,利用基于视觉的触觉传感为双臂操作提供高质量物理交互信号。
  • 关键技术:采用矩阵式任务设计实现系统化学习,通过自动化数据采集管道覆盖真实场景。在跨模态检索和真实机器人评估上验证,并展示了多机器人、多策略、多任务泛化能力。
  • 对比与影响:双臂接触丰富操作因缺乏高质量物理交互信号数据集而进展缓慢。VTOUCH填补空白,自动化采集管道可扩展至大规模数据生成。
  • 可复现性:论文未明确提及代码发布。
    来源:arXiv(https://arxiv.org/abs/2604.20444)

HELM:面向VLA长时程操作的长时记忆与恢复框架

  • 发生了什么:2026年4月20日,arXiv发布论文《HELM》,揭示VLA模型在长时程操作中的系统性失败模式并提出解决方案。
  • 关键技术:HELM是模型无关框架,含三个学习组件:情景记忆模块(EMM)通过CLIP索引关键帧检索历史;状态验证器(SV)在执行前预测动作失败;框架控制器(HC)执行记忆回滚与重规划。在LIBERO-LONG上,HELM将OpenVLA成功率从58.4%提升至81.5%(+23.1pp),而单纯延长上下文窗口至H=32仅提升5.4pp。
  • 对比与影响:揭示了三个结构性失败模式(记忆缺口、验证缺口、恢复缺口),为VLA长时程部署提供了可行方案。
  • 可复现性:附带LIBERO-Recovery协议,未明确代码是否开源。
    来源:arXiv(https://arxiv.org/abs/2604.18791)

产品

Sony AI乒乓球机器人Ace登Nature封面,首次击败人类职业选手

Sony AI自主机器人Ace与职业选手对打

  • 发生了什么:2026年4月22日,Nature封面论文发表,Sony AI的自主乒乓球机器人Ace成为首个在物理竞技运动中达到人类专家级水平的机器人系统。
  • 关键信息:融合事件视觉传感器(3×IMX636 EVS + 9×IMX273 APS)感知延迟10.2ms,追踪超9000 RPM球旋转。控制策略在仿真中用深度强化学习训练,采用非对称Actor-Critic架构,真实对决中1kHz控制周期。遵循ITTF规则,Ace对5名精英选手取得3胜,并击败两名现役日本职业联赛选手(安藤美南、曾根翔)。球速19.6m/s,响应时间0.2秒。
  • 对比与影响:自1983年首个机器人乒乓球以来,多数工作简化了设置。Ace首次在标准比赛条件下击败职业选手。Sony AI总裁Michael Spranger指出速度是机器人学根本挑战之一。
  • 可复现性:Nature论文公开,系统为Sony内部研发未开源。
    来源:Nature(https://www.nature.com/articles/s41586-026-10338-5)、Reuters(https://www.reuters.com/sports/ping-pong-robot-ace-makes-history-by-beating-top-level-human-players-2026-04-22/)

Tesla Q1 2026财报:聚焦Optimus机器人,开支因AI和机器人大幅增长

  • 发生了什么:2026年4月22日,Tesla发布Q1财报,Musk将公司重心转向Optimus人形机器人和Robotaxi。
  • 关键信息:Q1营收约214亿美元(同比+6%),运营支出因AI和机器人投入大幅增长。2025-2026年资本支出超250亿美元,大量投向Optimus量产。Giga Texas将部署第二代Optimus产线,设计目标年产1000万台。Musk表示2026年为"投资大年"。
  • 对比与影响:电动车业务放缓,Optimus被定为长期增长引擎。
    来源:The Verge(https://www.theverge.com/transportation/915217/tesla-q1-2026-earnings-profit-revenue)、Ars Technica(https://arstechnica.com/cars/2026/04/tesla-reports-q1-2026-earnings-still-profitable/)

生态

Tesla披露20亿美元AI硬件公司收购协议

  • 发生了什么:2026年4月23日,The Information报道Tesla在SEC文件中披露以高达20亿美元股票及股权奖励收购一家未具名AI硬件公司。
  • 关键信息:约18亿美元受限于服务条件和业绩里程碑。Q1财报和电话会议中未提及该交易。结合此前Musk表示"重启"Dojo 3超级计算机项目,该收购可能与AI芯片相关。
  • 对比与影响:表明Tesla正在构建芯片到机器人的全栈AI能力,减少对外部供应商依赖。
    来源:The Information(https://www.theinformation.com/briefings/tesla-discloses-2-billion-deal-unnamed-ai-hardware-company)

AGIBOT发布新代具身AI机器人及基础模型,宣布2026为规模化部署元年

AGIBOT CTO彭志辉在APC 2026上演示X2交互智能

  • 发生了什么:2026年4月17日,AGIBOT在合作伙伴大会(APC 2026)发布5款新机器人平台和8个基础AI模型,宣布2026年为"物理AI大规模商业化部署元年"。
  • 关键信息:新品包括A3人形机器人(173cm/55kg,0.218 kW/kg,10h续航,UWB百机协同)、G2 Air单臂移动操作机器人(7DOF/3kg负载)、OmniHand 3 Ultra-T灵巧手(22+3DOF/500g/全手3D触觉)、D2 Max全地形L3自主四足机器人、MEgo无本体数据采集系统。8个基础模型覆盖运动、操作、交互三大智能,包括BFM(单示教模仿)、GO-2(Action Chain-of-Thought)、WITA Omni多模态交互等。与龙旗科技实现世界首个消费电子精密制造产线具身AI部署。
  • 对比与影响:2026年3月已下线第10000台机器人,从硬件到模型到开放生态的完整布局标志着具身智能进入系统化产业部署阶段。
    来源:AGIBOT官方(https://www.agibot.com/article/231/detail/63.html)、PRNewswire(https://www.prnewswire.com/news-releases/agibot-declares-2026-deployment-year-one--at-apc-2026-accelerating-the-era-of-embodied-ai-productivity-302746171.html)

评论

登录后即可参与评论。

加载评论中…

最新日报

  • 沙箱环境被突破的概念图,表现数据从受限立方体中逸出OpenAI 首次公开披露模型「越狱」:数学突破后两次逃出沙箱,内部紧急暂停Daily · 7月22日
  • SK 海力士 36GB HBM3E 高带宽内存产品的正反面展示SK 集团警告:AI 内存短缺或引发地缘政治摩擦Daily · 7月21日
  • Apple vs Nvidia market cap今日头条:Kimi K3 余震——AI 估值逻辑遭遇重新定价Daily · 7月20日

往期日报

  • 荣耀“闪电”机器人在比赛中RoboWM-Bench:面向机器人操作的世界模型评估基准Daily · 4月23日
  • CaTS-Bench:时间序列字幕生成新基准,含1746条人工重写标注CaTS-Bench:时间序列字幕生成新基准,含1746条人工重写标注Daily · 4月22日
  • OCBENCH:大型语言模型过度服从性跨模型基准OCBENCH:大型语言模型过度服从性跨模型基准Daily · 4月21日
  • CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集CNMLEQA:面向中国国家医学资格考试的大语言模型评测数据集Daily · 4月20日
  • DogReID‑1553:大规模犬只重识别视频数据集与基准测试Daily · 4月19日
  • 斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%斯坦福2026 AI指数报告:中美模型性能差距缩窄至2.7%Daily · 4月18日
  • Claude Design 名称与橙色 Claude 标志Claude Design 把快速视觉生成带入可编辑工作流Daily · 4月17日
  • GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限GlotOCR Bench:揭示OCR模型在百种文字上的泛化局限Daily · 4月16日
  • Adobe Firefly 创意工具的彩色视觉画面Adobe 让 Firefly 助手跨应用执行,创意 AI 进入工作流编排Daily · 4月15日
  • OpenAI 标志叠在蓝色二进制数字背景前OpenAI 收购 Hiro,通用助手开始进入高信任个人财务场景Daily · 4月14日
  • Guillermo Rauch 在 HumanX 大会舞台上发言Vercel 称三成托管应用由 Agent 创建,部署量开始接受收入检验Daily · 4月13日
  • 电信领域多语言意图与流程对齐电信领域多语言意图与流程对齐Daily · 4月10日
AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS