8 月 12 日上传到 arXiv 的预印本《Scaling Automatic Research Agents via World Models》提出 WMRL(World Model RL),针对自动研究(AutoResearch)Agent 强化学习训练中的一个结构性瓶颈:贵的不是「生成」,而是「执行」。作者用与 Agent 同 backbone 的语言模型充当世界模型、替代真实的沙箱执行,再以约 10% 的「锚定组」同时由真实执行打分来纠偏去噪,把训练算力降到真实执行 RL 的约三分之一(3.1 倍与 3.4 倍提速),同时性能不降反升:后训练出的 Qwen3.5-4B 与 Qwen3.5-9B Agent 在留出 benchmark 上分别超过了 48B 与 120B 的开权重模型。
瓶颈不在生成,而在执行
AutoResearch Agent 的一次轨迹由两部分组成:生成(Agent 写出解决方案)与执行(在隔离沙箱里跑代码、加载数据、用真实 GPU 训练模型)。作者指出两者随轨迹规模增长的方式完全不同:生成侧由 vLLM、SGLang 等推理后端服务,批处理让并发轨迹共享算力,新增轨迹的边际成本趋近于零;执行侧无法摊销——每个候选方案都要独占一个沙箱和真实机时,成本随轨迹数量线性增长。因此当 RL 需要海量在线轨迹时,执行成本主导了训练总成本,成为规模化的瓶颈。
论文用 GRPO 作为默认的 agentic RL 目标(组内相对优势),每一步都要在线打分,而每个分数都来自一次真实执行。这正是瓶颈的具象化:训练要更聪明,就得付更多执行成本。
世界模型当环境,加上两个纠错
WMRL 的替换很直接:让 Agent 与世界模型交互,而不是与真实环境交互。世界模型用与 Agent 相同的 backbone,接收任务上下文和 Agent 方案,预测执行结果并给出估计分数。由于接口与真实环境一致,原 RL 管线不变。作者强调共享 backbone 还排除了「从更强的模型里隐式蒸馏」的可能。
但世界模型不完美。作者把它的误差分解为两部分:偏置 b(系统性偏差,取平均后仍存在)和零均值噪声 ξ。他们证明,纯世界模型奖励会把两个额外误差项带进收敛界:O(B²) 的偏置项既不含训练步数、也不含步长,无论训练多久、步长多小都无法消除,形成永久下限;O(σ²) 的噪声项则抬高最终误差。
为消除这个代价,WMRL 保留一条「锚定信号」:约 10% 的组同时由世界模型和真实执行打分,得到(估计分,真实分)对,喂给两个机制:
- 在线去偏(Online Debiasing):用 isotonic regression 拟合一个单调映射,把世界模型分数重标定以抵消偏置,并随训练逐步 refit 追踪漂移。
- 逆方差去噪(Inverse-Variance Denoising):把「稀缺但无世界模型噪声的真实执行流」与「充足但含噪声的世界模型流」按逆方差加权融合,得到比任一单一流更低的梯度方差;实现上退化为 ρ = 1 + η̂²/η̂_cal²,无自由参数。
理论结果把设计落到界上(Theorem 3 对比 Theorem 4):纠错后,偏置项被除以 1+T/T₀,随时间收缩、极限为零;方差项被除以 1+V_WM/V_E,低于任一单一流。极限下 WMRL 收敛到与真实执行训练相同的最优点,却只为约 10% 的组支付真实执行成本。
一个值得注意的机制是自动降级:当任务结果依赖无法从方案本身读出的随机性时,锚定组上的残差 η̂² 会变大,锚定权重自动上升,WMRL 平滑退化为标准 GRPO,而不是死学一个被污染的信号。这个 fallback 来自测量本身,不需要人为预设混合比例。
提速与性能:数字拆解
主实验在两种规模(Qwen3.5-4B、Qwen3.5-9B)上进行,所有运行使用相同的 A100 分配,GPU-hours 统计总训练算力。世界模型保持冻结、只有 Agent 被更新,因此 3–4 倍的提速里不藏着一笔世界模型的训练成本。分数为竞赛 leaderboard 百分位(avg@8),MLE-Dojo 与 DSBench 都是训练中未见过的留出任务。
| 方法 | GPU-hours | MLE-Dojo(test) Avg | DSBench Avg |
|---|---|---|---|
| Qwen3.5-4B-GRPO(真实执行) | 883 | 15.2 | 25.7 |
| Qwen3.5-4B-WM(纯世界模型,无纠错) | 269 | 12.9 | 23.1 |
| Qwen3.5-4B-WMRL | 286 | 16.4 | 28.8 |
| Qwen3.5-9B-GRPO(真实执行) | 1174 | 18.8 | 31.2 |
| Qwen3.5-9B-WM(纯世界模型,无纠错) | 330 | 16.1 | 28.0 |
| Qwen3.5-9B-WMRL | 349 | 21.6 | 32.8 |
WMRL 把真实执行 GRPO 的训练算力降到 3.1 倍(4B:883→286 GPU-hours)与 3.4 倍(9B:1174→349),且在两个 benchmark 的类别平均分上全部反超 GRPO。纯世界模型(无纠错)虽然更省(269/330 GPU-hours),分数却低于 GRPO——说明省下来的算力本身换不回性能,纠错机制才是关键。
对照大模型时,4B WMRL(MLE-Dojo 16.4、DSBench 28.8)超过 Kimi-48B-A3B(8.1、17.3),9B WMRL(21.6、32.8)超过 Nemotron-120B-A12B(20.5、31.7)。但要看清口径:48B/120B 是「off-the-shelf」(未做 RL 后训练)的开权重模型,作者明确把这场对照定义为「模型规模本身能否替代后训练」的检验,而不是同等训练预算下的公平竞争。
消融把两个纠错拆开看:不纠错的直接混合最低,单独加逆方差去噪提升 0.9~1.7 分,单独加在线去偏提升 2.2~2.8 分,两者同时启用提升 2.9~4.8 分。去偏的增益更大,与理论一致——偏置在收敛界里以完整尺寸进入,噪声则被步长压制。
代价与边界
世界模型替代并非免费,代价集中在一处:它可能漏掉真实执行里的意外失败模式。单调重标定只能修复分数尺度上的系统性偏差,无法修复非单调的错判——例如某些仅在真实运行中才触发的超时、环境 bug 或随机性。论文的应对是让锚定组残差 η̂² 充当审计信号:一旦世界模型变差,锚定权重自动上升,向标准 GRPO 退化。但这意味着锚定组比例(约 10%)与世界模型精度之间存在权衡,论文未系统给出这一比例的敏感性分析。
另一个要保留的边界是对比口径:4B/9B 反超 48B/120B,是「后训练过的小模型」对「未后训练的大模型」,不是小模型在同等训练预算下击败大模型。论文没有声称小模型本身更强,而是声称:执行侧的规模化瓶颈被移除后,后训练的收益足以抵消参数规模的差距。
迁移到具身 VLA
作者把同一套方法搬到视觉-语言-动作(VLA)策略后训练,说明纠错机制不依赖 AutoResearch 的特定结构。任务用 LIBERO-Long(模拟机械臂长时程操控),Agent 是 MiniVLA-1B,世界模型用现成的 Robometer(一个从图像预测任务成功率的 VLM)给出密集奖励,环境在 rollout 末尾返回的稀疏成功信号作为锚定。结果复现了主实验的模式:单独用稀疏真实信号只比 SFT 高 0.9 分,单独用世界模型信号高 1.8 分,WMRL 把总体成功率从 SFT 的 37.4 提到 41.2(+3.8 分),且在未见初始状态上的提升最大。
这指向一个更一般的结论:只要奖励「昂贵到要独占执行、又可以从 Agent 产出的东西预测出来」,并且能保留少量 ground truth 作锚定,WMRL 的框架就适用。「执行是瓶颈」是这类任务共同的形态,而非 AutoResearch 特有。
待验证项
这是 v1 预印本,未经过同行评审,也尚无第三方复现,全部数字为作者自报。留给实践者的问题有三个:锚定组比例与世界模型精度的权衡是否在其他任务上成立;世界模型漏检的失败模式在真实评测里会造成多大偏差;「后训练小模型 vs 未训练大模型」的对照在纳入训练预算后是否仍然成立。对做 Agent RL 的团队而言,这篇论文最可复用的一句话是——先分清瓶颈在生成还是执行,再决定要不要用世界模型把执行成本也摊销掉,同时务必保留一条真实信号做锚定。

