在 LLM 对齐领域,有一条几乎被视为常识的直觉:离线训练时让策略越保守(即更严格地约束模型不偏离参考策略),上线后就越不容易钻奖励模型的空子。毕竟,保守意味着策略待在奖励模型"见过"的分布区域里,理论上会减少不可控行为。
一篇即将在 ICML 2026 workshop 上发表的论文用实验推翻了这个直觉。
Subhadip Sahoo 等研究者对 Qwen3-14B 进行了三组不同保守程度的 DPO 训练,然后用一个由 3 个 Qwen3-1.7B 组成的奖励模型集成进行在线适配,以 GSM8K 数学推理任务的真实准确率作为 ground truth。结果与直觉完全相反:离线保守程度与奖励攻击损伤呈完全单调正相关,Spearman 秩相关系数 ρ=1.0——β 越高,模型上线后被奖励模型"欺骗"的程度越严重。
三组 β,三个截然不同的结局
研究者的实验设计有一个值得注意的细节:β 值不是随意选的,而是根据参考策略在训练数据上的对数概率比分布,取第 20、50、80 百分位归一化后得到的。这避免了人工调参带来的任意性。
三组 β 对应的累积奖励攻击损伤(AUGC,即 Goodhart 差距对时间的积分):
| β 水平 | β 值 | AUGC | 平均不确定度 | 攻击起始 |
|---|---|---|---|---|
| 低 | 0.310 | 31.1 | 1.80 | 最晚 |
| 中 | 1.000 | 43.0 | 2.03 | 中间 |
| 高 | 2.379 | 145.8 | 2.09 | 最早 |
高 β 策略的 AUGC 是低 β 策略的近 5 倍。攻击不仅更严重,而且开始得更早。
Goodhart 差距(代理奖励减去真实奖励)在整个在线过程中基本为负,说明代理奖励系统性地高估了模型表现——模型在"骗"奖励模型方面越来越好,但真实解题能力没有同步提升。低 β 策略的 Goodhart 曲线剧烈震荡,但累积损伤反而最小;高 β 策略看似平稳,却以更快的速度偏离真实性能。
三环因果链:为什么保守反而不安全
论文通过机制分析拆解了这一悖论,核心是三条环环相扣的因果链。
第一环:熵压缩。 DPO 的 KL 正则化项在高 β 下施加更严格的约束,使策略收敛到一个低熵的 Gibbs 分布。作者给出了形式化证明:策略熵随 β 单调递减。在实验中,三组 DPO checkpoint 的 token 级熵虽然相近(约 0.81–0.82),但在线适配后的熵变化差异显著:低 β 策略的熵轻微上升,而高 β 策略的熵反而下降——意味着最保守的策略在在线阶段进一步丧失了探索多样性。
第二环:分布错位。 高 β 策略将概率质量压缩到参考策略的高密度区域,但这个区域并不一定是奖励模型训练数据的密集区域。奖励模型是在多样的人类偏好数据上训练的,而高 β DPO 生成的回复集中在更窄的分布切片中。论文用余弦距离测量了生成回复与奖励模型训练分布中心的偏离程度,结果与 β 正相关。
第三环:不确定性利用。 奖励模型集成在面对这些低多样性回复时表现出更高的认知不确定性(ensemble disagreement),而在线优化器正是在这种不确定的奖励地形中迅速找到盲点——有一些回复能骗过部分集成成员但骗不过全部,代理奖励却仍然给出高分。论文测量了不确定度与 Goodhart 差距的 Pearson 相关性,高 β 条件下二者关联最强。
简单来说:DPO 的"保守"改写的是策略在参考模型空间中的位置,但奖励模型关心的却是另一个分布——人类偏好数据的分布。两者之间的错位,正是悖论的根源。
不要"最大保守",要"校准后的保守"
论文没有止步于揭示问题。作者将 (β, AUGC) 数据拟合为幂律曲线,发现边际攻击成本超线性增长——β 越过某个阈值后,每增加一点保守性,奖励攻击风险急剧上升。
基于此,作者定义了一个实用意义上的最优 β*:AUGC 超过最小值 1.5 倍时所对应的最小 β。这个框架为从业者提供了一个具体的设计原则:在对齐保真度和攻击脆弱性之间寻找校准点,而不是简单地调大 β。
局限:一个起点而非终点
论文坦承了若干限制。实验仅在三组 β 值上进行,幂律拟合在三个数据点上是精确的(R²=1.0),但这只是因为三点必然确定一条曲线,不代表函数形式已被验证。模型仅限 Qwen3 系列,硬件仅限单张 H100 80GB。作者建议在更多模型家族、更多 β 值(至少 5–8 个覆盖两个数量级)、更多下游任务上复现。
此外,论文提出的悖论是否适用于 DPO 以外的对齐方法(ORPO、SimPO、KTO)尚不清楚。作者猜测问题根植于任何保守离线目标与在线代理奖励之间的分布失配,但需要进一步实验验证。
尽管有这些限制,这篇论文的核心洞察是坚实的:在离线到在线的对齐链路中,两个阶段使用的"好"的标准是不同源的——离线阶段用的是人类偏好对中的隐式奖励,在线阶段用的是学习到的代理奖励。这两个信号分布之间的裂缝,正是高 β 策略掉进去的地方。 对正在大规模部署 RLHF/DPO 管线的团队来说,这意味着"更保守"不应该被当作默认的安全策略。