AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

LLM 知道约束却不用:激活修补证明这是路由问题,不是知识问题

2026-08-17 / 1 天前 · 共 3,030 字

模型
Yubo Li et al. / arXiv:2608.12321

「我想洗车,洗车店离我只有 50 米,应该走路还是开车去?」多数前沿模型会答「走路」——距离近,走路更省。但它们漏掉了一个隐含前提:洗车的对象是车,走路去的话车还停在原地。卡内基梅隆大学的 Yubo Li、Ramayya Krishnan、Rema Padman 以这道广为流传的「洗车题」为引,在 8 月 15 日交叉收录到 cs.AI 的论文 LLMs Know the Constraint But Do Not Use It(arXiv:2608.12321)里给出一个反直觉的机制判断:模型不是不知道这个约束,而是知道却没用进决策。作者用线性探测和激活修补把「知道但不用」做成可证伪的因果结论,并证明 CoT、前提列举、目标分解、反事实检查四种主流提示型补救全都无效——它们只会让模型整体变保守,无法修复真正的路由故障。

正确答案可能只是「保守默认」

这类失败此前容易被读作「模型不会推理隐藏约束」。但论文指出,只看单个题目的准确率会混淆两种完全不同的行为:一种是真推断出「洗车需要车在场」,另一种是出于别的理由默认选择保守答案。两者在准确率上无法区分。

为拆开二者,作者为 100 个场景(来自 HOB 基准,覆盖 4 类启发式 × 5 类约束的 20 个格子)各构造了一个「四件套」:Active(原题,隐含约束成立)、Removed(删掉约束的反事实对照)、Explicit(把约束写成一句明示)、Salience Control(插入等长中性句子,控制「额外文字」本身的干扰)。

对照结果说明「保守默认」确实普遍存在:当约束被删除后,14 个模型里有 12 个在 Removed 上表现得比原题更差,跌幅最高达 39 个百分点。也就是说,模型在原题上的一部分「正确」,来自它对约束的过度套用,而非真正理解何时该用、何时不该用。

四条件诊断:把「知道但不用」变成可证伪命题

作者把「隐藏约束失败」形式化为四个可独立检验的条件,缩写为 K/S/R/P:

  • Knowledge(知识):线性探针能从隐藏态里解码出「约束是否适用」;
  • Symmetry(对称):探针在「约束存在」和「约束删除」两类提示上准确率一致;
  • Routing(路由):探针投影的强度能预测模型最终答案的偏好;
  • Patching(修补):把「明示约束」提示的隐藏态写进失败提示,能恢复正确回答。

只有前三项成立、第四项失败,才算「条件激活瓶颈」——约束在内部有表征,却没被路由进决策。

在两个开源权重模型上,前两项都成立。Qwen3-14B 在第 27 层、GPT-OSS-20B 在第 20 层的线性探针,分别以 94.5% 和 88.0% 的交叉验证准确率区分「约束存在/删除」;对称性检验的差距只有 0.011 和 0.024,排除了「约束表征只存在于原题」的假象。关键在第三项:探针方向与最终决策的相关系数分别只有 0.125 和 0.224(预设阈值 0.30)——方向在那里,但决策头几乎不读它。这正是路由失败的特征。

两种失败模式,一次修补的反差

行为上,14 个模型按约束偏差指标(CBI = Active 准确率减去 Removed 准确率)分成三群:

  • 过度激活(7 个):Llama-4、Claude Opus 4.6、Qwen3.5-27B、Kimi K2.5、Claude Sonnet 4.5、GPT-5.2、Gemini 3 Pro。它们在约束已被删除时仍给出「考虑约束」的答案,Removed 准确率比 Active 低 11 到 33 个百分点。
  • 平衡(5 个):DeepSeek-R1、Grok 4.2、GPT-5.4、Qwen3-32B、Qwen3-14B。
  • 欠激活(2 个):GPT-OSS-20B(−0.103)与 GPT-OSS-120B(−0.186)。它们在约束成立时反而没把它用上,是相反方向的失败。

修补把这两种失败在机制上分开。在 Qwen3-14B 上,把「明示约束」提示在探针层的隐藏态写进失败的原题提示,模型「正确答案减去捷径答案」的对数概率差(单位 nats)从 +1.40 拉到 +7.78,净增 +6.38,而 Removed 对照组几乎不动(−0.84)。这是一次干净的修复:约束方向不仅存在,还能因果地改变决策。

GPT-OSS-20B 上同样的操作几乎无效(净增 −0.07 nats),尽管它的探针准确率高达 88%。这是教科书式的路由失败:约束方向可解码,但决策头不读它。同一个诊断动作,把「欠激活」和「过度激活」区分成了两种需要不同解法的病。

论文图 4:激活修补对 Qwen3-14B(可修复)与 GPT-OSS-20B(无响应)的差异

图 4:把「明示约束」的隐藏态注入失败提示后,Qwen3-14B 的决策被显著纠正,GPT-OSS-20B 几乎无变化。

为什么所有提示型补救都失败

如果问题是「模型忘了约束」,那么提醒它(CoT、前提列举、目标分解)应该有效。论文用「补救前沿」检验这一点:四种提示策略 × 10 个 API 模型,共 40 个格点,每个策略分别测「在原题上的增益」和「在删约束对照上的伤害」两个轴。

结果一致得令人意外:40 个格点全部落在「高伤害、低增益」区域——伤害 +0.28 到 +0.65,增益 −0.08 到 +0.11,没有一个触及「正增益、零伤害」的修复角。中介分析解释了原因:这四种策略都通过同一条路径起作用,即让模型「提到约束」。提到率从基线 0.3–0.5 被统一抬到 0.84–0.96,而「是否提到约束」对正确率的解释份额高达 0.91 到 0.99。它们没有教会模型何时该提,只是把「提」的概率整体拉高——在原题上捞回一些正确,在删约束对照上把答案反向带偏。

思考模式也救不了,反而更糟。在 Claude Opus 4.6、GPT-5.4、Gemini 3 Pro、DeepSeek-R1 四个模型上,打开思考模式后 CBI 从零样本的 +0.03~+0.28 飙到 +0.57~+0.85,删约束对照的准确率塌到 0.22 以下。预算从 256 到 16384 token 的扫描显示,更多算力不改变「哪些题目会被提到约束」,只放大这个偏差的强度。

论文图 2:四种提示策略全部落在高伤害、低增益区,无一触及修复角

图 2:补救前沿——四种提示策略的原题增益与对照伤害二维分布,所有格点都偏离「修复角」。

对评估与部署的含义

论文的实践含义有三层。

第一,评测必须加「删约束」的 minimal pair。只看 Active 准确率会把「真推断」和「保守默认」混为一谈,一个模型的分数可能高在保守偏差上,而不是推理能力上。

第二,提示层补不了路由层的洞。既然四种主流策略都走同一条「提及前提」的中介路径、只增加保守偏差,修复就必须作用在路由方向本身——作者给出的方向是「学出来的激活门」:按题目决定何时把约束方向注入决策,而不是无差别提醒。

第三,思考模式不是免费的可靠性。对依赖 Agent 在长流程里自我校验的团队,这篇论文提醒:让模型多想,可能只是让它更坚决地犯「过度套用约束」的错。

边界

结论要按预印本的标准打折。因果证据只来自两个开源权重模型(Qwen3-14B 与 GPT-OSS-20B),行为模式虽覆盖 14 个模型,但修补结论未在更多模型上复现;全部约 20.8 万次试验由单一判断模型 Qwen3-32B 判定,可能存在系统性误判;场景是英文日常领域,医疗、法律等专业域是否适用未知;API 模型数据采集于 2026 年 5 月,此后厂商可能已更新模型。此外,单层修补在 GPT-OSS-20B 上失败,也可能只是该模型需要多层或整块修补,而非彻底无解——作者自己也承认这一点。这篇论文最有价值的不是某个具体分数,而是把「知道但不用」这一长期模糊的直觉,变成了一套可复用、可证伪的诊断方法。

来源

  1. LLMs Know the Constraint But Do Not Use It: Activation Bottlenecks in Pragmatic Constraint Reasoning · arXiv

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Wiggle Framework 示意图:把 LLM 裁判的稳定性分解为机械一致性、单轮信念、多轮坚持三个维度,并列出 L1 到 L6 六级压力测试

    LLM 裁判经不起追问:Meta 测出 25%–71% 改判率,Amazon 的开源陪审团反超

    算法 · 2026-08-16

  • 该预印本的泛化热力图,展示训练后的说服者对不同目标模型在五个基准数据集上的说服成功率

    一条假论点让 LLM 放弃正确答案:RL 说服者把准确率从 66% 降到 1.8%

    算法 · 2026-08-13

  • 论文图 1:SWE-bench Verified 上各模型的解题率随时间上升,同时补丁臃肿比保持高位且与解题能力几乎不相关

    编码 Agent 研究「缺了人」:13 位研究者联署呼吁转向人机协作

    算法 · 2026-08-17

  • SynthID-Text 论文示意图:上方为 LLM 逐 token 生成文本的过程,下方为生成式水印的三个组件——随机种子生成器、采样算法与评分函数

    Claude 文本水印全量落地:AI 检测从「猜风格」转向「验密钥」

    算法 · 2026-08-17

  • Dual-Flow 论文图 1:NanoGPT 设定下标准 Transformer 与 Dual-Flow 在多个数据预算上的验证损失训练轨迹,Dual-Flow 在每个预算都更低

    Dual-Flow Transformer:额外计算只留给 decode,MoE 推理多一个成本旋钮

    算法 · 2026-08-16

  • FlashDrive 论文题图:VLA 推理的编码、prefill、解码、动作四阶段流水线与加速效果示意

    FlashDrive 把 10B 参数 VLA 推理从 717ms 压到 151ms

    算法 · 2026-08-16

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS