「我想洗车,洗车店离我只有 50 米,应该走路还是开车去?」多数前沿模型会答「走路」——距离近,走路更省。但它们漏掉了一个隐含前提:洗车的对象是车,走路去的话车还停在原地。卡内基梅隆大学的 Yubo Li、Ramayya Krishnan、Rema Padman 以这道广为流传的「洗车题」为引,在 8 月 15 日交叉收录到 cs.AI 的论文 LLMs Know the Constraint But Do Not Use It(arXiv:2608.12321)里给出一个反直觉的机制判断:模型不是不知道这个约束,而是知道却没用进决策。作者用线性探测和激活修补把「知道但不用」做成可证伪的因果结论,并证明 CoT、前提列举、目标分解、反事实检查四种主流提示型补救全都无效——它们只会让模型整体变保守,无法修复真正的路由故障。
正确答案可能只是「保守默认」
这类失败此前容易被读作「模型不会推理隐藏约束」。但论文指出,只看单个题目的准确率会混淆两种完全不同的行为:一种是真推断出「洗车需要车在场」,另一种是出于别的理由默认选择保守答案。两者在准确率上无法区分。
为拆开二者,作者为 100 个场景(来自 HOB 基准,覆盖 4 类启发式 × 5 类约束的 20 个格子)各构造了一个「四件套」:Active(原题,隐含约束成立)、Removed(删掉约束的反事实对照)、Explicit(把约束写成一句明示)、Salience Control(插入等长中性句子,控制「额外文字」本身的干扰)。
对照结果说明「保守默认」确实普遍存在:当约束被删除后,14 个模型里有 12 个在 Removed 上表现得比原题更差,跌幅最高达 39 个百分点。也就是说,模型在原题上的一部分「正确」,来自它对约束的过度套用,而非真正理解何时该用、何时不该用。
四条件诊断:把「知道但不用」变成可证伪命题
作者把「隐藏约束失败」形式化为四个可独立检验的条件,缩写为 K/S/R/P:
- Knowledge(知识):线性探针能从隐藏态里解码出「约束是否适用」;
- Symmetry(对称):探针在「约束存在」和「约束删除」两类提示上准确率一致;
- Routing(路由):探针投影的强度能预测模型最终答案的偏好;
- Patching(修补):把「明示约束」提示的隐藏态写进失败提示,能恢复正确回答。
只有前三项成立、第四项失败,才算「条件激活瓶颈」——约束在内部有表征,却没被路由进决策。
在两个开源权重模型上,前两项都成立。Qwen3-14B 在第 27 层、GPT-OSS-20B 在第 20 层的线性探针,分别以 94.5% 和 88.0% 的交叉验证准确率区分「约束存在/删除」;对称性检验的差距只有 0.011 和 0.024,排除了「约束表征只存在于原题」的假象。关键在第三项:探针方向与最终决策的相关系数分别只有 0.125 和 0.224(预设阈值 0.30)——方向在那里,但决策头几乎不读它。这正是路由失败的特征。
两种失败模式,一次修补的反差
行为上,14 个模型按约束偏差指标(CBI = Active 准确率减去 Removed 准确率)分成三群:
- 过度激活(7 个):Llama-4、Claude Opus 4.6、Qwen3.5-27B、Kimi K2.5、Claude Sonnet 4.5、GPT-5.2、Gemini 3 Pro。它们在约束已被删除时仍给出「考虑约束」的答案,Removed 准确率比 Active 低 11 到 33 个百分点。
- 平衡(5 个):DeepSeek-R1、Grok 4.2、GPT-5.4、Qwen3-32B、Qwen3-14B。
- 欠激活(2 个):GPT-OSS-20B(−0.103)与 GPT-OSS-120B(−0.186)。它们在约束成立时反而没把它用上,是相反方向的失败。
修补把这两种失败在机制上分开。在 Qwen3-14B 上,把「明示约束」提示在探针层的隐藏态写进失败的原题提示,模型「正确答案减去捷径答案」的对数概率差(单位 nats)从 +1.40 拉到 +7.78,净增 +6.38,而 Removed 对照组几乎不动(−0.84)。这是一次干净的修复:约束方向不仅存在,还能因果地改变决策。
GPT-OSS-20B 上同样的操作几乎无效(净增 −0.07 nats),尽管它的探针准确率高达 88%。这是教科书式的路由失败:约束方向可解码,但决策头不读它。同一个诊断动作,把「欠激活」和「过度激活」区分成了两种需要不同解法的病。

图 4:把「明示约束」的隐藏态注入失败提示后,Qwen3-14B 的决策被显著纠正,GPT-OSS-20B 几乎无变化。
为什么所有提示型补救都失败
如果问题是「模型忘了约束」,那么提醒它(CoT、前提列举、目标分解)应该有效。论文用「补救前沿」检验这一点:四种提示策略 × 10 个 API 模型,共 40 个格点,每个策略分别测「在原题上的增益」和「在删约束对照上的伤害」两个轴。
结果一致得令人意外:40 个格点全部落在「高伤害、低增益」区域——伤害 +0.28 到 +0.65,增益 −0.08 到 +0.11,没有一个触及「正增益、零伤害」的修复角。中介分析解释了原因:这四种策略都通过同一条路径起作用,即让模型「提到约束」。提到率从基线 0.3–0.5 被统一抬到 0.84–0.96,而「是否提到约束」对正确率的解释份额高达 0.91 到 0.99。它们没有教会模型何时该提,只是把「提」的概率整体拉高——在原题上捞回一些正确,在删约束对照上把答案反向带偏。
思考模式也救不了,反而更糟。在 Claude Opus 4.6、GPT-5.4、Gemini 3 Pro、DeepSeek-R1 四个模型上,打开思考模式后 CBI 从零样本的 +0.03~+0.28 飙到 +0.57~+0.85,删约束对照的准确率塌到 0.22 以下。预算从 256 到 16384 token 的扫描显示,更多算力不改变「哪些题目会被提到约束」,只放大这个偏差的强度。

图 2:补救前沿——四种提示策略的原题增益与对照伤害二维分布,所有格点都偏离「修复角」。
对评估与部署的含义
论文的实践含义有三层。
第一,评测必须加「删约束」的 minimal pair。只看 Active 准确率会把「真推断」和「保守默认」混为一谈,一个模型的分数可能高在保守偏差上,而不是推理能力上。
第二,提示层补不了路由层的洞。既然四种主流策略都走同一条「提及前提」的中介路径、只增加保守偏差,修复就必须作用在路由方向本身——作者给出的方向是「学出来的激活门」:按题目决定何时把约束方向注入决策,而不是无差别提醒。
第三,思考模式不是免费的可靠性。对依赖 Agent 在长流程里自我校验的团队,这篇论文提醒:让模型多想,可能只是让它更坚决地犯「过度套用约束」的错。
边界
结论要按预印本的标准打折。因果证据只来自两个开源权重模型(Qwen3-14B 与 GPT-OSS-20B),行为模式虽覆盖 14 个模型,但修补结论未在更多模型上复现;全部约 20.8 万次试验由单一判断模型 Qwen3-32B 判定,可能存在系统性误判;场景是英文日常领域,医疗、法律等专业域是否适用未知;API 模型数据采集于 2026 年 5 月,此后厂商可能已更新模型。此外,单层修补在 GPT-OSS-20B 上失败,也可能只是该模型需要多层或整块修补,而非彻底无解——作者自己也承认这一点。这篇论文最有价值的不是某个具体分数,而是把「知道但不用」这一长期模糊的直觉,变成了一套可复用、可证伪的诊断方法。