如果给模型一笔固定的推理预算,最好的花法是什么?当前流行的答案是让模型审视、批评然后重写自己的输出——Self-Refine、Reflexion、Best-of-N 等方法都是这个思路的变体。一项 7 月 31 日上传 arXiv 的论文给出了一个令人不适的答案:这些方法没有一个能打过最简单的方案——多采样几次然后投票。
论文来自 Stony Brook University 的 Iliya Mirzaei,实验覆盖 7 种方法、两个数学推理基准(GSM8K 和 MATH-500)、三个模型规模(1.5B、3B、7B 参数的 Qwen2.5-Instruct),共计 36 组配对比对,每组 150 题,全部报告 bootstrap 置信区间和 Holm 多重比较校正。结论是:0 个方法在等 Token 预算下显著优于 self-consistency 基线,10 个显著更差——而且这 10 个全部来自让模型"审查自己输出"的方法。
论文并非第一个提出这个观点的工作。2024 年 EMNLP 上,Wang 等人的 "Reasoning in Token Economies" 已经指出,在匹配合适的计算资源后,self-consistency 经常击败文献中更复杂的推理策略。但王等人只报告了点估计,没有置信区间、没有显著性检验,每个数据集仅 100 题——这意味着他们观察到的很多差异可能在统计噪声范围内。Mirzaei 的贡献是完成了这个审计:用配对 bootstrap、Holm 校正和精确的成本匹配,回答了一个关键问题——王等人的结论中,到底有多少经得起严格统计检验?
答案是:比预想的更多,但也比预想的更精确。不是"反思方法没用",而是"在研究覆盖的规模和任务范围内,把 Token 花在反思上不如花在多采样上"。
为什么必须控制 Token 预算
当前的自我改进方法有一个容易忽视的共性:它们都让模型生成更多文本。一次链式思考可能 300 个 Token,三轮 Self-Refine 可能 1600 个,三个 Agent 两轮辩论可能 2500 个。改变的不只是方法,还有计算预算——后者本身就能提高准确率。
Mirzaei 的基线是 self-consistency:以不同温度对同一问题采样 N 次,取出现次数最多的答案。这个方法不涉及任何批判、规划或 Agent 间通信。它只是一条准确率随 N 增长的曲线。论文的问题由此变得简单:一个方法是否值得它的 Token 成本,就看过它在曲线上的位置——在线上,值得;在线下,不如多采样。
论文的预算匹配比王等人更精细。王等人的做法是为所有方法设置统一的查询或 Token 上限;Mirzaei 的做法是测量每个方法的实际 Token 消耗,然后在 self-consistency 曲线上插值出对应成本点的准确率。这意味着每个方法都在和自己实际花掉的预算比较,而不是和一个笼统的上限比较。
论文只计算生成的 Token(completion tokens),不包括输入的 Token。这是有意为之——生成 Token 是最不依赖部署细节(批处理、缓存)的成本度量,也是在这套度量下反思方法看起来最好的度量。如果计入输入 Token,辩论和 Best-of-N 的劣势会进一步扩大,因为这两种方法需要反复重读大量上下文。
谁输得最惨
将方法按"Token 做了什么"分组后,模式变得清晰。让模型评估或重写自己输出的方法——Self-Refine、Reflexion(强制版)和 Best-of-N——在全部 18 个比较中都低于等成本基线。不涉及自我评估的方法——Chain-of-Thought 和 Plan-and-Solve——在基线附近波动,无显著差异。
具体到各方法:
Self-Refine 在所有 6 个设置中都低于基线,4 个在 Holm 校正后仍显著。在 Qwen2.5-7B/MATH-500 上差距最大:-6.3 个百分点。即便模型大到 7B,"写出来、批判、重写"这个循环仍然不如"多写几份然后投票"。论文作者在讨论部分解释了原因——数学题答案非对即错,批判没有细腻的改进空间,每次修改都是一次赌博。这在原始 Self-Refine 论文主要面向的开放式生成任务中可能不同,但在数学推理上,反思的代价超过了它带来的修正。
Reflexion(原版) 是论文中最具戏剧性的发现。Reflexion 的设计是:模型每轮回答后判断自己是否正确,只在自认为有错时才反思重试。在 Qwen2.5-1.5B 上,这个判断机制从未触发——模型在两个基准的全部 300 题上都判断自己"正确",Reflexion 静默退化成了单次链式思考。它在结果表上看起来还算体面(74%/46%),但那是因为它什么都没做,而不是因为它做对了什么。到 3B 时同样的代码行为大变:在 MATH-500 上几乎每次都触发重试,成本比 1.5B 高了四倍以上。同一个方法,在不同模型上测量的是完全不同的东西。
这暴露了一个系统性风险:带自适应控制流的方法可以无声地退化成更廉价的方法,而只看准确率的 benchmark 完全发现不了。Mirzaei 的回应是——任何评估自适应方法的论文,如果不报告自适应机制实际触发的频率,就等同于在证据上留了一个洞。
Reflexion(强制版)——让反思循环无论如何都跑满三轮——在所有 6 个设置中都低于基线,4 个显著。这直接回答了"反思机制本身是否有用"的问题:至少在这些模型和任务上,没有。
Multi-Agent Debate 是所有自我评估方法中表现最好的——6 个比较中有 0 个显著低于基线,但点估计全部为负。经过两轮辩论后,Agent 在 48-91% 的题目上达成一致,问题在于一致性不等于正确性。辩论是唯一以投票而非判断收尾的方法,这或许解释了它相对较小的劣势。论文谨慎地指出,辩论处于"自我评估"和"不自我评估"之间的灰色地带,因为每个 Agent 确实在阅读和回应其他 Agent 的批判。
最干净的实验:计票与模型的正面交锋
论文中最无可辩驳的比较来自 Best-of-N。其流程是:对同一问题采 8 次样,然后让模型自己挑出最好的一份答案。论文的做法是:拿这 8 份一模一样的答案,分别让模型来挑和简单计票——候选样本、Token 消耗、模型完全相同,唯一的变量是谁来拍板。
计票在所有设置中都赢了,差距从 1.3 到 17.3 个百分点。模型的选择与多数答案一致的概率在 63-95% 之间——失分发生在不一致的那部分题目上。更细致的分析显示,小模型倾向于选第一个候选答案(位置偏误),而不是因为它判断第一个更好。
这个差距随模型规模缩小。1.5B 时计票领先 8 到 11 个百分点,3B 时 5 到 17 个百分点,到 7B 时缩至 2 和 1.3 个百分点——已经不再统计显著。Mirzaei 不会声称 7B 上计票仍然更优,只会说在 7B 上两者不可区分。这个"收敛"本身信息量很大:模型的选择能力在追赶计票的可靠性,但它是通过与多数答案越来越一致实现的,而不是因为在分歧题目上变得更准确。论文对分歧题目的逐项分析显示,当模型的选择与多数不同时,模型在这类题目上的准确率始终低于 50%。也就是说,差距缩小是因为分歧变少了,不是因为模型在分歧时判断更准了。
将这一发现与 Zhang 等人(2024)的结果放在一起更有趣。Zhang 等人发现,经过专门训练的验证器在 7B 规模可以击败多数投票。Mirzaei 未训练的验证器刚好在这个规模追平。结合来看:训练,而非"验证"这个行为本身,才是让验证器有价值的因素。
对 Agent 设计的实际意味着什么
这篇论文不是一个"这些方法没用"的声明。它是一个关于比较方式的论证,而论证的结论直接影响工程设计决策。
第一,当预算有限时,花 Token 去多试几次比花 Token 去反思一次更划算——至少在数学推理这类答案可自动验证的任务上。如果你的 Agent 在做的事有明确的正确/错误标准,在考虑加反思循环之前,先看看把同样的 Token 预算用于 pure sampling 会得到什么结果。
第二,任何带自适应停止条件的方法都必须检测"方法是否真的在运行"。Reflexion 在 1.5B 上的无声失败不是一个偶发 bug——它是设计中的一个结构性风险。部署时应当记录自触发机制的激活频率,把它当作和准确率同等重要的指标。
第三,"一个方法的机制带来的增益"和"多花计算带来的增益"必须分开测量。论文的方法很简单:在同等成本下和 self-consistency 比,报告置信区间。这个标准不复杂,但它要求方法提出者主动证明"我的方法比多采样更好",而不是只证明"我的方法比单次生成更好"。
这篇论文没有说什么
论文的局限是作者主动列出的,不需要外部解读来弱化。
任务限制在数学推理,答案可自动检查。Self-Refine 最初是为开放式生成设计的——对话回复、文本润色——在那里答案不是非对即错,批判可能有真正的操作空间。论文不声称反思在那些任务上无效,只声称在数学推理上无效。将这个结论推广到其他领域需要一套不同的实验和不同的质量度量。
模型规模不超过 7B。7B 以上,Best-of-N 与计票的差距已经消失,反思机制的差距也可能继续缩小。论文作者明确说:"判断是否会最终超越计票,需要在更大的模型上测试,我们的数据只能定位收敛点,不能预测之后。"这是一个可检验的问题,而不是一个已解决的问题。
模型是 8-bit 量化的 CPU 推理结果。论文也承认量化可能与不同方法产生交互,但 8-bit 对于这些模型规模已接近全精度,且影响方向不明确。
论文使用了 Wang 等人(2024)的原始洞见——预算匹配的比较方式——作为出发点,不是作为新贡献。论文的新贡献在于统计严谨性、成本匹配的精度、小模型 regime 的覆盖、Best-of-N 的固定样本比较,以及对自适应方法"是否真正在执行"的检测。
论文的所有代码、提示词、每一份生成的原始文本和验证脚本均已开源。作者鼓励对其评分器和结论进行独立审计——这与王等人不公开原始生成的做法形成了鲜明对比。
