AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

采样越多反而越差:测试时计算的两个「天花板」

2026-06-30 / 3 周前 · 共 2,548 字

大型语言模型的推理系统有一条默认信条:让模型对同一道题多采样几次,然后用多数投票或奖励模型挑出最佳答案——采样越多,准确率越高。大量推理产品把 Best-of-N、自一致性(self-consistency)作为标准后处理管线,采样数从十几到上万不等。

UIUC 的 Yong Yi Bay 与 Kathleen A. Yearick 在 6 月发表的论文中证明,这条信条只在有限范围内成立。他们识别出两个硬天花板——模态上限和相关性上限,超过临界点后,每额外一次采样的边际价值以平方速度衰减,甚至可能让最终答案更差。在真实采样日志上测量后发现:一万次采样在评估基准均值时只相当于约两个独立样本;在 MATH-500 上 256 次采样后,覆盖率冲到 88%,但自一致性投票的准确率锁死在 45%。

把测试时采样当作集群采样

论文的核心洞察是将测试时采样重新理解为统计中的集群抽样(cluster sampling):同一道题的 n 次采样不是 n 个独立抛硬币,而是一个集群内的相关抽取。同一个 prompt、同一个模型温度、同一套解码分布,反复抽取的答案彼此相似——就像同一家庭的成员在问卷调查中给出相似的回答。

一旦接受这个框架,经典调查统计中的设计效应(design effect)就自然适用。设每次采样正确的概率为 s,同一题目上两次采样正确性之间的类内相关系数为 ρ,则有效采样数为:

n_eff = n / (1 + (n-1)·ρ)

当 n → ∞ 时,n_eff → 1/ρ。这就是相关性天花板:无论预算多大,一个相关系数为 ρ 的题目最多只能提供 1/ρ 个有效独立样本的信息。

两个天花板,三种不同的「收益」

论文将采样预算买到的东西拆成三个互不相同的量,各自有各自的饱和点。

**覆盖率(coverage)**问的是「n 次采样里至少有一次正确吗?」它只关心正确答案是否出现在采样池中,不需要知道哪一个对。只要模型对某道题有非零的解出概率,覆盖率就会随着 n 增大单调趋向 100%,不存在采样天花板。但覆盖率需要一个完美验证器来兑现——大多数实际场景没有。

选择(selection)问的是「能从采样池中挑出正确的那个吗?」自一致性投票、奖励模型打分、加权投票都在做这件事。论文证明,随着 n → ∞,自一致性投票的结果以概率 1 收敛到模型在这道题上最常输出的那个答案——即答案分布的众数。于是自一致性准确率的上限就是模态命中率 π_mode:出题集里有百分之多少的题,模型最常输出的答案恰好是正确答案。

这就是模态天花板。一旦采样数足够多到能稳定揭示答案分布的众数——通常只需几十次——再增加采样不会改变投票结果。在模式错误的题目上,更多采样只会让错误答案赢得更坚定。

**基准均值估计(benchmark estimation)**问的是「用 n 次采样估计模型在某题上的准确率,值不值得?」答案是不值得。相关性天花板 1/ρ 直接限制了这个估计的信息量。

在真实日志上:一万次采样 = 两个独立样本

论文在两个公开采样日志上测量了这些效应。

在 Brown 等人 2024 年发布的 GSM8K 和 MATH 独立采样日志上,他们估计出题目间难度差异带来的类内相关系数 ρ_b ≈ 0.4-0.6。这意味着:每道题上那 10^4 次采样,对基准均值的估计价值只相当于不到三个独立样本。为评估增加采样数几乎毫无意义——应该把钱花在增加题目数量上。

在 Beeching 等人的 MATH-500 依赖采样日志上(Llama-3.2-1B-Instruct,每道题 256 次,温度 0.8),每道题的 256 个答案中位数只包含约 13 个不同的值——答案分布高度集中。覆盖率爬到 0.88(近九成题目至少有一次正确的尝试),但自一致性投票的准确率在约 64 次采样后就稳定在 0.45——模型能生成正确答案,但无法通过投票选出它。

反缩放:采样让答案变差

论文中一个特别反直觉的结果来自「反缩放」现象。对于模式是错误的那些题目——即模型最常输出的答案恰好是错的——随着采样数增加,自一致性投票准确率不是趋于平稳,而是趋向于零。覆盖率和选择在这类题上走向完全相反的方向:模型生成正确答案的概率越来越高,但投票选出的答案越来越肯定是错的。

这就是为什么有研究观察到自一致性性能在采样数增加时出现非单调甚至下降。论文指出,这是混入「模式错误题」与「模式正确题」后整体平均的结果,而不是采样本身有随机波动。

一份可行的实践检查清单

论文最终提供了一套实用性很强的建议:

对评估:报告有效采样数 n_eff 而非名义采样数 n。由于 ρ_b 通常在 0.4-0.6,如果以名义 256 次采样计算置信区间,实际会窄约 11 倍。正确的做法是多采题目,少采重复。

对不带验证器的部署:采样的投入产出比在几十次后急剧下降。与其堆采样数,不如通过提高温度、调整 nucleus 采样、改变 prompt 或混合模型来增加答案多样性——拉低答案分布的集中度,才能提高模态命中率。

对带验证器的场景:覆盖率没有天花板,持续加大采样确实能提升「至少有一次正确」的概率——前提是验证器可靠。但不要混淆:覆盖率曲线上升不等于最终答案质量在上升。

论文将有效采样数的计算浓缩为一句话,建议直接复制到方法部分:「Following Bay and Yearick, we report the effective number of samples n_eff = n/[1+(n-1)ρ] alongside the nominal sample count.」

尚未闭合的环路

论文作者坦诚留下了几个开放问题。最关键的是解码杠杆的验证:论文的理论预测,降低答案相关性(通过温度、采样策略等)应当能提高模态天花板,但这个因果链尚未被对照实验证实——他们已在文中预注册了实验方案,留给后续工作。

另一个重要的边界条件:完美验证器的假设。实际中验证器本身存在假阳性和假阴性,这会在相关性天花板之上叠加第二个独立天花板。在代码场景中(有测试套件的验证器),覆盖率曲线的收益可以部分兑现;在开放式问答中,奖励模型与真实正确性之间的差距意味着即便覆盖率在上升,也无法转化成可用的答案。

对产业界而言,这篇论文最重要的信息可能不是理论优雅,而是直接的成本含义:大量企业推理管线中那些用 Best-of-32、Best-of-64 甚至更高采样数烧掉的 GPU 时间,有很大比例买到的只是冗余。论文证明,在集群相关性的约束下,这笔钱应该花在提高答案多样性或增加测试题目上。

来源

  1. When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling
  2. sampling-ceilings (GitHub)

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Google 位于俄亥俄州 New Albany 的数据中心园区夜景,AI 基础设施投入的直接体现

    Alphabet Q2 超预期却暴跌 6%:$2050 亿 AI 军备竞赛触发华尔街信任投票

    算力 · 2026-07-26

  • Etched 联合创始人兼 CEO Gavin Uberti

    从被所有 VC 拒绝到 10 亿美元订单:Etched 带着 Transformer 专用芯片出隐身模式

    算力 · 2026-07-25

  • Meta 官方视频封面中的路易斯安那州 Richland Parish 乡村道路与林地。

    Meta 将路易斯安那 Hyperion 扩至 5GW,总投资突破 500 亿美元

    算力 · 2026-07-24

  • 服务器电路板上的多枚 Google Ironwood 加速芯片近景

    Google 秘密研发 Frozen v2:将 Gemini「烧」进硅片,模型即芯片的时代来了

    算力 · 2026-07-22

  • TSMC 位于亚利桑那州凤凰城北部的 Fab 21 晶圆厂施工航拍图,该厂区在美总投资已升至 2650 亿美元

    台积电 Q2 净利润暴增 77%、追加千亿美元投资亚利桑那:AI 芯片的物理版图正在从台湾向美国迁移

    算力 · 2026-07-21

  • SK 集团会长崔泰源在济州论坛记者会上发言,警告 AI 记忆体短缺正在引发外国政府的直接干预

    SK 集团会长发出罕见警告:AI 记忆体短缺已成为地缘政治武器

    算力 · 2026-07-20

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS