2020 年,ICLR、ICML、NeurIPS 三大 AI 顶会共收到 17,051 篇投稿。到 2026 年,这个数字飙升至约 73,883 篇——六年增长 333%。同一时期,至少 17.5% 的计算机科学摘要已携带 AI 生成痕迹,部分生物医学子领域中这一比例高达 40%。传统同行评审的人力根本无法跟上这场论文生产的加速度。
Google Research 给出的答案出人意料地直白:既然 AI 制造了论文洪峰,那就用 AI 来建水坝。其 Paper Assistant Tool(PAT)已在 STOC 2025 和 ICML 2026 两项顶会上完成大规模试点,累计审查超过 4,700 篇投稿。6 月底,研究团队在 arXiv 上发布了完整论文,公布了系统架构、基准测试结果、作者调查数据,以及一份关于 AI 在同行评审中可扮演的四种角色的分类法。
不是又一个「把论文扔给 LLM」的工具
PAT 与常见的「把 PDF 丢给 ChatGPT 让它提意见」有本质区别。Google 团队明确指出,单次 LLM 调用有两个致命缺陷:其一,模型的有效上下文窗口不足以对整个论文进行深层分析,尤其是需要大量「思考 token」的数学证明验证;其二,如果简单用 Pass@k 缩放(多次独立调用再合并),虽然召回率有所提升,但精度会急剧下降——模型可能输出 100 条「疑似问题」,其中只有 1 条是真问题,人类反而被噪音淹没。
PAT 的设计从源头解决这两个问题。它的流水线分三步走:
分段代理(Segmenter) 先将论文按逻辑主题拆解为若干片段——理论、方法、实验、结论等——片段之间可以重叠且不必连续,然后根据每个片段的信息密度和复杂度动态分配计算预算。证明密集的部分获得更多算力,叙述性段落则少占资源。
深度审查代理(Deep Review Agents) 随后对各片段进行独立验证,每个代理虽然聚焦特定片段,但可以访问全文作为上下文。这些代理由 Gemini Deep Think 的增强版驱动,采用推理缩放技术——同时探索多条推理路径并交叉验证,而非沿着单条线性思路走到底。
合成代理(Synthesis Agent) 最后合并所有片段的审查报告,通过 Google 搜索核查引用(防止捏造不存在的论文或定理),去重后生成完整的审稿意见。
这套架构在 SPOT 基准测试上展现了清晰的阶梯式提升。SPOT 是一个收集了真实论文中曾导致勘误或撤稿的错误的基准。在数学和计算机科学类别的「等式/证明」错误子集上,原始 SPOT 最好成绩仅检出 21.1%,Gemini 3.1 Pro 的零样本单次调用跃升至 55.2%,而 PAT 达到了 89.7%——相比零样本提升了 34 个百分点。
论文中提供了一个具体案例:在一篇关于对偶 Banach 空间的论文中,零样本模型直接接受了一个关于复最小算子空间上实线性映射的错误完备压缩性声明;PAT 则拒绝盲信,自行构造了一个反例,揭示出足以否定主定理的致命漏洞。
值得注意的是,即便零样本基线也能检出超过一半的错误——这意味着哪怕是最简单的「提交时自动跑一次 LLM」也比什么都不做强得多。「如果 arXiv 在每篇投稿时自动运行一次 LLM 审查,超过一半的撤稿级错误可以在发表前被拦截」,研究团队在论文中写道。
4,700 篇论文的真实反馈:不是漂亮数字,是改了证明、跑了新实验
PAT 的首次实战是 2025 年 11 月的 STOC(计算机理论顶会),当时专门针对理论计算机科学的数学密集型论文进行了优化。2026 年 1 月,系统在 ICML 上进行了更大规模的部署,扩展至可评估实验框架、发现混淆因素、指出缺失的比较实验和实验设计缺陷。
两次试点遵循同一原则:PAT 仅为作者提供提交前的私密反馈,完全独立于正式同行评审流程,审稿人和领域主席无法查看这些反馈。在 ICML 试点中,反馈的平均周转时间仅约 30 分钟。
调查结果远超「AI 挺有用」的泛泛评价。在 ICML 的 869 份有效问卷中:
- 92.1% 的作者表示愿意再次使用 PAT
- 87.3% 认为 PAT 提升了论文的清晰度和可读性
- 35.4% 的含理论内容论文作者报告 PAT 发现了需要超过一小时才能修复的重要理论漏洞
- 31% 的含实验内容论文作者因 PAT 的反馈而跑了全新的实验
STOC 的反馈更为浓缩——97% 的作者愿意再次使用,85.1% 认为论文清晰度得到改善,11.6% 报告发现了重要理论错误。
但最有力的证据来自定性反馈。一位 STOC 作者写道:「它发现了我们应用一个工具时的关键 bug……一个尴尬到极点的简单错误,躲了我们好几个月。幸好我们在截止日期前修好了,可这意味着我们不得不重写七八页的技术内容。」另一位作者报告 PAT 指出了证明中的一个矛盾——「证明是无效的,我们在 AI 发现后修好了它」。
UC Irvine 杰出教授 Vijay Vazirani 的反馈更为直接:「这组评论简直令人震惊!它指出了我算法中一个微妙但致命的 bug,我及时修好了!」
即使是那些没有致命错误的论文,PAT 也频繁发现「数学上有意义的笔误」——缺失的绝对值符号、方向错误的不等式、过载的符号、off-by-one 错误——这些对于人类审稿人来说是极其耗时的体力活,但 PAT 可以系统性地逐行扫描。
四级分类法:同行评审的「自动驾驶」路线图
论文最具野心的部分或许不是 PAT 本身,而是研究团队为 AI 在同行评审中的角色提出的四级分类法。它参照了无人驾驶的 SAE 分级和数学研究的自主性分级,试图为社区讨论提供一个结构化框架:
角色一:AI 作为作者工具。 PAT 在 STOC 和 ICML 中的使用方式——提交前私密反馈,作者全权决定是否采纳。这是最保守、争议最小的模式,但已经能显著提升投稿池的整体质量。
角色二:AI 作为审稿人工具。 人类审稿人使用 AI 理解论文、发现潜在缺陷、生成审稿草稿,但最终审稿意见由人类全权负责。风险在于审稿人可能过度依赖 AI 的幻觉批评,或隐藏自己的 AI 使用,在 rebuttal 阶段为错误的 AI 观点辩护。
角色三:AI 作为辅助审稿人。 AI 像人类审稿人一样独立生成完整的技术审查报告(仅限客观评估,不含主观评分),人类领域主席综合所有 AI 和人类审稿意见做出录用决定。一个变体(角色 3.5)允许 AI 也给出主观评分和推荐。最激进的实现方式是所有审稿意见都由 AI 生成,人类仅扮演决定者角色。
角色四:AI 全自动化同行评审。 在这个未来场景中,AI 评审系统的一致性和精确度超越人类。论文提出了一种可能形态——类似 arXiv 但只收录经过 AI 审查的论文的「AIrXiv」,支持多轮自动审查、交互式 rebuttal 和逐条问题解决,通过持续的多轮审查建立论文的置信度评级。
论文同时提出了一系列必须解决的问题:当 AI 审查出错时谁负责?作者如何质疑 AI 的幻觉批评?如何防止作者学会「讨好审查 AI」?如何确保计算资源的公平获取?自动化审查是否会导致观点同质化、压制智识辩论?
走到哪了
一个重要的背景事实被埋在论文中部:根据 Pangram 的研究,ICLR 2026 有 21% 的审稿意见已完全由 AI 生成——尽管这明确违反了会议政策。换句话说,审稿人已经在大量使用 AI,但处于地下状态。论文的立场是:与其让 AI 在地下无规则地渗透评审系统,不如制定明确的政策和分级框架,让 AI 在阳光下的特定角色中发挥作用。
PAT 的下一个迭代已经宣布——将整合 ScholarPeer 系统(一款在文献引用和批判性分析上更强的审稿工具)——并将在 NeurIPS 2026 上继续试点。与此同时,AAAI-26 也已启动了自己的 AI 审稿试点,为每篇主赛道投稿生成一份清晰标注的 LLM 审稿意见。
从 STOC 到 ICML 再到 NeurIPS,从作者工具到审稿人助手再到可能的辅助审稿人,AI 进入同行评审不是「是否」的问题,而是「多快」和「以什么角色」的问题。PAT 用 4,700 篇论文和 89.7% 的错误检出率为这场讨论提供了一个坚实的事实基准——接下来需要的是社区的集体决策。

