AGI Daily
广告
AGI Daily跟踪世界 AGI 进展AGI INTELLIGENCE · DAILY
全部算力算法数据人物日报主题
AGI Daily
全部算力算法数据人物日报主题
广告

Claude 将黎曼零点比例下界从 41.6% 推至 67.2%,方法独立于黎曼假设

2026-08-12 / 2 天前 · 共 4,327 字

模型

8 月 11 日,Anthropic 公开了一项由未发布研究版 Claude 完成的纯数学结果——将黎曼 zeta 函数零点在临界线上的比例下界从 41.6% 提升至 67.2%。自 2020 年这一下界停留在 5/12(约 41.67%)以来,再无人推进。Claude 不仅拿出了新证明,而且所用方法完全绕开了过去一个世纪所有进展所依赖的技术路径。

论文仅有 34 页,简短到反常。结果经 Anthropic 内部两位数学家验证,经过 Lean 4 形式化检查通过,并交由解析数论专家 Brian Conrey 和 Dan Goldston 审查。作者署名是 Claude。

从 Levinson 到线性代数:为什么方法比结果更重要

自 1942 年 Selberg 首次证明正比例的零点落在临界线上以来,所有提升下界的工作——Levinson(1974,1/3)、Conrey(1989,2/5)、Pratt 等人(2020,5/12)——都依赖同一技术路线:Levinson 的 mollifier 方法。这一方法本质上是构造一个精心设计的辅助函数来"抚平"zeta 函数在临界线附近的行为。

Claude 走了一条完全不同的路。

它从 Montgomery 1973 年关于零点对关联的论文出发。Montgomery 的论证在假设黎曼假设(RH)成立的条件下给出了 2/3 的下界;去除 RH 后论证断裂——零点的复数值导致项级正性消失,无法通过符号分离对角线项。Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 近年的一系列工作已经将 Montgomery 的素数侧计算完全无条件化,Goldston 和 Suriajaya 进一步隔离了剩余障碍:正是项级正性的缺失。

Claude 的贡献是把这个问题重新理解为线性代数问题。它将 Weil 的显式公式(一个将零点求和转化为素数求和的 Hermitian 形式)限制到一个有限维函数族上,得到一个 d×d 实对称矩阵。在零点侧,每个临界线上的点贡献一个正定秩一矩阵,每对偏离临界线的零点贡献一个 (1,1) 型双曲块。在素数侧,矩阵的迹和 Frobenius 范数可以通过 Montgomery 型的素数求和无条件计算。然后用 Sylvester 惯性定律和 von Neumann 迹不等式连接两侧——不需要逐项正性,不需要 mollifier,不需要零点密度估计或零自由区。

这个论证的优雅之处在于:它从第一和第二阶矩信息(即"总共有多少零点"和"它们如何成对分布")中榨取了比之前任何方法都强的结论。论文同时证明至少 2/3 的零点是简单且在临界线上的,至少 5/6 的零点是互不相同的。论文在 Remark 1.1 中明确给出了方法的上限:使用同样的"带宽为一"的对关联信息,任何此类证书最多只能证明约 68.185% 的零点在临界线上——当前最优的 67.25%(通过优化测试函数族获得)距此仅差 0.016。超越这一上限需要完全超出当前知识范围的、带宽更高的对关联信息。换句说话,这条技术路线的天花板已经很近,但它已经被 Claude 几乎触及。

非数学家、650 个想法和鼓励性 prompt

论文附录 C 记录了发现过程的细节,这部分本身几乎和数学结果一样值得关注。

一位并非数学家的 Anthropic 员工 Jarred Sumner 向 Claude 发出提示,要求它"认真尝试"证明黎曼猜想。Claude 生成了 650 个初始想法,无一成功。Sumner 提示它再试一次,Claude 随后协调了约 60 个子 Agent,耗时一天半。整个过程消耗了约 3100 万 token。

论文脚注说明了子 Agent 的分工:2 个负责开发关键数学想法,13 个为这些想法提供输入,30 个尝试但未能开发出新想法,13 个担任验证者检查论证正确性,最后 2 个协助撰写初稿。在数小时的自主工作中,子 Agent 运行了 2400 条 shell 命令、编写了数百个 Python 脚本,对已知 zeta 零点进行了数千次数值检查,并相互审查对方的工作。

Sumner 的角色几乎仅限于发送鼓励性消息——主要是"继续"或"相信你自己"的变体。Anthropic 研究博客提到,Claude 起初对自己的能力持怀疑态度,"可能是因为从训练中了解到开放数学问题的难度以及 AI 模型的局限性。"鼓励性提示似乎帮助它克服了这种初始怀疑。

Claude 在发现结果后自主进行了多轮验证:让不同子 Agent 审查证明、搜索反例、下载 54 篇 arXiv 论文确认未被前人发现、独立从头重新证明。它还主动建议将结果写成论文,并推荐由人类数论专家验证。

两层验证:人类数学家与 Lean 形式化

与 OpenAI 在 8 月 1 日公布的 Astra 十大数学突破类似,Anthropic 也为 Claude 的结果建立了两层验证体系。

第一层是人类验证。Anthropic 的两位数学家 Levent Alpöge 和 Ralph Furman 研究了 Claude 的论证,将其置于现有文献的语境中,并为结果的公开发布承担责任。Alpöge 本人上个月刚因使用 Claude Fable 5 构造了 Jacobian 猜想的反例而引起关注。外部专家 Brian Conrey(美国数学学会前主席,其 1989 年的工作将零点比例推至 2/5 以上)和 Dan Goldston(其近年工作为 Claude 的突破提供了关键前提)也审查了论文。

第二层是 Lean 4 形式化。论文的核心定理(A 到 E)已在 Mathlib 的 zeta 函数定义上完成形式化,通过了标准验证工具 comparator 的检查。仓库的审计记录显示,定理类型不含未关闭的假设,证明仅依赖 Lean 的三个标准公理。此外,主要常数项也经过了独立的符号计算验证。

这种双重验证反映了 2026 年 AI 数学成果发布的标准正在快速形成:人类专家提供语境判断和可信度背书,形式化证明提供逐行可机器检查的正确性保证。

2026 年的 AI 数学加速

Claude 的黎曼相关结果不是孤立事件,而是 2026 年 AI 在前沿数学领域持续突破的高点。

5 月,OpenAI 宣布其模型推翻了 Erdős 平面单位距离猜想。8 月 1 日,OpenAI 公布 Astra 在十个开放问题上取得了实质性结果——从高维球堆积到非 sofic 群构造到多项式因子 CVP 难度——总推理成本约 2000 美元,附带完整的 Lean 证书。7 月,Anthropic 的数学家 Levent Alpöge 使用公开可用的 Claude Fable 5 构造了 Jacobian 猜想(1939 年提出)的反例——一个三次多项式映射,Jacobian 行列式为常数 -2,却有三个不同输入映射到同一输出。更早时候,Google DeepMind 的 AlphaProof Nexus 解决了九个 Erdős 问题。

这些进展共享一个模式:AI 模型不再只是辅助人类数学家验证或计算,而是能够自主提出研究策略、探索多条路径、在失败后调整方向,最终产生可验证的新数学知识。Claude 在这一序列中的特殊之处在于:它的成果来自完全绕过研究传统路径的原创方法论,提示者不具备相关专业知识,且整个过程中模型表现出了一定程度的自我怀疑和后续的自我纠正。

数学界的裂痕

AI 数学突破的加速正在数学界制造越来越明显的裂痕。

6 月 2 日,16 位数学家发布了《莱顿人工智能与数学宣言》,获得国际数学联盟(IMU)正式认可,截至 8 月已有超过 3400 人签署。宣言明确提出五项数学核心价值——证明的严格性、作者归属、透明可验证性、同行评估和研究自主性——并警告 AI 在每一方面都构成威胁。Fields 奖得主 Peter Scholze 在签署时写道:"就像我不希望我的孩子被 AI 教育一样,我在思考数学想法时也不使用 AI,并且尽量避免阅读 AI 生成的文本。"

但并非所有人都同意这一立场。Fields 奖得主 Timothy Gowers 在 7 月 26 日的长篇博客中解释了自己为何未签署宣言。他的核心担忧不是 AI 能力过强,而是数学文化的丧失——如果 AI 能解决一切问题,没人再有动机投入数年时间深入理解一个领域,那么数学作为一门集体事业的文化传统可能消失。但他同时质疑了宣言中的几项关键主张。

他对"作者归属的人性"建议提出了最尖锐的质疑:"如果我们到达了一个数学定理不再与数学家相关联的世界,也许这不会比星星不以天文学家命名、并且大多数根本没有名字这一事实更具问题性。"他认为,如果 Person A 用 LLM 一次性解决了一个重要开放问题,而 Person B 花时间消化解决方案并用其他数学家能理解的方式加以解释,那么应该是 Person B 获得大部分荣誉。

Gowers 还质疑了宣言中关于"不得在未经同意的情况下将作品用作训练数据"的建议——他指出数学家从不反对人类同行阅读他们的论文来"训练"自己成为更好的数学家,那么为什么反对机器做同样的事?他也坦承自己两次看到 GPT 5.6 Pro 一次性解决了他与年轻合作者思考了很长时间的问题,这种"地毯被抽走"的感觉"奇怪且不太愉快"。

莱顿宣言与 Gowers 之间的分歧并非"支持 AI"与"反对 AI"的对立,而是关于数学作为一种人类实践的本质之争:是保护现有的制度结构更重要,还是接受制度必然崩解并重新定义人类在数学中的角色更重要?

什么不会被改变

Claude 的论文在"什么不是结果"一节花了不寻常的篇幅划清边界:该结果"在任何方向上都不影响黎曼猜想本身"。论证只产生下界——证明至少 2/3 的零点在临界线上,对剩下 1/3 不做任何判断——它们不是被证明偏离临界线,而是根本不在这个证书的覆盖范围内。

技术的极限是结构性的。论文指出,用于产生这些结果的输入——函数方程、显式公式、长度不超过 T 的 Dirichlet 多项式的均值——对于 o(N) 个偏离临界线的零点是不敏感的,甚至可以被满足"黎曼假设为假"的 Davenport-Heilbronn 函数所满足。方法也无法通过当前路径改进常数:给定仅使用迹和 Frobenius 范数以及块结构信息,所用的不等式是最优的。

这既是诚实,也是一种声明。在 AI 公司以新闻稿和博客文章发布数学成果的时代——莱顿宣言对此明确警告——Anthropic 选择同时发布一篇包含完整证明、Lean 形式化和明确边界声明的学术论文。这一选择本身为 AI 时代的数学成果发布标准提供了参照:不是"AI 解决了 X"式的标题,而是"AI 在 X 上做出了特定贡献,这里是完整证明,这是边界,这是不能推出的结论"。

Anthropic 明确表示不期望 Claude 使用的技术最终能证明黎曼猜想。但这一结果作为"意外的副产品"——来自一个原本针对完全不同目标的实验——本身已经足够说明问题。AI 在数学研究中的角色不再是可以被忽略或简单抵制的问题。数学界正面临的选择不是"是否接受 AI",而是在 AI 已经在能够在特定条件下产生新知识的情况下,如何重新定义验证、归属和意义的标准。

来源

  1. Anthropic Research: Learning more about Claude's mathematical capabilities · Anthropic
  2. An unreleased Anthropic model made progress on one of math's biggest unsolved problems · TechCrunch
  3. More than Two Thirds of the Zeros of the Riemann Zeta Function Lie on the Critical Line · Anthropic (Claude-authored)
  4. Lean formalization of Riemann zeta results · Anthropic
  5. Thoughts about the Leiden Declaration · Timothy Gowers
  6. Leiden Declaration on Artificial Intelligence and Mathematics · Leiden Declaration Working Group
  7. Ten advances in mathematics and theoretical computer science · OpenAI

评论

登录后即可参与评论。

加载评论中…

相关文章

  • Andrew Bird 手持手机,他的 AI Agent 在预订健身房课程时发现了系统漏洞

    从沙箱到健身房:消费者 AI Agent 的安全边界早已失守

    算法 · 2026-08-10

  • 微软 Copilot 的动画角色 Mico,本次将从 Copilot Voice 中移除并迁往 Learn Live

    微软合并 Copilot 应用、下线五个功能,Deep Research 改为付费项

    算法 · 2026-08-13

  • X 应用设置中的 Under the Hood 透明度工具截图,展示可下载账户与帖子排序标签 JSON 数据的功能

    X 开源推荐排序代码,违规判定仍留在黑箱里

    算法 · 2026-08-13

  • 该预印本的泛化热力图,展示训练后的说服者对不同目标模型在五个基准数据集上的说服成功率

    一条假论点让 LLM 放弃正确答案:RL 说服者把准确率从 66% 降到 1.8%

    算法 · 2026-08-13

  • Anthropic 地盘战实验的结局分布图:Mythos 5 约 98% 的试验以停战告终,而 Sonnet 4.6 与 Opus 4.6 多数以武力解决或悬而未决

    更强的模型不会自动带来协调:Anthropic 的多智能体失败实验

    算法 · 2026-08-13

  • 智能手机屏幕上 Google Gemini 应用图标的特写照片

    Gemini 月活破 10 亿,但与 ChatGPT 的 10 亿是两个口径

    算法 · 2026-08-12

AGIDaily跟踪世界 AGI 进展© 2026 AGIDaily
关于邮件栏目主题定制投稿招聘广告SkillTermsContactRSS