众力资讯网

突发!Claude挑战黎曼猜想「失败」,却意外刷新37年数学纪录

机器之心编辑部

AI向新的数学难题发起了挑战,这次是「黎曼猜想」。

一个诞生于1859年的数学猜想,悬而未决167年,还挂着100万美元奖金。最近Anthropic内部有人给尚未发布的Claude研究版本布置了一个近乎「不讲道理」的任务:

认真尝试一下黎曼猜想。

Bun联合创始人JarredSumner,他于去年12月加入Anthropic

Claude确实认真试了。它先后提出650个思路,全部失败。随后又重新组织约60个Claude子Agent,连续工作一天半,执行2400次Shell命令,写下数百个Python脚本,做了数千次数值检验。最终,黎曼猜想依旧没有被攻克。

但在这次失败的尝试中,Claude碰到了另一个结果。Anthropic披露,这个尚未发布的Claude研究版本,将黎曼ζ函数中已知至少位于临界线上的零点比例下界,由41.6%提高到了67.2%。

换句话说,人类此前能够证明,至少41.6%的相关零点符合黎曼猜想所预测的位置;Claude给出的结果,则把这个可证明的比例推进到了67.2%。

一家风投公司MenloVentures合伙人、研究者Deedy表示,「Claude这次的结果简直离谱,可能是自2013年有界素数间隔突破以来,解析数论领域最重大的进展。它把能够严格证明位于临界线上的黎曼ζ函数零点比例,一口气提高了25.6个百分点。而在此前37年里,数学家们总共只把这个数字提高了0.8个百分点。」

Anthropic两名数学家随后研究并验证了Claude的论文,Claude还给出了对应的Lean形式化证明。数论学家BrianConrey和DanGoldston也在较短时间内审阅了论文。

Anthropic强调,这套方法预计无法直接导向黎曼猜想的最终证明。但这次结果依然提供了一个值得关注的信号:前沿模型的数学能力,正在开始触及真正没有现成答案的研究问题。

167年没有解决的黎曼猜想

黎曼猜想之所以重要,与素数有关。黎曼ζ函数与素数的分布存在深刻联系。1859年,德国数学家伯恩哈德・黎曼提出猜想:ζ函数所有“非平凡零点”的实部都应该等于1/2。

在复平面上,这意味着这些零点全部落在一条垂直线上,也就是著名的临界线。

这个看似抽象的问题影响非常广。大量关于素数分布的数学结论,都可以在假设黎曼猜想成立的前提下得到更精确的结果。它也因此成为克雷数学研究所七大「千禧年难题」之一,完整证明或推翻它都可以获得100万美元奖金。

过去一个多世纪里,没有人能够证明所有非平凡零点都落在临界线上,但数学家可以证明其中一定有一部分位于那里。

于是,一个相对现实的问题出现了:我们至少能够证明多大比例的零点落在临界线上?经过数十年的推进,这个比例的已知下界逐渐提高到了约41.6%。

Claude这次推进的正是这个数字。

从41.6%到67.2%

Claude得到结果所依赖的基础,并非凭空出现。

1973年,数学家HughMontgomery研究ζ函数零点的分布时,引入了一系列重要方法。不过,其中部分分析依赖黎曼猜想成立这一前提。近年来,数学家们的一系列工作,进一步发展了相关技术,使其中一些方法可以在不预先假设黎曼猜想成立的情况下使用。

这意味着,它们有机会反过来帮助研究「究竟有多少零点位于临界线上」。Claude在这些工作的基础上,又结合了EnricoBombieri在2000年前后发表的相关研究,找到了一个新的组合方式。

最终得到的结果是:至少67.2%的相关零点位于临界线上。相比此前41.6%的已知下界,提高了25.6个百分点。

从技术上看,Claude构造了一个合适的函数空间,并利用Weil诱导出的二次型,将位于临界线上的零点和偏离临界线的零点分别对应到正定与负定方向。随后,它利用二次型的秩与一阶、二阶矩信息之间的关系建立不等式。

Anthropic的数学家认为,其中一个关键点,在于Claude没有分别处理正定和负定部分,而是将整个空间放到同一个框架内分析,同时允许二次型具有非对角结构。结合此前数论研究者已经建立的结果,这一步最终导出了67.2%的下界。

这里需要特别说明:Anthropic目前并没有声称这套技术能够继续一路推进到100%,更没有声称Claude距离证明黎曼猜想只差32.8%。

67.2%是一个相关问题上的下界改进,与完整证明黎曼猜想之间仍然存在巨大的理论距离。

3100万输出Token、60个子Agent,

Claude是怎么找到它的?

这次实验同样值得关注的,还有Claude解决问题的方式。整个结果是在两轮ClaudeCode会话中得到的,总计消耗约3100万输出Token。

最初,JarredSumner给Claude下达的要求非常开放:认真尝试一下黎曼猜想。

Sumner本人并非数学家,也没有为Claude指定具体数学路线。

第一轮里,Claude生成并尝试了大约650个想法。全部失败。

Sumner随后让它继续尝试。第二轮持续约一天半。

Claude组织了约60个子Agent,把问题拆成多个方向并行探索。这些Agent一共执行了约2400次Shell命令,编写数百个Python脚本,并针对已知的ζ函数零点进行了数千次数值检查。

不同子Agent之间还会互相审阅结果。

按照Anthropic的说法,Sumner在这一阶段几乎没有提供数学上的指导。他主要做的事情,是不断告诉Claude「继续」「再试试」「相信自己」。Anthropic甚至提到,Claude一开始对自己能否在这样一个著名开放问题上取得真正进展相当怀疑。直到持续探索之后,这个新下界才逐渐出现。

找到结果后,Claude又启动了一轮自我验证。一些子Agent专门负责检查证明,一些寻找反例;Claude还下载了54篇arXiv论文,检查类似结果是否已经由其他数学家得到。

随后,它又让独立Agent从头重新推导了一遍结果。确认没有明显问题之后,Claude主动建议将结果整理成论文,并明确提出:应该找一位真正的数论专家进行人工验证。

Anthropic内部数学家LeventAlpöge和RalphFurman随后开始检查论文,分析它与既有文献之间的关系。与此同时,Claude还与Anthropic员工EricEasley合作,把关键结果形式化为Lean证明。这份形式化结果已经通过Lean标准验证工具Comparator的检查。

Anthropic还邀请了研究黎曼ζ函数的数学家BrianConrey和DanGoldston审阅论文。因此,目前更准确的说法是:Anthropic内部数学家已经对结果进行了研究和验证,并完成了机器可检查的形式化证明,同时两位外部领域专家对论文进行了审阅。这与已经完成传统学术同行评议、形成数学界共识,仍然是两个不同阶段。

更多链接:

参考链接:

https://x.com/AnthropicAI/status/2086867246073401655

https://www.anthropic.com/research/riemann-zeta

https://x.com/jarredsumner/status/2086869681785500011