模型发布

Claude替数学家啃黎曼猜想,未解但把下界从41.6%抬到67.2%

Anthropic让未发布的Claude研究版去试黎曼猜想,虽未证明猜想本身,但把符合黎曼猜想的zeta函数零点比例下界从41.6%提到67.2%,一次抬升25个百分点,反映出大模型在长链形式推理上的新进展。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
Claude替数学家啃黎曼猜想,未解但把下界从41.6%抬到67.2%

Anthropic最近放出一篇研究记录:让旗下大模型Claude去啃黎曼猜想这种级别的纯数学难题。结果不算"破解",但出现了一个意外收获——一个尚未对外发布的Claude研究版本,把符合黎曼猜想的zeta函数零点比例下界,从此前的41.6%抬到了67.2%。这意味着AI在严肃数学推理上又往前走了一步。

黎曼猜想研究的是zeta函数非平凡零点的分布。1859年提出至今161年,没人能完全证明,也没人能否定。数学家通常用"零点中满足黎曼猜想条件的比例"来衡量研究进展——这个比例越接近100%,说明我们离最终答案越近。

这25个百分点的分量

  1. 6%到67.2%,听上去像一次普通数字更新。但放在这个领域,这意味着数学证明下界被一次性抬高了超过25个百分点,不是渐进式优化,而是一次结构性推进。研究披露,Claude在长时间自主推理中尝试了大量假设,并自我修正路径,最终给出的结果可被独立验证。

更值得注意的是过程:Claude并不是直接给答案,而是按研究助手的方式工作——生成子命题、检验反例、修补漏洞。这种"长时间思考+自我修正"的范式,正是过去两年大模型在数学、代码、Agent方向上努力的方向。

AI做数学,能做什么不能做什么

这件事给行业带来几个判断。第一,AI在纯数论这种高度抽象、需要长链推理的领域也能产出可验证成果,不再只是写代码、做题库。第二,结果仍依赖人类研究员的提问、拆解与验证,AI更像一个不知疲倦的合作者。第三,模型版本之间的差异比想象中大——未发布版本能做到的事,公开版未必做得到。

开发者能借力的地方

对国内做AI应用、研究Agent、做数学工具的团队来说,这条线索值得复现。Anthropic公开了思路而非完整解题过程,但提供了方法框架:用模型反复试错,再用符号计算工具做校验。这类工作流可以嫁接到形式化验证、定理证明、代码安全分析等更现实的场景。

对企业用户而言,重点不是"AI能做数学研究",而是"AI能不能在一个封闭领域里长时间不出错地推理"。如果这条能力被打通,金融建模、合规审查、芯片验证等高门槛任务都会迎来新的工具组合。

中文用户该看的几个点

首先,关注模型版本与能力的"代差"。研究版领先不代表公开版可用,付费API什么时候能用上,是普通用户更在意的事。其次,留意Anthropic、OpenAI、Google DeepMind在这类数学基准上的新一轮比拼。最后,国内大模型在形式化推理、长链思考上仍有差距,这条新闻可以当作对照参考。

接下来值得观察的几件事

一是Anthropic会不会把相关能力下放到公开Claude;二是同行是否会独立复现67.2%这个数字;三是这类研究是否会被引入数学竞赛、AI for Science的标准化评测里;四是国内厂商如何回应"AI做基础科学"这种叙事。短期内,模型做基础数学不会立刻变现,但它会改变人们对AI能力上限的预期。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具