发生了什么
8月10日,Anthropic发布研究简报,披露其尚未公开的研究版Claude在黎曼猜想上取得重要进展。黎曼猜想由德国数学家波恩哈德·黎曼于1859年提出,核心命题涉及素数分布的规律性,是克雷数学研究所悬赏100万美元的七大千禧年难题之一。在此次测试中,Claude将黎曼ζ函数临界线上零点比例的可证明下界从41.6%提升至67.2%,提升幅度达25.6个百分点,为数十年来最大改进。
自主科研过程解析
值得注意的是,这一成果并非由数学家精心引导完成。据Anthropic披露,一位不具备深厚数学背景的内部员工向模型发出「认真尝试证明黎曼猜想」的指令后,任由模型自主协调任务推进。在36小时内,模型测试了650种不同解题思路,调动60个子智能体分工协作,累计执行2400条Shell命令,编写数百个Python脚本,消耗3100万输出Token。
- 零点比例下界从41.6%提升至67.2%,为数十年来最大幅度改进
- 模型自主组织60个子智能体,在Claude Code中运行36小时
- 累计执行2400条Shell命令,编写数百个Python脚本
- 消耗3100万输出Token,经历650次失败尝试后调整策略
企业读者关注点
这一事件对企业决策者的意义不在于黎曼猜想本身,而在于它验证了AI系统在复杂知识工作中的自主性边界。首先,AI已能在前沿数学领域产出有意义的进展,尽管尚不能给出完整证明;其次,多智能体协作和长流程自主执行正在成为现实,这对企业的研发流程自动化有直接启示;第三,3100万Token的消耗量意味着此类自主科研的成本正在快速下降。Anthropic表示,相关代码和方法将开源,供学术界进一步验证。

