文章上線

Anthropic 的 Claude 将费马大定理形式化:有史以来最长的计算机检验证明

Anthropic 的 Claude 将费马大定理形式化:有史以来最长的计算机检验证明

目录

你可能想知道的事

• 一个 AI 如何能在如此短的时间内完成费马大定理的完全计算机验证形式化证明?

• 一个包含 1300 万行、可机器检查的证明对数学实践意味着什么?

主要主题

在 2026 年 9 月,Anthropic 报告其 Claude AI 在大约 11 天内产生了费马大定理的完整形式化、计算机检验证明。该结果非凡的原因在于输出是一个完整、可由证明助理逐行检查的机器可验证版本,将 Andrew Wiles 在 1995 年的著名证明翻译成形式化的证明语言。成品中的每一个推理都可以根据系统使用的公理与逻辑规则被机械地验证,而不仅仅依赖人工同行评审。

费马大定理在 1637 年提出,断言不存在三个正整数 a、b、c 在指数 n 大于 2 的情况下满足 a^n + b^n = c^n。皮埃尔·德·费马著名地声称自己有证明但未留可用手稿,该定理直到 Andrew Wiles 在修正与 Richard Taylor 的初步尝试后于 1995 年发表正确的 129 页证明才被解决。Wiles 的论证依赖于费马时代不存在的现代工具,这也是大多数学者怀疑费马本人所称的简单证明的原因。

将人类撰写的证明翻译到像 Lean 这样的形式系统,需耗费大量精力把每一个定义、引理与推理重新以机器可检验的语法表达。传统的数学阐述常常省略常规步骤、诉诸标准结果或使用对人类清楚但对证明助理而言模糊或不完整的简洁高层推理。形式化通过要求对每一个逻辑转换给出明确且可验证的步骤,消除了这种模糊性。

Claude 的项目产生了约 1300 万行的形式化证明代码,据报涵盖超过 30,000 个辅助定理,并生成了一个远大于数学家使用的既有共享库的作品集。Anthropic 描述了一个多代理工作流程,许多 Claude 代理并行工作以创建定义、证明中间引理,并将这些部分组装成更大的结构。一个名为 Prove2Me 的协调工具提供了同步的待办列表并组织文件,以防代理重复劳动或丢失先前结果。

代理工作流程的早期迭代经常遇到失败:代理重复工作、丢失上下文或产生不一致的产物。据报约 7% 的最终行数反映了那些错误的起点。协调层和对中间结果的系统性英文注释使得可复用并减少冗余的证明尝试,从而使系统能有效地扩展形式化工作。

Claude 的最终输出并不是新的数学发现,而是 Wiles 早期结果的一个完整、确定性的、可机器检验的编码。Kevin Buzzard(在帝国理工学院领导一个人工进行的 Lean 形式化 Wiles 证明项目的数学家)审查了 Claude 的输出并确认它在被接受的数学公理下确立了该定理。Buzzard 的人工项目始于 2024 年并获得资助至 2029 年;Claude 的自动化努力则在更短时间内完成了形式化。

生成证明与验证证明之间的区别很重要。数学正确性依赖于每一个逻辑步骤;人类撰写的证明可能隐藏微妙的漏洞,需要后来的审阅者仔细查核。形式化创建了一个可由证明助理根据所选基础公理认证为正确的记录。对于大型、复杂的定理,形式化可以提供比单纯人工检查更强的保证,避免被忽略的推理或隐含假设。

历史例子显示在没有形式化的情况下,验证可能既缓慢又具争议性。计算机辅助证明如开普勒猜想,以及像 Perelman 对庞加莱猜想的复杂人工论证,都花了多年让社区对其正确性建立信心。可机器检验的证明通过使每一步明确且可机械验证,减轻了人工审阅者的负担,尽管形式化证明仍需要对所做的形式化选择(定义、库与编码)进行仔细审查。

Anthropic 已公开发布该 1300 万行的形式化(例如在 GitHub 上),因此任何数学家都可以详细检查该作品。该产物的体量——相当于数百本内容密集的常规书籍——凸显了形式系统所要求的颗粒度与人工审查的实际挑战。研究人员与从业者现在可以检查完整的形式化痕迹、本地重现检查,并探索形式化开发的组织与依赖关系。

从实际层面看,Claude 的成就表明现代 AI 系统结合协调工具与证明助理生态的精细工程,能够在规模上执行冗长的形式化任务。对于数学社区,这暗示了用于验证大规模结果的新工作流程、加速证明助理库的开发,以及促成可重复、机器检验的数学。对于 AI 研究,该事件凸显了平行代理化、工具化与人工监督的结合,使大型形式化工作成为可处理的事务。

关键洞见表

方面 描述
关键事实 1 Claude 在约 11 天内产生了费马大定理的完全形式化、机器检验证明。
关键事实 2 该形式化约为 1300 万行并包含超过 30,000 个辅助定理,其规模超过许多现有库。
关键事实 3 协调的多代理工作流程与工具(Prove2Me)帮助管理并行工作并减少重复。
关键事实 4 Kevin Buzzard 与其他人已验证该形式化遵循被接受的公理;输出已公开供检查。

之后...

直接的結論是,自動化形式化如今在曾被認為難以達到的規模上已實用。未來,數學與更廣泛的科學社群應探索若干方向:改進證明助理庫以減少形式化負擔;為混合人–AI 團隊開發穩健的協調框架;以及建立發佈與審查機器檢查證明的最佳實踐。

進一步的技術進展可側重於降低形式化編碼的冗長性、增強不同證明助理間的互操作性,並創建更高層次的抽象,使數學家能在保持機器可驗證性的同時更簡潔地表達論證。從社會與制度角度,期刊、資助機構與研究小組可能需要調整規範與基礎設施,以處理機器檢查產物——包括學術貢獻的認定與形式化庫的長期維護。

最終,形式化證明的價值在於其可重複性與清晰性:它們使假設明確、啟用自動驗證,並創造可被無限次重檢的產物。隨著工具與實務的改善,形式化可能成為傳統數學論述的常規補充,提高複雜結果的可靠性並擴大可複製、可驗證數學的可及性。

最後編輯時間:2026/9/5

數字匠人

闲散过客