深度 · 小互解读

陶哲轩在国际数学家大会讲 AI:AI 证明会越来越多,但数学不会因此变快

他把数学研究拆成五步流水线,AI 大幅加速的只有第一步,剩下四步越往后越慢、越离不开人。
一分钟速览
  • AI 现在真能解出研究级的数学题了:First Proof 拿十道全新问题去测四个 AI 系统,七道题有人答到了可发表的水平。而埃尔德什问题网站上已经堆了近二十份 AI 声称的解答,没有人类专家愿意去验证。题解得出来了,后面几步没跟上。
  • 7 月 24 日国际数学家大会的公开讲座上,陶哲轩讲的就是这件事。他不去争论 AI 到底行不行,而是请听众先假设它行,然后问:那我们这行该怎么办。
  • 他把数学研究拆成一条流水线:解出证明 → 验证正确 → 写得能读懂 → 被同行接受 → 写进教科书。AI 大幅加速的只有第一步,越往后越慢、越需要人,也越值钱。
  • 最反直觉的一条:证明写得太顺滑反而有害。他放了一张自己年轻时批注 Bourgain 1991 年论文的照片,纸上写着「AARGH!」和「我讨厌 Jean Bourgain」。那些卡住人的地方,正是逼读者慢下来真学懂的地方。
  • 他给同行的处方是三条:把 AI 使用的披露常态化;把力气从抢着解题转到把证明消化掉;以及最硬的一条:讲不清自己的结果,就不该发表。
现场

AI 已经能解出研究级难题,麻烦从这儿开始

埃尔德什问题网站上,现在堆着几十份 AI 生成的证明。

这些证明里有不少很可能是对的。问题是没人验。

有能力验的人当然存在。难的是没有一个够格的数学家愿意花那个时间,去读一份不知道谁写的、可能几十页长的东西,然后签下自己的名字说「我确认它成立」。有几份提交,连交上来的人自己都写明了:我没有资格判断它对不对。

陶哲轩在讲台上就着这件事问了一句:我们会不会哪天拥有一个被验证过的重大结果的证明,却没有任何一个人类理解到能把它讲清楚?

而 AI 解得出研究级数学题这件事,已经不是设想了。

First Proof 是一个独立的评测项目,专门测 AI 在研究级数学上的真实水平。它的做法是找一批数学家交出自己研究中真实碰到过、已经解出但从未公开发表的问题,网上和文献里都搜不到答案。第二批一共十道题,横跨可计算性理论、离散几何、随机偏微分方程、冯诺依曼代数等方向,五月底在受控条件下交给四个 AI 系统各答一遍,每题只有一次机会,中途不许人插手。答卷送去盲审,约三十位对应领域的专家评审,每份至少两个人看。

7 / 10
至少有一个 AI 系统答到可发表水平的题数
39 份
四个系统交出的答卷总数,由约 30 位专家双盲评审
1 道
四个系统全军覆没、无一取得实质进展的题(度量几何)

其中一道随机偏微分方程的题,有个系统给出的解法跟人类作者的完全不同,评审说印象深刻。

7 月 24 日,费城。四年一届的国际数学家大会正在开会,这是数学界规格最高的场合。陶哲轩做了一场面向公众的讲座,题目是《AI 时代的数学》,52 页幻灯片。

他讲的题目是:AI 已经能做一部分数学了,这一行接下来该怎么办。

关于「AI 到底行不行」,他专门写了一页,然后说今天不谈

他把这个问题写成了一个数学猜想的样子,而且故意留满空格:

AI 能力猜想 · 模板

不久的将来某个时候某些 AI 工具将会,在某种成本下,在某种程度的人类监督下,正确完成某些领域里某些研究级的数学任务,具有某种非平凡的成功率,以及某种程度的正确性和质量。

高亮的地方全是占位符。你怎么填,就得到这个猜想的一个具体版本。争论 AI 能力的人,其实各自在填不同的空。

他说粗糙地分成弱形式和强形式就够用了。这两种情况下,这一行该做的事完全不同:

连弱形式都是假的

那大家可以放心地把 AI 当成长期无关紧要的东西,照常过日子。

最强的形式是真的

那想维持现在这套文化和实践就很困难,尤其是当我们把「解出尽可能多的未解问题」当成头号目标的时候。

然后他说,今天这场讲座不谈这个猜想。

他的理由是这场争论已经卡住了。支持和反对的数据点都有一大堆,但大多不是在受控的科学条件下收集的;公开能看到的那些,高度受报道偏差和各种非科学动机的影响,一些关键的成本和变量根本没有披露。他还提醒了一个容易被混过去的区分:一个说法是不是真的,跟我们希不希望它是真的,完全是两回事。

所以他换了个办法:请听众先假设 AI 能做到,把它当作一个前提接受下来。他管这叫「工作假设」,并且专门说明:我不是要求你想要它成立、相信它成立或者接受它成立,这是一个条件分析。支持或反对这个假设的证据,跟我今天要讲的东西是不相干的。

他给这件事的定性是:基础危机,而且是第二次

头一次发生在一百年前。在那之前的几百年里,数学一直靠一套「朴素的」基础在运转:什么是集合、什么是数、什么是无穷、数学的公理到底是哪些,这些问题基本丢给了哲学家。1901 年的罗素悖论和 1931 年的哥德尔不完备定理,逼着一线数学家回过头去查自己一直默认的那些假设。

那三十年动荡,但产出极有价值:一套明确的、严格的、标准化的基础框架。它经受住了严苛的检验,今天仍然是数学可以信赖的工作环境。

陶哲轩说,我们正在进入一个类似的动荡期。上一次要重查的是逻辑地基,这一次轮到了这一行的价值观和干活方式。他也给了同样的结论:等我们把这些东西彻底检查一遍、明确写下来,这个共同体会比以前更强、更有韧性。

机制

AI 能帮你多解题,但多解题真的是目的吗

AI 写得快只是表象。那些证明堵在那儿的真正原因是:「解出一道题」从来就不是这一行唯一要的东西。

陶哲轩在讲座上列了一串做数学研究的理由,多到一张图才装得下:

建立理论
解奥数题
解埃尔德什问题
应用知识
数学知识↖ ↑ ↗ ← → ↙ ↓ ↘
解研究问题
建立共同体
训练下一代
创造有持久审美价值的作品
依幻灯片第 22 页原图重绘为中文,这是他在讲座上列出的那些目标。中心向外的八根箭头是原图就有的,指向什么下面会讲。陶哲轩自己在原图下加了脚注:这张图极度简化了,实际维度应该高得多。

他说,过去这些目标基本是同向的:在一个上面有进展,通常另外几个也跟着走。所以可以拿其中一两个当其他目标的代理指标,很多目标甚至不必说出口,隐含着就够了。

但所有指标被往死里优化的时候,都会撞上古德哈特定律:一个衡量标准一旦变成大家要冲的目标,它就不再是一个好的衡量标准。

陶哲轩在这里加了一句:生成式 AI 本身是「无根据的」(它的输出不锚定在任何事实上,也没有内在机制保证自己说的话为真),再加上 AI 公司的财务激励,这两样叠在一起,让 AI 工具的使用特别容易触发这条定律。

于是过度的 AI 优化,会让这些原本大体对齐的目标互相发散。他在讲座上是用连着三页的图讲这件事的:

过去

几个目标基本同向。推进其中一个,其余大体跟着走,所以可以拿一两个当其余的代理指标。

被过度优化之后

同一批目标各走各的。代理指标失效:解题数字上去了,其余几个目标未必跟着动。

依幻灯片第 20、21、22 页三张图重绘为中文对照(原图三页递进:先是几乎同向,再是夹角拉开,最后是上面那张八方发散)。两个中心圆都代表「数学知识」。

这张图值得对着自己所在的行业看一眼。任何一个行业都能列出一串这样的目标,也都习惯了拿其中一两个当其余的代理,因为过去它们确实一起走。而 AI 恰恰最擅长把其中某一个指标单独拉到极高。

那到底该要哪几件事?接下来是全场的主体,陶哲轩当着全场的面,把目标改了五次。

拆解

从解题到写进教科书,AI 只加速了第一步

他挑的是「解决问题」这一件事。他特意说明这只是这一行的一个方面,理论建构是同等重要的另一面,需要单独分析,但解题这块最容易被 AI 冲击。

下面这条流水线,就是他改了五次改出来的。点标签看它怎么一步步长出来:

目标 · 第 1 版解出尽可能多的未解问题。
目标 · 第 2 版解出尽可能多的未解问题,并且验证它们是对的
目标 · 第 3 版解出尽可能多的未解问题,验证它们是对的,并且确保结果能被清晰地传达、被数学共同体理解
目标 · 第 4 版解出未解问题,验证正确,确保能被清晰传达,并且被共同体消化和接受
目标 · 第 5 版解出未解问题,验证正确,确保能被清晰传达,被消化、被接受,并且被纳入这个领域的定论理论
开放问题
证明生成AI 大幅加速
证明验证AI 帮得上,形式化工具能查
验证过的解
证明表述AI 记录喜忧参半
写得好的解
证明发表慢,靠人类编辑与审稿人
被接受的解
证明经典化最慢,需要共同体审议共识
定论理论
依幻灯片第 24、26、29、37、43 页的五张流程图重绘并合成为中文交互版。每一段右侧那句「AI 能不能顶」是把陶哲轩在对应几页正文里的说法改写成一句,原图上没有这个标注。

第 1 版:解出尽可能多的未解问题

这个目标听上去没毛病,网络也简单:一头是开放问题,一头是解,中间一根箭头叫「证明生成」。

风险早在 AI 出现之前就知道了:你会收到大量对重大问题的错误解答。任何一个做数论的人都收到过声称证明了黎曼猜想的邮件。

第 2 版:加上「验证它们是对的」

流水线长出第二段:生成出来的先叫「未经验证的解」,验证过了才算数。

这一段 AI 确实帮上了忙。Lean、Rocq、HOL 这类证明助手能把数学证明写成计算机可以逐行核对的代码;让 AI 来做这个翻译,叫自动形式化。

人来验

读懂整个论证,判断每一步是否成立。需要一个懂这个方向的专家,花上几天到几周,而且他得愿意为结论署名。

会累,会漏,也会因为「这不算我的研究成果」而根本没人接。

机器来验

把证明翻译成 Lean 这类语言写的代码,编译器逐行核对,过了就不会有逻辑漏洞。

前提是得先有人(或 AI)完成那次翻译,而翻译本身就是一件很重的活。

陶哲轩说,生成和验证这两端,AI 都已经在很多情况下大幅加速了,而且按工作假设,这个加速还会继续。

然后他抛出那个问题:如果 AI 生成了一份很长的证明,没有人看得懂(包括那个把题目喂给它的人),怎么办?

这就是开头那些堆在埃尔德什问题网站上的东西。机器可能验得过,但没有一个人能站出来说「我懂了,我担保」。

第 3 版:加上「能被清晰地传达和理解」

流水线又长出一段:验证过的解,还得变成「写得好的解」。中间这一步叫证明表述。

而这一步,AI 的表现最奇怪。

反直觉

写得太顺,读者反而学不会

陶哲轩对当前 AI 写数学的评价是分裂的。

好的那一半

拼写、语法、格式几乎无可挑剔。

他在这里加了个脚注:可以说是无可挑剔了。

坏的那一半

常常在琐碎的地方长篇大论,却飞快掠过、甚至遮蔽了论证里最有趣、最新颖的那部分。

也常常不指出这个结果跟已有文献的关系,不给一个高层次的概览。

同样的观察也出现在别处。First Proof 那批盲审专家的报告里,同一条毛病被反复记录下来:AI 的解答倾向于把例行的部分做得极其细致,却在最难的几步上一笔带过,有时候直接断言某个关键结论「由标准论证即得」,不给理由;有时候引用的论文里根本没有它说的那个结果。

报告里还记了一件更难看的事。有一道题的几份 AI 解答,逐行借用了出题人自己早先那篇论文的措辞,连自造的术语(T-patterns、bends)和公式标号(B、T、D、H)都照搬,却从头到尾没有引用那篇论文一次。评审写下的原话是:如果这是人交上来的,会被判抄袭。

更深一层:表述也会被优化过头

表述是个比验证模糊得多的优化目标。按工作假设,AI 迟早会把表述能力提上去。可即使提上去了,还有一个问题:表述本身也会被过度优化。

一份证明可能被写得太顺滑了:论证里例行的部分和真正困难的部分,被呈现得同样容易消化。

而在人写的证明里,作者当年觉得难的地方,通常会留下某种自然的摩擦:句子变涩,跳步变多,语气变紧。这些痕迹在提醒读者,这儿慢下来,多看两眼。

过度的 AI 润色会把两种摩擦一起抹掉:人为的(作者偷懒、没写清楚),和自然的(这里本来就难)。抹平之后,读者顺顺当当滑过去了,却没有被鼓励去真正理解论证里的关键想法。他用了「悖谬的是」这个说法:人类表述里的那些「瑕疵」,最终可能对读者是有帮助的。

人写的证明
线的高低表示读起来顺不顺:位置高就是读得顺,下陷就是卡住。两处凹下去的地方,就是作者当年也卡过的地方,句子变涩、跳步变多、语气变紧,读者被迫慢下来,真看懂了。
过度润色的证明
从头到尾一样顺,读者一路滑过去,什么也没学到。
示意图,本站所画,幻灯片里没有这张图。

说完这段,他放了一张照片。

一篇 1991 年 Bourgain 论文的对开页,页边和行间写满钢笔手写批注
幻灯片第 33 页。陶哲轩给这张照片的说明只有一句:「一篇 1991 年 Bourgain 的论文,被年纪小得多的我批注过。」Jean Bourgain 是比利时数学家、菲尔兹奖得主,调和分析领域的大家,2018 年去世。
同一页局部放大:印刷体 We skip the details 下面手写着 AARGH,旁边是三个问号和 I hate Jean Bourgain
同一页的局部放大(本站截取)。印刷体那句「We skip the details.」(细节我们略过)被划了一道横线,横线下面写着 AARGH!;右边是三个大问号,再往右是「Sobolev norms!」;上面那行手写是 「I hate Jean Bourgain.」(我讨厌 Jean Bourgain。)

这张照片就是那个论点的实物证据。

Bourgain 写下「细节我们略过」,年轻的陶哲轩读到这儿卡死了。他划线、打问号、写下「Sobolev norms!」提醒自己该往哪个方向想,最后在页边上写了一句「我讨厌 Jean Bourgain」。

三十多年后,他把这一页拍下来,放到国际数学家大会的屏幕上。正是这些卡住他的地方,逼着他慢下来,把那套东西真的学会了。一份每一步都同样顺滑的证明,不会给读者留下这样的位置。

紧接着他引了 William Thurston 1994 年那篇《论数学中的证明与进步》里的一段:

我们不是在完成某种抽象的、关于定义、定理和证明的生产配额。衡量我们成功与否的标准,是我们所做的事情能否让人们更清晰、更有效地理解和思考数学。

William Thurston,《On proof and progress in mathematics》,1994
诊断

证明多了,数学却没有变快

写得让人看懂,还只是第三步。

第 4 版:加上「被共同体消化和接受」

一份证明要真的对这个领域有贡献,光是正确、易读还不够。别的数学家得消化它,把它吸收进自己的工作里。

作者能帮上忙:讲讲自己当初卡在哪、怎么想通的、为什么选这条路,这些东西能让别人更快吃下去。但当前的 AI 工具对自己的求解过程相当不透明,那些内部运作属于商业机密的专有模型尤其如此。

而共同体接受这件事,本质上是慢的、人的。好的表述和仔细的写作能促进它,但它终究是一个外部过程,没法由作者和他手上的 AI 单方面优化完成。

这套东西现在靠什么运转?靠人类编辑和审稿人自愿提供服务。陶哲轩点了一句:这份工作常被认为不如生成证明那么有声望,但它是不可或缺的一环,是把数学家的个人成就转化成集体进步和理解的方式。

AI 可以在这里当过滤器,比如期刊可以自动退掉那些被标记为验证不充分或表述不合格的稿子。但过滤器替代不了接受本身。

第 5 版:加上「被纳入这个领域的定论理论」

就算发表了,也不总是一个解的终点。关键结果最终要进入这个学科的权威教科书和参考资料,成为教给下一代学生的标准说法。陶哲轩管这一步叫经典化(canonicalization)。

这是所有阶段里最慢的一个,需要整个共同体广泛的、审议式的共识,也是最不适合被 AI 优化的一个。

但他说,它是整个流程里最有价值的部分。理由有两条。第一,很多应用只有在底层数学被彻底消化之后才变得可行。第二条更要紧:AI 工具今天在数学上的成功,恰恰关键性地依赖于人类数学家几个世纪里辛苦建立起来的那些经典理论。模型能解题,是因为前人已经把这一行整理成了它学得动的样子。

五步走完,诊断也就出来了

如果 AI 真能干这些活,而政策和文化不做相应改变,这条流水线上到处都会出现「阻抗失配」(impedance mismatch)。这是个电路里的词,指两段线路接口对不上,能量卡在接缝处过不去。他也用了一个更直白的说法:证明消化不良。

具体是四处堵:

堵在验证前AI 生成的证明会堆着,等人验证。
堵在表述前很多已经验证过的,会等着一份人能读的写法。
堵在评审前就算要求它既正确又写得好,数量也会压垮传统的同行评审系统。
堵在经典化前就算发表出来了,也多到共同体没法把它们整合成定论形式。

一句话:我们将从证明稀缺的时代,转入证明过剩的时代。

证明生成AI 大幅加速
证明验证形式化工具帮得上,但要人来判断值不值得验
证明消化写清楚、发表、进教科书,人的速度
三段速度差示意图(本站所画,幻灯片里没有这张图)。条的长度只表示相对快慢,不代表任何实测数据;右端的斜纹表示东西堆在接缝处过不去。

这些迹象已经在出现了。他说,事实上早在现代 AI 出现之前,压力就已经在积累。

他自己用过一个更好懂的类比

三个月前,他在社交账号上把这条流水线换成了做饭:

证明生成 = 采集食物 证明验证 = 清洗检验 证明消化 = 烹饪

一个习惯了食物稀缺的社会,瓶颈在能不能弄到吃的。别人清洗和烹饪的辛苦当然也被感谢,但真正有声望的是打回猎物的人。这时候几乎任何无毒的肉和菜送到公共餐桌上都会被欢迎,也总找得到志愿者把它做成一顿饭。

一个食物充足社会的百家宴就不一样了。随便送来的生食材不再受欢迎:一个陌生人扔下一具来路不明的野兽尸体让别人去清洗烹饪,不会有人谢他(除非这具猎物背后有个特别独特有趣的故事,而且能保证肉是安全的)。就算是检验合格、包装完好、可以直接吃的成品餐,通常也只能算餐桌上的一部分。真正被看重的,是社区里信得过的人用心做的家常菜,因为围绕这些菜产生的对话本身就是聚会的一部分,也是训练下一代厨师的机会。

出自陶哲轩 2026 年 4 月 27 日在 Mastodon 上的一串帖子,不是本次讲座的内容。本站认为它比幻灯片上的说法更容易懂,故补录。

在同一串帖子里,他给了一个观察,比幻灯片上任何一句都更直接:证明生成这一端的大规模加速,实际上并没有带来数学进展本身的显著加速。

他还提到一个副作用:一个问题被 AI「解决」了却没人看得懂,反而可能扼杀掉别人继续研究它的兴趣。毕竟它已经「解决」了,尽管没有任何人类理解那个解。

建议

那数学家该干什么

既然堵在后面几步,力气就该换个地方花。

他推荐莱顿声明作为起点。这份倡议今年 6 月 2 日上线,起点是 2025 年 9 月在莱顿大学的一次研讨会,由十六位数学家组成的工作组起草,成员来自剑桥、哥伦比亚、牛津、莱顿、苏黎世联邦理工等机构。它已经得到国际数学联盟的背书,也就是主办这次大会的同一个组织。

陶哲轩从声明里挑了四条,配了三句自己的评论。

声明 · 第 1 条披露工具使用
透明地披露自动化工具的使用,包括大模型、机器学习系统、证明助手和其他数学软件。在论文里加一节「工具与算力资源披露」。担任评审时遵守出版方的规定;如果允许使用 AI,就公开你是怎么用的,并对自己给出的重要意见负责。
陶哲轩的评论需要避免最坏的情况:作者偷偷用 AI 帮忙,却把这件事藏起来,以免招来同行批评。要把负责任的披露常态化。
声明 · 第 2 条支持评审的需要
在写论文时使用 AI,会引入让评审变得更吃力的内容。通过披露工具使用、给出精确完整的既往结果引用、在可行且合适的时候提供形式化证明,让同行更容易评审你的工作。
陶哲轩的评论我们需要降低对证明生成、对「第一个解出来」的强调,提高对证明消化(proof digestion,也就是表述、发表、经典化)的强调。
声明 · 第 4 条 + 第 6 条保留正确性责任 · 在正确归属上下功夫
在已发表的数学研究中使用自动化技术时,论证与结果的正确性和充分性,以及对相关前人工作引用的完整性和准确性,责任完全在人类作者身上。自动化工具在正确归属想法方面的已知局限,产生了一项对应的义务:主动去寻找并致谢那些让新结果成为可能的来源;做不到令人满意的归属时,在出版物里明确说明这一点。
陶哲轩的评论,也是他给的那条拇指规则如果作者不能令人信服地证明,他们能就自己的结果做一场清晰的、专家级别的、正确且归属得当的报告,那这个结果就不应该被发表。

需要说明的是,莱顿声明本身比陶哲轩取用的这四条宽得多。它还有专门章节谈 AI 用于战争、大规模监控、破坏民主和环境代价,呼吁加强对 AI 产业的公共监督,其中给政策制定者的一条直接叫「别信炒作」。这场讲座只取了操作层面的部分。他讲的是数学共同体自己该怎么干活。

他自己在幻灯片上做了两次披露

第一页的脚注写着:这些幻灯片里所有的破折号都是人工敲的。(长破折号现在常被当成 AI 写作的标记。)

讲到「把披露常态化」那一页,脚注写着:本幻灯片使用了 AI 工具来自动补全文字和生成图表。

两句都没放进正文,就搁在页脚。

最后

他说解题只是一个方面。同样的分析还需要在教学、指导学生、招聘、经费申请、公众传播上各做一遍。在一些领域(尤其是教育和训练),需要强调工作中人的那一面,严格限制 AI 工具的使用;在另一些领域,则需要主动出击,按我们自己的条件去定义怎么把这些工具纳入工作流。还需要新的工作流和新的基础设施来补充传统的那些,但那是另一场讲座。

他留给全场的最后一句是:我们的共同体需要坐到一起,就 AI 能力和我们的目标与价值观,进行开放而诚实的讨论。

正文的最后一页,他没有再加评论,只放了莱顿声明的第 7 条:

莱顿声明第 7 条原文截图:Participate in public discourse
幻灯片第 51 页,整场正文的最后一页,画面上只有这一条,没有配任何文字。中文见下。
声明 · 第 7 条参与公共讨论
数学家有责任支持严肃的科学新闻报道,并参与公共讨论,去解释 AI 辅助的方法与结果,把它们放回恰当的语境里。这一点在我们自己所在的子领域内尤其重要,因为评估一个结果的深度、难度和意义,需要专门的知识。此外,我们鼓励数学家寻找机会,与面临类似挑战的其他研究者和创作者合作,并给予他们支持。
幻灯片末页还列了几个他认为值得关注的新工作流与基础设施:Mathlib(Lean 的数学库)、埃尔德什问题网站、他自己发起的优化常数众包数据库、以及他参与联合创办的 SAIR 基金会的公开竞赛。还有一项写着「Mathematical Discourse」,后面跟着 TBA,尚未公布。
来源
Mathematics in the age of AITerence Tao · ICM 2026 公开讲座·幻灯片 PDF·2026-07-24
本站说明
两张论文批注照片来自幻灯片第 33 页,第二张是本站截取的局部放大。五步流水线图与目标发散图是本站按幻灯片第 22、24、26、29、37、43 页原图重绘的中文版;三段速度差是本站所画的示意图,不含实测数据。First Proof 的评审细节、题目领域与四档评级来自其第二批报告(arXiv:2606.18119),幻灯片上只有一行结论;陶哲轩在讲座中给的单题成本区间是 10 到 1000 美元,报告里的实际数字是最低 8 美元、最高 951 美元。需要说明的是,陶哲轩本人是受测的四个系统之一(UCLA Moonshot Harness)的团队成员,幻灯片中未提及这一点。食物类比出自他 2026 年 4 月 27 日的 Mastodon 帖子,不是本次讲座内容。