IMO满分金牌——这是AI数学推理能力的"图灵测试"级别里程碑

2026年7月21日,一个注定被写进AI史的日子:小红书dots团队带着dots-note 3.0模型参加第67届国际数学奥林匹克(IMO 2026),六道题全部满分,42/42分,全球仅7位人类选手获此成绩

这不是一个"AI又考了个高分"的新闻。IMO是地球上最难的数学竞赛,没有之一。每年全球最顶尖的高中生在IMO上鏖战,能拿满分的寥寥无几。2026年,全球只有7个人类选手拿到了满分金牌。现在,AI也做到了。

更令人震惊的是:dots-note 3.0不依赖形式化语言,直接读取原始LaTeX题目,通过递归自我批判能力端到端完成解题。而且,它还是dots3系列中最轻量级的模型。

"IMO满分金牌这个里程碑,背后是模型递归自我批判能力的突破。不依赖形式化验证就能给出优雅证明,这对数学推理研究是个真信号,做推理方向的值得细读。"——AIHOT编辑推荐语

1 IMO满分意味着什么?不只是"AI会做题"

很多人会问:AI能考IMO满分,跟我们有什么关系?

答案是:IMO满分验证的不是"AI会做题",而是"AI能推理"

IMO的题目不是"1+1=2"的计算题。每道IMO题目都需要创造性的数学思维——你需要从零开始构建证明思路,尝试不同的路径,在遇到死胡同时回溯,最终找到一条优雅的证明路径。这不是"模式匹配"能解决的问题,这是真正的"推理"。

过去,AI在数学推理上的表现一直差强人意。大语言模型可以"背诵"已知的数学定理,但遇到需要原创性思维的新问题时,往往会"胡编乱造"。这就是为什么IMO一直是AI的"终极考场"——它考的不是知识,而是创造力

dots-note 3.0的满分,意味着AI第一次在"需要创造性推理"的顶级智力竞赛中,达到了人类顶尖水平。这不是"AI的记忆力比人好",而是"AI的推理能力开始逼近人类"。


递归自我批判——让AI在解题过程中不断"反思"自己的推理,是这次突破的核心


2 递归自我批判:dots-note 3.0的核心秘诀

dots-note 3.0最引人注目的技术特点是递归自我批判

什么是递归自我批判?简单说,就是让模型在解题过程中不断"反思"自己的推理是否正确。传统的大模型在推理时是"一条路走到黑"——给出一个答案,然后坚持这个答案。但dots-note 3.0不同:它在生成每一步推理后,会主动检查这一步是否正确、是否有漏洞、是否有更优雅的解法。

这就像人类数学家的工作方式:不是"写下一个答案就完事",而是"反复推敲、反复修改、反复验证"。高斯不会因为第一次尝试就得到正确答案而停止——他会寻找更优美的证明。dots-note 3.0的递归自我批判,本质上是在模拟这种"数学家式的思维"。

而且,dots-note 3.0不依赖形式化验证工具(如Lean、Coq等)。这意味着它不需要把数学问题翻译成形式化语言,而是直接读取人类写的LaTeX题目,用人类的数学语言进行推理。这个能力,比依赖形式化工具的方案更接近"人类式的数学思维"。


dots-note 3.0 IMO 2026 核心数据

3 小红书做AI?从"种草"到"IMO金牌"

很多人对小红书的印象还停留在"种草平台"。但dots团队在AI数学推理上的突破,让人不得不重新审视这家公司的技术实力。

小红书dots团队并非突然冒出来的。dots系列模型一直在数学推理、代码生成等方向深耕。dots3系列在多个基准测试中都有出色表现。但IMO满分金牌,无疑是最具冲击力的"成绩单"。

这背后是中国AI行业一个值得关注的趋势:非传统AI公司正在AI核心技术上取得突破。不只是BAT和字节,小红书、快手、美团等公司也在AI研发上投入巨资。这些公司有独特的业务场景和海量数据,当它们把AI能力与自身业务深度结合时,往往能产生意想不到的化学反应。

dots-note 3.0预期将开源,这意味着全世界的数学家和AI研究者都可以基于这个模型进行进一步的研究。这不仅是小红书的胜利,也是开源AI社区的胜利。


从"会做题"到"能发现新的数学定理"——AI数学推理的下一站


4 从IMO满分到"AI数学家":还有多远?

IMO满分是一个里程碑,但它不是终点。从"能解IMO题"到"能发现新的数学定理",中间还有巨大的鸿沟。

IMO的题目,再难也是"已知有解"的。每道题都有标准答案,评委会提前验证过。AI做的是"找到已知的答案"。但真正的数学研究,面对的是"不知道有没有解"的问题——你甚至不知道答案是否存在,不知道这条路是否走得通。

这种"在不确定性中探索"的能力,是当前AI不具备的。人类数学家可以花几年甚至几十年研究一个猜想(比如费马大定理,花了358年才被证明),但AI目前还不能做这种"长期、开放式的探索"。

不过,腾讯混元同日发布的Hyra-1.0给出了一个方向:递归自我改进的研究智能体。Hyra在55个数学开放问题中刷新了29个历史最好结果。如果dots的"递归自我批判"和Hyra的"递归自我改进"结合起来,AI自主进行数学研究的那一天,可能比我们想象的更近。


AI数学推理的三条技术路线

形式化验证路线(Lean/Coq):将数学问题翻译成形式化语言,用定理证明器验证。优点是100%可靠,缺点是翻译成本高、不灵活。

端到端推理路线(dots-note 3.0):直接读取人类数学语言,自主推理。优点是灵活、接近人类思维,缺点是可靠性不如形式化验证。

递归自我改进路线(Hyra-1.0):让AI在推理过程中不断改进自己的策略。优点是可能发现人类未发现的解法,缺点是稳定性不足。


5 冷静看待:IMO满分背后的"冰山"

尽管dots-note 3.0的IMO满分令人振奋,但几个现实问题值得冷静思考:

42分≠42分。AI的42分和人类的42分,意义不完全相同。人类选手在考场上只有几个小时,不能查阅资料,不能重试。AI的"考试环境"是否与人类完全一致?如果AI可以多次尝试、可以选择最优答案,那这个"满分"的含金量需要更透明的评估标准。

最轻量级模型拿满分,说明什么?dots-note 3.0是dots3系列最轻量级模型。这当然说明了"小模型也能有大能力",但反过来也说明:IMO题目可能被"过拟合"了。如果模型在训练数据中见过类似题目,满分就不完全代表"推理能力"。

从"解题"到"发现"的鸿沟。如前所述,IMO题目是"已知有解"的。真正的数学研究是"探索未知"。AI能否从"解题工具"进化为"发现工具",是下一个需要回答的问题。

IMO满分金牌是一个里程碑,但它的真正意义不在于"AI比人类聪明",而在于"AI终于开始理解'推理'这件事了"。当AI不仅能"算"出答案,还能"想"出答案、"批判"自己的答案时,我们离通用人工智能就近了一步。这条路,刚刚开始。