四个AI模型横扫IMO 2026满分:Claude Fable 5、GPT-5.6 Sol、Kimi K3的42分之战

7/23/2026AI数学IMO

2026年7月21日,第67届国际数学奥林匹克(IMO)在上海落幕。中国队以232分蝉联冠军,三名少年拿到满分42分。同一天,GitHub上出现了另一份成绩单:前Google工程师、Menlo Ventures合伙人Deedy Das用7个前沿AI大模型全自主解答IMO 2026全部6道题,Claude Fable 5、GPT-5.6 Sol、Kimi K3和AxiomProver四个系统全部拿到42/42满分。

IMO 2026 上海天际线

这是IMO历史上第一次有AI系统拿到满分。2025年,Gemini Deep Think和OpenAI实验性模型各得35/42(金牌线),都败在第6题上。一年之后,四个系统全部跨过满分门槛,而且其中三个是任何用户都能直接调用的商业API,还有一个即将开源。

四个满分,四种姿势

Deedy Das的测试框架建立在Axiom Math提供的Lean 4形式化题面之上。Axiom Math将IMO 2026全部6道题逐字翻译成机器可读的Lean 4定理,AI输出Lean证明后由编译器自动判分,不需要人类评委参与。这个机制排除了"模型看起来对了但实际有逻辑漏洞"的风险——编译器要么接受证明,要么拒绝,没有中间地带。

模型总分耗时成本输出Token尝试策略
Claude Fable 5 (high)42/422.5小时$5170万1次通过,9轮对话
GPT-5.6 Sol (xhigh)42/423.8小时$2023万2次尝试,P2磨106分钟
Kimi K3 (max)42/4217.4小时$31154万4次尝试,P3鏖战491分钟
AxiomProver42/42---独立运行,Lean全程形式化

满分42和第五名28之间横着14分的鸿沟。第四名到满分的差距,等于第四名到零分的差距的一半。

三种推理风格

三个满分的商业模型展现了截然不同的推理性格。

Claude Fable 5打最干净。9轮对话产出6轮有效输出,全程2.5小时搞定。单道题最长耗时73分钟(第3题),总共输出70万token。Fable的特点是"一次到位"——拿到题目后直接构建正确的证明路径,不需要反复试错。

GPT-5.6 Sol走的是经济路线。总输出只有23万token,是Fable的三分之一,Kimi K3的六分之一。代价是在第2题上磨了106分钟跑了4轮,中间还被网络故障打断两次。Sol用xhigh推理档位运行,在难题上投入更多思考时间,但在简单题上快速通过,整体成本控制在20美元。

Kimi K3的风格是暴力堆算力。2.8万亿参数的MoE模型一口气喷出154万token,是Sol的6.5倍。第3题(数论组合题)发起6次冲锋,鏖战491分钟才攻克。K3证明了自己能做到,但代价昂贵——用4倍的尝试次数和6倍的token消耗换来同样的满分。

第6题(组合几何,传统最难)是真正的分水岭。Claude Fable 5用26分钟两轮攻克,GPT-5.6 Sol用60分钟两轮拿下,Kimi K3则耗了381分钟四轮。Grok 4.5在这道题上只挤出7053个token就放弃,提交文件写着"Full proof: (Not yet complete.)",成本0.18美元,全场最廉价的白卷。

Lean验证的意义

AxiomProver的满分有特殊的技术意义:它是唯一全程用Lean形式化语言写出证明的系统。其他模型用自然语言写数学证明,需要人类专家或独立系统二次验证才能确认正确性。AxiomProver直接输出Lean代码,编译器自动检查每一步推理。

这意味着AI数学证明从"看起来正确"进化到了"机器可验证正确"。Lean是一种交互式定理证明器,数学家可以用它写出任何数学命题的严格证明。Axiom Math的25岁创始人洪乐彤(MIT数学物理双学位、Morgan Prize得主)将IMO题目翻译成Lean后,整个评分链路就脱离了人类主观判断。

Lean形式化的另一个价值是可复现。任何人都可以下载deedy/imo-2026仓库中的Lean证明文件,用编译器重新编译验证。这在数学竞赛AI评测中是前所未有的透明度。

三年三级跳

年份最高AI得分里程碑
202428/42(银牌级)DeepMind AlphaProof/AlphaGeometry首次参赛
202535/42(金牌级)Gemini Deep Think和OpenAI实验模型同获金牌,均败于P6
202642/42(满分)四个系统满分,三个商业可用,一个即将开源

2024到2026,AI在IMO上的进步呈断崖式跨越。2024年DeepMind的AlphaProof和AlphaGeometry是用专门针对数学证明的强化学习训练的系统。2025年Gemini Deep Think和OpenAI模型是通用大模型加数学推理增强。2026年的参赛者全部是商业API,用户可以花20-51美元复现这个结果。

2025年全球只有6个人类选手解出第6题。2026年,三个AI模型全部攻克。

未参赛的Gemini

Google DeepMind的Gemini系列没有出现在Deedy Das的测试中。IMO 2026考试日(7月15-16日)前,Gemini 3.5 Pro因代码和推理能力未达标连续推迟发布,Google最终废弃了基础模型并重新开始预训练。Google DeepMind在2024和2025年一直是AI数学竞赛的领跑者,今年因为模型迭代节奏错过了这轮横评。

Manifold预测市场上,"Gemini在IMO 2026拿到满分"的合约在赛前一度冲到56%,随着Gemini延期的消息发布回落至38%。最终市场没有Gemini的满分结果可供判定。

中国队的满分

IMO 2026官方赛果中,中国队以232分领先第二名25分。三名满分选手全部来自上海:上海中学的邓乐言、张百零,以及华东师范大学第二附属中学的刘澈。这是中国队自1989年首次参赛以来的第26次冠军,也是连续第八年有满分选手。

人类满分和AI满分有着本质差异。人类选手在9小时考试时间内用纸笔完成全部证明,每一步推理和书写都不能出错。AI系统虽然也能在4小时内完成,但背后是数十万到上百万token的计算量,某些模型还需要多轮重试。

过去七年IMO,4347名人类选手参赛,只有30人拿过满分,比例0.69%。AI首次参赛(2024年)就是银牌水平,三年后满分已经可以从多个模型中重复获得。

下一个前沿

IMO满分之后,AI数学能力的下一个目标是什么?

Terence Tao在ChatGPT上讨论Jacobian Conjecture反例的对话在Hacker News上获得684分。Claude Fable 5此前 disproved 了Jacobian Conjecture的一个87年变体。这些迹象表明,AI的数学能力正在从"解决已有竞赛题"向"发现新的数学结构"延伸。

IMO的题目虽然难,但答案已知,证明路径存在。真正的数学研究面对的是没有人知道答案的开放问题。AI在IMO上的满分证明它已经掌握了顶尖竞赛选手的推理能力,但从"解题"到"提出有价值的猜想"还有距离。

Deedy Das在测试中附带了一个声明:所有模型的训练数据截止日期都在IMO 2026之前,测试期间未启用联网搜索。这意味着模型的数学推理完全来自训练和推理阶段,不存在"事先看过答案"的可能。

测试代码和全部7个模型的解题记录已开源在GitHub(deedy/imo-2026),任何人都可复现。


来源:Deedy Das (@deedydas) on XGitHub: deedy/imo-2026IMO官方

推荐阅读