人工智能基准测试,这样真的可以吗?
六个宣称满分,官方评分的却只有两个

开篇
7月16日,国际数学奥林匹克竞赛(IMO)在上海落下帷幕。666人参赛,获得42分满分的学生有7人。
但下一周更热闹。短短一周内,六个AI系统相继宣布“我们也拿了42分满分”。华为、小红书,再加上独立测试中出现的四个模型。
订阅者朋友,这里我想先点出一件事。这六者之中,真正将答案提交给IMO主办方的只有两个。剩下的四个,评分者不是人类,而是基于Claude的智能体。而且该代码库自己也写明:“结果强劲,但并非官方认证结果”。
先说结论。现在AI缺的不是更难的题目,而是一套能留下“谁、在什么条件下、如何评分”的制度。也就是说,缺的不是基准测试,而是考试。
满分的季节,但考场却有六个
先来梳理一下发生了什么。
人类那边的成绩很清楚:666人中7人满分。学生们分两天共9个小时解答6道题,同一天、同一时段、同一间考场。AI那边则分成了这样:
官方评分路径:华为的Celia和小红书的dots-note-3.0,是在人类比赛结束后拿到题目,在规定时间内提交答案,并将答案交给了IMO主办方。小红书方面表示“严格禁止任何形式的人为介入”。
独立测试路径:剩下的四个,是在一名研究者自行搭建的测试环境中跑出来的结果。
| 模型 | 首次尝试 | 最终成绩 | 成本 | 耗时 |
|---|---|---|---|---|
| Claude Fable 5 | 42/42 | 42/42 | 约51美元 | 2.5小时 |
| GPT-5.6 Sol(xhigh) | 39/42 | 42/42 | 约21美元 | 3.8小时 |
| Kimi K3 | 36/42 | 42/42 | 约31美元 | 17.4小时 |
| AxiomProver | 形式化证明 | 42/42 | 未公开 | 约25小时 |
单看数字确实惊人。Fable 5一次性解出,用时不到学生们9小时的三分之一。AxiomProver的路数不同,它用名为Lean 41的形式化证明语言,将6道题写成总计7,722行、机器可验证的证明。仅第3题就用了4,229行、869分钟。
但看着这张表,让我一直纠结的不是成绩,而是条件。
四个模型的评分者不是人类奖牌得主,而是AI智能体。而且努力等级(effort tier)设置不同,同一个模型的分数会上下浮动11分之多。还有一处最令人不安的细节:在同一测试中,Meta的Muse Spark与DeepSeek V4 Pro在第3题上给出了一模一样的错误答案。
如果是人类考场,这立刻就会被列为调查对象。两份答案以同样方式出错,意味着很可能不是各自独立解出来的。也可能是训练数据发生了重叠。但在基准测试里,根本没有处理这种情况的程序。它们只是各自被记为“错1题”,就此完结。
1062年,高丽在答卷上抹去了姓名
这里让我们把时间往回拨一大段。
谈到考试这项制度,我们通常会想到题目:出了什么题、有多难、谁答对了。但纵观考试制度的历史,真正被精心打磨发展的部分并不是题目本身,而是防止舞弊、验证结果的程序。
最具代表性的就是封弥。将答卷右侧写有考生身份、姓名、年龄、籍贯的部分折叠粘住,让阅卷者看不出这份答卷出自谁手。这一制度确立于中国宋代,在高丽,则是1062年文宗十六年由Jeong Yu-san(音译)提议后开始施行,并一直延续到朝鲜时代。
这还没完。即便姓名被遮住,字迹也能被认出来。于是又出现了易书这样的装置——由第三人将整份答卷重新誊抄一遍。
千年前的人们为何要设计这些?并不是因为不信任阅卷者。而是因为要让考试结果具备社会效力,就必须能够在事后追溯这个结果是如何产生的。
科举及第不只是一个分数,而是通往官职的资格。一旦赋予资格,考试就不再是测量,而成为制度。成为制度之后,需要的不是更难的题目,而是申诉程序、监考人、记录保存,以及为结果负责的主体。
有意思的是,这种方式如今也用在论文评审中。所谓的盲审(Blind Peer Review),就是把作者的学校、导师等背景信息遮蔽起来,避免其对评审者造成压力或赋予权威,从而对论文本身进行评判。而现在,AI评估正站在这道门槛前。
8月4日阿斯塔纳,AI首次接受监考
正因如此,我对下周即将开始的一场活动颇感兴趣。
8月2日至8日,第三届国际人工智能奥林匹克竞赛(IOAI)将在哈萨克斯坦阿斯塔纳举行。今年首次设立了名为IOAI²:AI Model Track的独立赛道。AI系统将以参赛者身份注册,与人类选手分开在独立的排行榜上一较高下。报名截止就在明天,7月27日。
细读规则,会发现不少有趣之处。
- 固定时间:8月4日与6日,每次6小时,共两场。每场3道题。
- 禁止人为介入:初始运行提示词之后,全程自主执行。
- 应试次数限制:每道题最多提交50次。
- 标准化评分环境:运行在参赛机构自有硬件上进行,但评分在标准化GPU上完成。
- 结果公开的自主权:赛后24小时内私下获得百分位分数,48小时内决定以机构名义公开还是匿名。
- 验证条件:若要获得奖牌,必须提交包含所有模型输入输出、工具调用、提示词的执行轨迹2。该记录除评审团外不对外公开。
- 报名费:每个机构可免费报名1个模型(赞助商为2个),额外模型每个收费2万5千欧元。
把这份清单与基准测试对照来看,差异就变得清晰起来。
基准测试可以随时、任意次数、在任何条件下应试。留下的只有分数,过程不留痕迹。而这个赛道则应试时间固定、尝试次数受限,若要获得认证结果,必须提交过程记录。而且,有评审团。
如果说封弥是让阅卷者看不见考生姓名的装置,那么执行轨迹的提交就是向评审团公开应试过程的装置。方向相反,目的却相同:让结果在事后可被验证。
2万5千欧元的报名费也不该只被视为一种盈利模式。设立报名费,意味着应试这一行为附带了成本与责任。可以免费无限次刷分的评估,和需要付费报名、在指定日期进行的评估,会让参与者的行为产生不同。
基准测试正在崩溃的证据
您可能会问:“可基准测试不还是够用的吗?”看看最近几年的数据,答案并非如此。
第一,饱和(saturation)3**。**GPQA Diamond从2023年底的39%升至2026年初的94%。短短两年多,可用的空间就已被耗尽。AIME 2025也是如此,头部模型的成绩大多集中在80%区间的后段到90%区间的中段。到这种地步,分数差异已不再代表实力差异。GPQA Diamond的题目共198道,在这个规模下,95%置信区间大约是±3分。这意味着,绝大多数以3分之差排名次的营销话术,在统计学上毫无意义。
第二,污染(contamination)4**。**Scale AI制作了与GSM8K难度相当的新题集GSM1k,对同一批模型重新测试后发现,部分模型的成绩最多下滑了13分。而且下滑幅度,与该模型完整背诵出GSM8K原题的频率呈相关关系。也就是说,这不是学会的,而是死记硬背下来的。
**第三,是评委问题。**用LLM作评分者时,观察到一种偏差:答案越长,得分往往会高出15~30分。选项顺序不同也会导致偏好发生变化。这不是随机噪声,而是有方向性的偏差,一旦施加优化压力,就会朝那个方向偏移。
把这些都加在一起,结论只有一个:排行榜上的数字不是结果,而是假设。
Oswarld视角
我从一个稍微不同的角度看待这个问题。我认为这不是评估方法论的问题,而是采购决策的问题。
在制定GTM战略的过程中,我见过无数次这样的场景:供应商拿着基准测试分数上门,负责人把这个数字抄进审批文件。可两个月后,实际业务中性能跟不上,这时却没有人能拿这个数字追究责任——因为一开始就没人知道,这个分数是在什么条件下产生的。我见过这种情况反复上演,每次都得出同一个结论:基准测试分数不是采购依据,而是营销资产。
企业在引入AI时,真正需要的不是“我们的模型得了94分”,而是**“在这样的条件下、这个时间点、经过这样的过程,得出了这个结果,而且记录都留存了下来”**。想想财务审计就容易理解了。我们不会仅凭企业发布的业绩公告就直接相信,而是因为有审计师、有审计工作底稿、有可供日后查阅的记录,我们才会相信。
AI性能宣称目前还没有这套基础设施。IOAI²这类尝试之所以有意思,原因就在这里。它不是在尝试出更难的题目,而是试图为分数附上可审计性。我认为,在当下这个时间点,这个方向要重要得多。
当然,我不认为第一届就能做得完美。在自有硬件上运行、只在标准环境中评分,这种结构本身就有漏洞。允许尝试50次,就意味着留下了只挑最佳成绩上报的空间。2万5千欧元的报名费,也天然更有利于资源充裕的机构。但我依然认为方向是对的。制度本来就是从粗糙起步,边补漏洞边成长的。封弥最初也只是遮住姓名,后来才发展到连字迹都要遮蔽。
结语
总结一下。
- 在IMO 2026中,人类是666人中7人满分,AI则是六个系统宣称满分,其中走官方评分路径的只有两个。
- 基准测试因饱和、污染、评委偏差这三个原因,正在失去区分能力。
- 下一步需要的不是更难的题目,而是配备应试条件与验证程序的考试制度。8月的阿斯塔纳,将开启这场实验的第一步。
读完之后,建议您不妨试试这个:下次有人拿着AI性能数字来找您,别问分数,改问一句:“这个分数,是谁、在什么时候、在什么条件下评的?记录还留着吗?”您会发现,答不上来的情况,比想象中要多得多。
如果您在实际工作中引入AI工具时,曾遇到基准测试分数与实际表现不符的经历,欢迎在评论区分享,哪个环节的落差最大。等案例攒够了,我会在下一期整理成一份《面向从业者的AI性能验证问题清单》。
💬 欢迎在评论区分享基准测试与现实脱节的瞬间 · 📨 如果有正在考虑引入AI的同事,欢迎将本文转发给他们
参考资料与延伸阅读
核心来源
- IOAI,《AI Model Track: Rules and Competition Format》,International Olympiad in Artificial Intelligence 2026。 链接 ··· 关于提交执行轨迹与验证分数的条款,是本期内容的核心依据。直接阅读原始规则,会更清楚地看出“考试”与“基准测试”在设计上的差异。
- Axiom Math,《AxiomProver at IMO 2026》,GitHub,2026。 链接 ··· 6道题的Lean 4形式化证明全文已公开。如果好奇机器可验证的证明长什么样,可以打开第3题的文件看看。
- Digital Applied,《Four AIs Scored a Perfect 42/42 on IMO 2026. So What?》,2026。 链接 ··· 一篇以表格整理各模型成本、耗时、重试次数以及评分主体差异的文章,可以看清媒体报道中被含糊带过的部分。
- Acing AI,《The LLM Evaluation Crisis: Contamination, Saturation, and the Judge Problem》,2026。 链接 ··· GPQA Diamond的置信区间与GSM1k重现实验的数据均出自此文。如果您是处理基准测试相关工作的人,建议至少读一下统计部分。
- AFP,《AI catches up with humans to score 100% at top maths contest》,2026年7月23日。 链接 ··· 这是通讯社对华为、小红书发布消息的报道,也是观察媒体如何转述企业公告的一个好例子。
背景知识
- 《封弥(封彌)》,朝鲜王朝实录专门辞典,韩国学中央研究院。 ··· 整理了1062年高丽文宗年间引入该制度的经过,可以借此确认考试制度的核心不在题目,而在程序。
- 《中国的科举制》,维基百科。 链接 ··· 适合快速了解宋代科举改革的整体脉络。
📝 术语说明
注释
-
Lean 4:一种能将数学证明写成计算机可逐行检验形式的编程语言。它不需要人来阅读并判断“看起来是对的”,而是由机器自动找出逻辑上的漏洞。 ↩
-
执行轨迹(execution trace):AI在解题过程中,按时间顺序留下的所有输入、输出、工具调用与提示词记录。如果用考试来比喻,这不是答卷,而更接近监控录像。 ↩
-
饱和(saturation):随着模型性能提升,评测题目变得过于简单,导致头部选手的成绩都挤在满分附近的现象。到了这种状态,就无法再通过分数差异来区分实力。 ↩
-
污染(contamination):用于评测的题目,已经出现在模型的训练数据中的情况。这就好比提前看过考题再进考场,导致分数反映的不是实力,而是记忆。 ↩

