Ai

我让 6 个大模型参加了 2025 高考数学:3 个满分,最低 94 分

By karp 2 Views 21 MIN READ 0 Comments
如果把一整套高考数学卷交给当前主流大模型,并且禁止联网、禁止互相抄答案、只允许提交一次,它们能考多少分?

这一次,我没有问大模型几个零散的数学问题,而是认真布置了一间“AI 高考考场”。

统一试卷、统一规则、同时开考,甚至还安排了一个单独的模型担任监考官。

最终结果有些出乎意料:

  • GPT-5.6:150 分
  • Opus 5:150 分
  • Kimi K3:150 分
  • Codex:143 分
  • Cursor Grok 4.5:141 分
  • GLM 5.2:94 分

同一张试卷,最高分与最低分相差了 56 分

AI GAOKAO · 2025
当 6 个大模型走进
高考数学考场
同一张试卷 · 禁止联网 · 禁止互抄 · 只准交卷一次
150
最高分
3
满分模型
56
最高最低分差
19
试题总数

一、先准备一张所有模型都能读懂的试卷

本次使用的是 2025 年普通高等学校招生考试(新高考 I 卷)数学,适用地区包括山东、广东、湖南、湖北、河北、江苏、福建、浙江、河南、江西、安徽。

原始 PDF 不只是文字和公式,还包含表格、坐标图与立体几何图形。如果直接读取 PDF,部分模型可能遇到根号、分数、希腊字母或图形信息识别错误。

因此,正式开考前,我先把整套试卷整理成统一的 Markdown:

  • 全卷共 19 题;
  • 数学公式统一使用 LaTeX;
  • 表格转换为结构化 Markdown 表格;
  • 原卷图形保留为图片;
  • 每张图额外补充纯文字描述;
  • 清除 PDF 文字层中的乱码、断行和 OCR 错误。

所有模型读取的都是同一份文件:

exam_2025_math_clean.md

这一步非常重要。否则最后比较的可能不是模型的数学能力,而是谁更擅长猜测乱码。

试卷标准化流水线
INPUT
原始 PDF
公式乱码、断行、图形与文字层混合
PROCESS
识图与人工校订
LaTeX 公式、结构化表格、图形文字描述
OUTPUT
统一 Markdown
所有模型读取完全相同的 19 道题

二、考场规则:不联网、不互抄、只能交一次

为了尽量接近一次真实的限时考试,我给所有参赛模型设置了相同规则。

我的原始要求

  1. 所有模型统一使用 exam_2025_math_clean.md
  2. 考试期间禁止网络检索答案;
  3. 只能依靠模型自身能力完成试卷;
  4. 目标答卷时间为 5 分钟;
  5. 禁止读取或参考其他模型的答案;
  6. 每个模型只允许提交一次;
  7. 提交后不允许二次演算或修改答案;
  8. 只提交最终答案,不展示完整推理过程;
  9. 不允许修改原始试卷文件;
  10. 由 Composer 2.5 担任独立监考官。

原计划参赛阵容包括:

  • GPT-5.6
  • Opus 5
  • Kimi K3
  • Codex
  • Gemini 3.5 Flash
  • GLM 5.2
  • Cursor Grok 4.5

不过,实际执行时 Gemini 3.5 Flash 不在当前可用模型列表中。为了不擅自更换型号,本次没有用其他 Gemini 版本代替,所以最终共有 6 名考生入场。

考场纪律
STRICT MODE
01 · 禁止联网
考试期间不得检索答案
02 · 独立作答
不得读取其他模型答卷
03 · 目标 5 分钟
同批启动,限时交卷
04 · 只交一次
提交后不得修改答案
05 · 只写答案
不展示完整推理过程
06 · 独立监考
Composer 2.5 只监考不答题

三、开考:6 个模型同时作答

6 个模型在同一个并行批次中启动,分别独立读取试卷。

监考官 Composer 2.5 不参与答题,只负责核对规则和记录可观察到的行为。它确认了试卷路径有效,并且自身没有修改试卷或输出答案。

但这里必须说明实验边界:

  • 系统没有记录每个模型精确到秒的作答耗时;
  • 聊天时间戳只能确认整批答卷在约 6 分钟的窗口内返回;
  • 因此不能严格证明每个模型都在 5 分钟内完成;
  • 每个模型都只有一次提交记录,没有再次交卷或修改答案;
  • 模型内部是否自行验算,无法从外部技术审计;
  • Kimi K3 的答卷中可以看到少量中间式,其他模型主要提交最终结果或简短结论。

换句话说,我能够确认“没有二次提交”,但不能把“模型内部从未回头检查”当成已经证实的事实。

考生状态 · 同批并行启动
GPT-5.6
已交卷 · 1 次
Opus 5
已交卷 · 1 次
Kimi K3
已交卷 · 1 次
Codex
已交卷 · 1 次
Cursor Grok 4.5
已交卷 · 1 次
GLM 5.2
已交卷 · 1 次
监考官:Composer 2.5 · 未作答 · 未修改试卷 · 未发现可证实违规

四、阅卷标准:满分 150 分

考试结束后,阅卷阶段允许联网,用于交叉核验公开答案和题型分值。

本卷采用新高考 I 卷常见的 150 分结构:

题型题号分值
单项选择题1—840 分
多项选择题9—1118 分
填空题12—1415 分
解答题15—1977 分
总计1—19150 分

解答题采用以下题目总分:

  • 第 15 题:13 分
  • 第 16 题:15 分
  • 第 17 题:15 分
  • 第 18 题:17 分
  • 第 19 题:17 分

为了比较模型的最终解题结果,本次排名使用的是 “最终答案正确度评分”:最终结论正确,就按照对应小问计分。

这不等于真实高考卷面分。

真实高考明确要求解答题写出文字说明、证明过程或演算步骤。由于我在考试规则中要求模型“只提交答案”,证明题缺少完整过程,若严格按照真实高考阅卷,它们不可能仅凭一句“结论成立”拿到全部过程分。

因此,本文成绩代表的是:

模型最终答案的正确程度,而不是一张符合高考书写规范的正式答题卡得分。

五、成绩公布:3 个满分

排名模型客观题解答题总分
1GPT-5.673/7377/77150
1Opus 573/7377/77150
1Kimi K373/7377/77150
4Codex73/7370/77143
5Cursor Grok 4.573/7368/77141
6GLM 5.257/7337/7794

最醒目的结果不是第一名,而是前三名同时拿到了满分。

GPT-5.6、Opus 5 和 Kimi K3 的答案完全命中。更值得注意的是,它们不仅基础题和客观题正确,后面的数列、立体几何、椭圆和三角函数压轴题也给出了正确结果。

Codex 和 Grok 4.5 的客观题同样全部正确,差距主要出现在解答题最后阶段。

GLM 5.2 则从第 11 题开始出现明显失误,最终停在 94 分。

最终答案正确度
满分 150 · 分数越高,横条越长
3 个满分
GPT-5.6150
Opus 5150
Kimi K3150
Codex143
Cursor Grok 4.5141
GLM 5.294
评分口径:最终答案命中分,不等同于真实高考过程分。
交互式成绩面板:2025 Math Model Grading

六、它们分别错在了哪里?

GPT-5.6、Opus 5、Kimi K3:全部命中

三者在最终答案层面没有发现错误,均得到 150 分。

但需要再次强调:其中涉及证明的题目只提交了结论,不能据此断言它们在真实高考阅卷中也会获得满分。

Codex:倒在椭圆题最后一问

Codex 前 17 题以及第 19 题均与正确答案一致。

它唯一的错误出现在第 18 题第(2)问第②小问:

  • Codex 作答:约 $5.515$
  • 核验答案:$3\sqrt3+3\sqrt2$

该小问扣 7 分,最终得分 143 分

Cursor Grok 4.5:两处失分

Grok 4.5 的客观题全部正确,但解答题出现两处问题:

  1. 第 15 题独立性检验的 $\chi^2$ 统计量多了一位数量级,但“检查结果与患病有关”的结论正确,因此只扣部分分;
  2. 第 18 题最后一问最大值错误。

最终得分 141 分

GLM 5.2:错误开始连锁出现

GLM 5.2 的主要失分包括:

  • 第 11 题多选题出现错选;
  • 第 12、14 题填空错误;
  • 第 16 题第(2)问结果错误;
  • 第 17 题空间角结果错误;
  • 第 18 题后两问错误;
  • 第 19 题第(1)、(3)问错误。

它的前 10 题与其他模型保持一致,但进入后半卷后,错误数量明显增加,最终得分 94 分

真正拉开差距的是第 18 题
第(2)问第②小问:求 |PQ| 的最大值
正确答案
3(√3 + √2)
GPT-5.6 · Opus 5 · Kimi K3
CODEX
≈ 5.515
该小问扣 7 分
GROK 4.5
5 + 3√2
该小问扣 7 分
GLM 5.2
√10
第 18 题后两问均错误

七、这场测试能说明什么?

1. 当前头部模型已经具备很强的高中数学结果输出能力

在统一输入、禁止联网、完整试卷和短时间约束下,3 个模型给出了全卷正确答案。

至少从“得到最终结果”这一维度看,它们已经能稳定处理:

  • 复数、集合与函数;
  • 向量和解析几何;
  • 概率统计与数列;
  • 立体几何;
  • 椭圆综合题;
  • 三角函数压轴题。

2. 客观题已经很难拉开头部模型的差距

GPT-5.6、Opus 5、Kimi K3、Codex 和 Grok 4.5 的客观题全部得到 73 分。

真正产生差距的是解答题,尤其是第 18 题椭圆综合题。Codex、Grok 4.5 和 GLM 5.2 都在这道题的后半部分失分。

3. “答案正确”与“会不会证明”不是同一件事

本次测试为了控制输出长度,要求模型只提交答案。

这适合比较最终结果,却不适合评价完整的数学表达、推导严谨性和证明能力。一个模型可以猜中或算出结论,但如果不能提供可检查的推理链,就不能直接等同于真实考生的满分答卷。

4. AI 测评首先要控制输入质量

如果每个模型读取到的公式、表格和图形不一致,那么排行榜没有意义。

这次测试中,先把 PDF 清洗为统一 Markdown,再让所有模型同时读取,是整个实验成立的基础。

八、这次实验仍有哪些局限?

这不是一项严格的学术基准测试,至少存在以下限制:

  1. 每个模型只运行了一次,无法反映多次采样下的稳定性;
  2. 没有记录单模型精确耗时;
  3. 不能审计模型内部是否自行验算;
  4. 模型只提交答案,无法完整评价证明过程;
  5. 解答题小问分值采用模拟拆分,并非教育考试院公开的逐步采分细则;
  6. Gemini 3.5 Flash 因当前环境不可用,未实际参赛;
  7. 本次成绩只对应当前试卷、当前提示词和当前模型版本,不能直接推广到所有数学任务。

如果要继续完善这项测试,下一轮至少应该加入:

  • 每个模型重复测试 3—5 次;
  • 记录准确开始时间、结束时间和首字延迟;
  • 同时保留“只交答案组”与“完整过程组”;
  • 使用盲审方式对证明题单独评分;
  • 在不改变原意的前提下,准备不同排版版本,测试模型对输入形式的敏感程度。

九、最后

这场 AI 高考最有意思的地方,并不是“某个模型拿了满分”。

真正值得关注的是:当输入被认真整理、规则被统一之后,头部模型之间的差距已经被压缩到少数几道综合题上。

它们在基础题上的表现越来越接近,决定排名的,开始变成复杂推导中的稳定性。

而这也提醒我们:

测试大模型,不能只随手问一道题。
要给它完整试卷、统一规则、独立考场,以及一套能够被复核的评分标准。

下一次,我准备让它们挑战另一年的高考数学。

到时候,是继续出现多个满分,还是会有新的模型翻车?

NEXT EXAM
下一场:2026 高考数学
同样的规则,更难的新卷。
下一次还会出现三个满分吗?
To be continued

附:本次实验信息

  • 试卷:2025 年新高考 I 卷数学
  • 试卷格式:清洗后的 Markdown
  • 实际参赛模型:6 个
  • 监考模型:Composer 2.5
  • 考试阶段网络:禁止
  • 阅卷阶段网络:允许,仅用于交叉核验
  • 提交次数:每个模型 1 次
  • 精确作答耗时:未记录
  • 评分口径:最终答案正确度评分
  • 满分:150 分

参考资料

  1. 2025 年普通高等学校招生全国统一考试(新高考 I 卷)
  2. 2025 年高考全国一卷数学真题及计分规则
  3. 2025 新高考 I 卷第 18 题解析
  4. 2025 新高考 I 卷第 19 题研究与解析
注:公开答案和解析可能来自教育机构或教师整理,本文已结合独立演算交叉核验。解答题模拟小问分值不代表教育考试院正式评分细则。

本文由 karp 原创

采用 CC BY-NC-SA 4.0 协议进行许可

转载请注明出处:https://ikarp.top/index.php/archives/866.html

标签: 无标签

相关推荐

  • 暂无相关推荐,看看别的吧。

0 评论