岁月史书:主流llm

10 minute read

Published:

岁月史书:主流llm

DeepSeek

模型(按发布时间)知识/推理
MMLU
知识/推理
MMLU-Pro
知识/推理
GPQA-Diamond
知识/推理
SimpleQA
知识/推理
HLE
对齐/偏好
IF-Eval
对齐/偏好
AlpacaEval 2.0
对齐/偏好
ArenaHard
对齐/偏好
AlignBench
数学
AIME
数学
MATH-500
数学
CNMO 2024
数学
HMMT
数学
IMO-AnswerBench
代码
HumanEval
代码
LiveCodeBench
代码
Codeforces
代码
SWE-bench Verified
代码
SWE-bench Multi
代码
Aider
代码
Terminal-Bench
Agent/搜索
BrowseComp
中文
C-Eval
中文
C-SimpleQA
中文
CLUEWSC
DeepSeek-V2(2024-05-07)77.838.9041.607.9178.089.9
DeepSeek-Coder-V2(2024-06-17)79.236.9265.007.8490.2(Py)43.4(23.12–24.06)79.485.9
DeepSeek-V2.5(2024-09-05)50.576.28.0489.0(Py)/ 73.8(Multi)41.0(2024.01–09)16.872.2
DeepSeek-V3(2024-12-26)88.575.959.124.986.170.085.539.2(2024)90.243.282.6(Multi)37.651.6(Pct)42.079.7(Edit)/ 49.6(Poly)86.564.890.9
DeepSeek-R1(2025-01-20)90.884.071.530.183.387.692.379.8(2024)97.378.865.92029(R)/ 96.3(Pct)49.253.391.863.792.8
DeepSeek-R1-0528(2025-05-28)85.081.017.7(无工具)91.4(2024)/ 87.5(2025)86.979.4(2025)73.31930(R)57.671.6
DeepSeek-V3.1(2025-08-21)84.880.193.429.8(带工具)93.1(2024)/ 88.4(2025)84.2(2025)74.8(2408-2505)2091(R)66.0(Verified)54.576.331.3(2.0)30.0
DeepSeek-V3.2(思考模式,2025-12-01)85.082.425.1(无工具)93.1(2025)92.5 / 90.2(2025 Feb / Nov)78.3(2025)83.32386(R)73.1(Verified)70.246.4(2.0)51.4/67.6(无工具/带工具)
DeepSeek-V4-Pro-0813(正式版,2026-08-13)42.7 / 60.0(无工具/带工具)87.9(2.1)
DeepSeek-V4-Flash-0731(正式版,2026-07-31)37.8 / 51.5(无工具/带工具)82.7(2.1)

GLM

模型(按发布时间)知识/推理
MMLU
知识/推理
MMLU-Pro
知识/推理
GPQA-Diamond
知识/推理
HLE
数学
AIME
数学
HMMT
数学
IMO-AnswerBench
数学
MATH-500
数学
MATH
数学
GSM8K
代码
HumanEval
代码
LiveCodeBench
代码
SWE-bench Verified
代码
SWE-bench Pro
代码
SWE-bench Multilingual
代码
Terminal-Bench
代码
BrowseComp
Agent/工具
τ²-Bench
Agent/工具
TAU-Bench
Agent/工具
BFCL V3
Agent/工具
SciCode
Agent/工具
MCP-Atlas
对齐
AlignBench
GLM-4(2024-01-16)81.535.747.987.672.07.66
GLM-4.5(2025-07-20)90.084.679.114.4(无工具)91.0(2024)98.272.9(v6)64.2(Verified)37.526.4(无工具)79.7 / 60.477.841.7
GLM-4.5-Air(2025-07-20)87.481.475.010.6(无工具)89.4(2024)98.170.7(v6)57.6(Verified)30.021.3(无工具)77.9 / 60.876.437.3
GLM-4.6(2025-09-29)83.281.017.2 / 30.4(无工具/带工具)93.9(2025)89.2 / 87.7(2025 Feb / Nov)73.5(2025)82.8(v6)68.0(Verified)53.824.5(2.0)45.1(无工具)75.2
GLM-4.7(2025-12-22)84.385.724.8 / 42.8(无工具/带工具)95.7(2025)97.1 / 93.5(2025 Feb / Nov)82.0(2025)84.9(v6)73.8(Verified)66.741.0(2.0)52.0(无工具)87.4
GLM-5(2026-02-11)86.030.5 / 50.4(无工具/带工具)92.7(2026)96.9(2025 Nov)82.5(2026)77.8(Verified)73.356.2(2.0)62.0(无工具)89.767.8
GLM-5.1(2026-04-03)86.231.0 / 52.3(无工具/带工具)95.3(2026)94.0 / 82.6(2025 Nov / 2026 Feb)83.8(2026)58.463.5(2.0)68.0 / 79.3(无工具/带工具)70.6(τ³)71.8
GLM-5.2(2026-06-16)91.240.5 / 54.7(无工具/带工具)99.2(2026)94.4 / 92.5(2025 Nov / 2026 Feb)91.0(2026)62.181.0(2.1)76.8
GLM-5.3(2026-08-14)— / 62.5(带工具)88.2(2.1)

Kimi

模型(按发布时间)知识/推理
MMLU
知识/推理
MMLU-Pro
知识/推理
MMLU-Redux
知识/推理
GPQA-Diamond
知识/推理
HLE
数学
AIME
数学
HMMT
数学
IMO-AnswerBench
数学
MATH-500
数学
Codeforces
代码
LiveCodeBench
代码
SWE-bench Verified
代码
SWE-bench Pro
代码
SWE-bench Multilingual
代码
Multi-SWE-bench
代码
Terminal-Bench
代码
BrowseComp
代码
SciCode
Agent/工具
OJBench
Agent/工具
DeepSearchQA
Agent/工具
MCP-Atlas
Agent/工具
Toolathlon
Kimi k1.5 long-CoT(2025-01-20)77.5(2024)96.294(Pct)62.5(v5,24.12–25.2)
Kimi K2(Instruct,2025-07-11)89.581.192.775.14.7(文本子集)69.6 / 49.5(2024 / 2025)38.8(2025)97.453.7(v6)65.847.330.0 / 25.0(自研 / Terminus)
Kimi K2 Thinking(2025-11-06)84.694.484.523.9 / 44.9(文本子集,无工具 / 带工具)94.5(2025)89.4(2025)78.6(2025)83.1(v6)71.361.141.947.1(Terminus-2 JSON)60.2(无工具)44.8(无工具)48.7(cpp)
Kimi K2.5(Thinking,2026-01-27)87.187.630.1 / 50.2(Full,无工具 / 带工具)96.1(2025)95.4(2025 Feb)81.8(2025)85.0(v6)76.850.773.050.8(2.0,Terminus-2)60.6(无工具)48.7(无工具)57.4(cpp)
Kimi K2.6(2026-04-20)90.534.7 / 54.0(Full,无工具 / 带工具)96.4(2026)92.7(2026 Feb)86.0(2026)89.6(v6)80.258.676.766.7(2.0,Terminus-2)83.2(无工具)52.2(无工具)60.6(python)92.5(无工具)50.0(无工具)
Kimi K3(2026-07-16)93.543.5 / 56.0(Full,无工具 / 带工具)88.3(2.1)91.2(无工具)58.7(无工具)95.0(无工具)84.2(无工具)76.5(Verified)

Qwen

模型(按发布时间)知识/推理
MMLU
知识/推理
MMLU-Pro
知识/推理
MMLU-Redux
知识/推理
GPQA-Diamond
知识/推理
HLE
数学
AIME
数学
HMMT
数学
IMO-AnswerBench
数学
MATH-500
数学
MATH
数学
GSM8K
代码
LiveCodeBench
代码
Codeforces
代码
SWE-bench Verified
代码
SWE-bench Pro
代码
SWE-bench Multilingual
代码
Terminal-Bench
Agent/搜索
BrowseComp
对齐/通用
IFEval
对齐/通用
Arena-Hard
对齐/通用
C-Eval
对齐/通用
LiveBench
对齐/通用
AlignBench
Qwen2-72B-Instruct(2024-06-07)82.364.442.469.093.235.7(v1)77.648.183.88.27
Qwen2.5-72B-Instruct(2024-09-19)71.186.849.083.195.855.5(2305–2409)84.181.252.3
Qwen2.5-Max(2025-01-28)76.160.138.7(24.08–24.11)89.462.2
Qwen3-235B-A22B(思考模式,2025-04-29)92.771.185.7 / 81.5(2024 / 2025)98.070.7(v5)2056 / 98.2%83.495.689.677.18.94
Qwen3.5-397B-A17B(2026-02-16)87.894.988.428.7(无工具)91.3(2026)94.8 / 92.7(2025 Feb / Nov)80.9(2025)83.6(v6)76.4(Verified)69.3(Multilingual)52.5(2.0)69.0 / 78.6(无工具/带工具)92.693.0
Qwen3.6-35B-A3B(2026-04-16)85.293.386.021.4(无工具)92.7(2026)90.7 / 89.1 / 83.6(2025 Feb / 2025 Nov / 2026 Feb)78.9(2025)80.4(v6)73.4(Verified)49.5(Pro)67.2(Multilingual)51.5(2.0)90.0
Qwen3.6-27B(2026-04-22)86.293.587.824.0(无工具)94.1(2026)93.8 / 90.7 / 84.3(2025 Feb / 2025 Nov / 2026 Feb)80.8(2025)83.9(v6)77.2(Verified)53.5(Pro)71.3(Multilingual)59.3(2.0)91.4

测评集分类与使用趋势小结

综合四家的官方测评,可以把主流 LLM 测评集归为五大类:知识/推理类数学类代码类Agent/工具类对齐/偏好类。知识/推理类包括 MMLU(57 学科的多选题)、MMLU-Pro(MMLU 的进阶推理版,目前各家仍普遍报告)、MMLU-Redux(MMLU 的数据修正版)、GPQA-Diamond(研究生级科学多选题,号称”谷歌搜不到答案”)、SuperGPQA(285 个学科的大规模科学题)、SimpleQA(OpenAI 的事实性短答,后被 SimpleQA-Verified 取代)、HLE(Humanity’s Last Exam,人类全学科前沿难题,2025 年后的旗舰标配)以及中文的 C-Eval、C-SimpleQA、CLUEWSC。数学类包括 AIME(美国数学邀请赛,2024/2025/2026 各届仍在轮换使用)、MATH 与 MATH-500(MATH 的 500 题子集,已取代完整 MATH)、GSM8K(小学数学应用题)、HMMT(哈佛-麻省理工数学锦标赛)、IMO-AnswerBench(国际数学奥林匹克)和 CNMO(中国数学奥林匹克)。代码类包括 HumanEval(函数级代码生成,已基本弃用)、MBPP/MultiPL-E/EvalPlus(同类早期基准)、LiveCodeBench(防污染的动态代码题,版本从 v1 迭代到 v6,2025 年起各家统一报 v6)、Codeforces(竞赛编程,报 Rating 或 Percentile)、SWE-bench Verified/Multilingual/Pro(真实 GitHub issue 的工程修复,Verified→Pro 逐步升级)、Terminal-Bench(终端命令行操作,1.x→2.0→2.1)、Aider(代码编辑)、SciCode、OJBench 等。Agent/工具类是 2025 年才兴起的新类别,包括 BrowseComp(复杂网页搜索)、τ²/τ³-Bench 与 TAU-Bench(多轮工具调用客服场景)、BFCL v3/v4(伯克利函数调用)、MCP-Atlas/MCPMark(MCP 协议工具调用)、Toolathlon 与 Tool-Decathlon(通用工具使用)、DeepSearchQA 与 WideSearch(深度搜索),以及 NL2Repo、Cybergym、DeepSWE、FrontierSWE、SWE-Marathon 等 2026 年最新出现的长时程编码 Agent 基准。对齐/偏好类则包括 IFEval/IFBench(指令遵循)、Arena-Hard 与 AlpacaEval 2.0(LLM 裁判的偏好胜率)、MT-Bench(多轮对话评判)和中文的 AlignBench。

从时间线看趋势非常清晰:2024 年早期各家还在报 MMLU、GSM8K、MATH、HumanEval、BBH、C-Eval 等”基础款”,但这些基准因分数饱和与数据污染,在 2024 年底之后已基本退出新模型的官方报告——MMLU 让位于 MMLU-Pro/MMLU-Redux,GSM8K/MATH 让位于 AIME/MATH-500/HMMT/IMO-AnswerBench,HumanEval 让位于 LiveCodeBench/SWE-bench,MT-Bench 也让位于 Arena-Hard/AlpacaEval,BFCL 从 v3 升级到 v4。当前(2025 下半年至 2026)各家旗舰一致在用的是:知识/推理类的 MMLU-Pro、GPQA-Diamond、HLE;数学类的 AIME(取最新一届)、HMMT、IMO-AnswerBench、MATH-500;代码类的 LiveCodeBench v6、SWE-bench Verified/Pro/Multilingual、Terminal-Bench;以及 2026 年新增的 Agent 类基准(BrowseComp、τ²/τ³-Bench、MCP-Atlas、Toolathlon、DeepSearchQA、Cybergym、NL2Repo 等)——从 DeepSeek-V4 正式版、GLM-5.2、Kimi K3 的官方报告可以看出,Agent/工具类测评的权重已超过传统学术基准,成为衡量前沿模型的主要标尺。那些”已不用”的基准并非完全消失,而是退化为 base 模型评测或内部消融测试使用(如 MMLU、C-Eval 仍出现在各家 base 模型报告中),不再作为旗舰模型的对外卖点。

Claude

模型(按发布时间)知识/推理
MMLU
知识/推理
GPQA-Diamond
知识/推理
MMMLU
知识/推理
HLE
知识/推理
ARC-AGI-2
数学
MATH
数学
GSM8K
数学
AIME
代码
HumanEval
代码
SWE-bench Verified
代码
SWE-bench Pro
代码
Terminal-Bench
代码
DeepSWE
代码
FrontierCode
Agent/工具
BrowseComp
Agent/工具
MCP-Atlas
Agent/工具
OSWorld
Agent/工具
τ²-Bench
Agent/工具
GDPval-AA
Agent/工具
AutomationBench
Claude 2(2023-07-11)78.588.071.2(Codex)
Claude 3 Opus(2024-03-04)86.850.46195.084.9
Claude 4 Opus(2025-05-22)74.987.433.9(2025)72.543.2(2.0)
Claude Opus 4.5(2025-11-24)87.090.830.8/43.4(无工具/带工具)37.692.8(2025)80.959.3(2.0)62.366.388.91416
Claude Opus 4.6(2026-02-05)91.391.140.0/53.0(无工具/带工具)68.899.8(2025)80.853.465.4(2.0)83.7(带工具)59.572.791.91606
Claude Opus 4.7(2026-04-16)94.291.546.9 / 54.7(无工具/带工具)75.887.664.369.4(2.0)79.3(带工具)77.378.017539.9
Claude Opus 4.8(2026-05-28)93.649.8 / 57.9(无工具/带工具)72.188.669.274.6(2.1)46.584.3(带工具)82.283.4189015.5
Claude Fable 5(2026-06)958084.3(2.1)29.385.0193217.4
Claude Opus 5(2026-07-24)56.3 / 64.7(无工具/带工具)90.496.079.268.853.490.8(带工具)85.870.6(2.0)186126.0

GPT

模型(按发布时间)知识/推理
MMLU
知识/推理
MMLU-Pro
知识/推理
GPQA-Diamond
知识/推理
HLE
数学
MATH-500
数学
AIME
数学
HMMT
代码
HumanEval
代码
LiveCodeBench
代码
Codeforces
代码
SWE-bench Verified
代码
Terminal-Bench
Agent/工具
BrowseComp
Agent/工具
τ²-Bench
GPT-4(2023-03-14)86.435.767.0
GPT-4 Turbo(2023-11-06)84.742.564.383.7
GPT-4o(2024-05-13)87.249.974.69.3(2024)91.032.9(v1)759(R)
o1(2024-12-05)91.875.796.474.3/79.2(2024/2025)1891(R)48.9
o3(2025-04-16)92.985.383.320.3(无工具)97.891.6/88.9(2024/2025)87.478.4(v5)2706(R)69.130.2(2.0)49.7(带工具)
GPT-5(2025-08-07)87.185.724.8(无工具)94.6(2025)88.3 / 89.2(2025 Feb / Nov)84.5(v6)2537(R)74.943.8(2.0)54.9(带工具)81.1

测评集分类与使用趋势小结

Claude 与 OpenAI 两家闭源厂商的官方测评口径,同样可以归入知识/推理、数学、代码、Agent/工具四类,但与开源派(DeepSeek/GLM/Kimi/Qwen)相比各有鲜明特点。Claude 侧:2024 年(Claude 3/3.5/3.7)仍以传统学术基准为主——MMLU、GPQA-Diamond、MATH、GSM8K、HumanEval、BBH、DROP、ARC-Challenge、MGSM,其中 MMLU(87-90)、GPQA(50-59)、MATH(61-71)、HumanEval(85-92)是当时对外的主打数字;2025 年 Claude 4 系列开始加入 SWE-bench Verified、Terminal-Bench、AIME、MMMLU,并首次把多语言 MMMLU 作为常规项;2025 下半年起(Sonnet/Opus 4.5 之后)Claude 的测评口径明显转向Agent 与专业任务——SWE-bench Verified/Pro/Multilingual/Multimodal、Terminal-Bench、BrowseComp、HLE(无工具/带工具双分数)、MCP-Atlas、OSWorld、τ²-Bench、ARC-AGI-2,以及大量自建或垂类基准:FrontierCode、FrontierBench、CursorBench、DeepSWE、FrontierSWE、OfficeQA、HealthBench(Professional)、Finance Agent、GDPval-AA、AutomationBench、AA-Briefcase、Legal Agent Benchmark、ChartQAPro、GraphWalks(长上下文)等;2026 年 Opus/Sonnet 5 进一步以 Frontier-Bench、ARC-AGI-3、SWE-Marathon、CursorBench 3.2 作为旗舰卖点。OpenAI 侧:GPT-4/GPT-4 Turbo 时代用 MMLU、GSM8K、MATH、BBH、HumanEval;GPT-4o 过渡到 MMLU、GPQA、AIME、MATH-500、LiveCodeBench、Codeforces;o 系列(o1/o1-mini/o3-mini/o3/o4-mini)是纯推理模型,官方主打竞赛类推理基准——AIME、Codeforces、GPQA-Diamond、MATH-500、LiveCodeBench 以及 OpenAI 自有的 MathArena、FrontierMath 等(未公开全部细节);GPT-5 则全面拥抱 HLE、AIME 2025/HMMT/IMO-AnswerBench、SWE-bench Verified、Terminal-Bench、BrowseComp、τ²-Bench 这一套 2026 年的”标准盘”。从趋势看,两家与开源派高度同步:MMLU、GSM8K、MATH、HumanEval、BBH 这类早期基准在 2024 年底后已从两家旗舰模型的官方报告中消失(GPT-4o 是最后一批还在报 MMLU/HumanEval 的,Claude 3.5 Sonnet 之后也不再报);当前(2026)两家共同在用的是 GPQA-Diamond、HLE、AIME(取最新一届)、HMMT、SWE-bench Verified/Pro、Terminal-Bench、BrowseComp、τ²-Bench 这一核心盘;差异在于 Claude 更激进地扩展 Agent/工具与专业领域测评(MCP-Atlas、OSWorld、GDPval-AA、ARC-AGI-2/3、FrontierCode、DeepSWE、HealthBench、OfficeQA 等已占其 System Card 能力章节的大部分篇幅),而 OpenAI 相对保守,主要报推理竞赛与代码工程基准,且因闭源口径,MMMLU、MCP-Atlas、OSWorld 等不在其官方发布之列。总体而言,2026 年的前沿模型竞争已从”谁 MMLU 高”彻底转向”谁在 HLE/SWE-bench Pro/BrowseComp/Terminal-Bench 这类长时程、工具密集的 Agent 任务上更强”,Claude 与 OpenAI 的官方 System Card 正是这一转变的缩影。

中外厂商测评差异说明

综合上面的表格与小结,Claude、OpenAI 与 DeepSeek/GLM/Kimi/Qwen 这四家国产厂商在测评上有四点结构性区别:

其一,测评集的”公共池”与”自建池”差异。国产开源派之间测评高度同质、互相引用,形成一个公共测评池——MMLU-Pro、GPQA-Diamond、AIME、MATH-500、HMMT、IMO-AnswerBench、LiveCodeBench、SWE-bench Verified/Multilingual、Terminal-Bench、BrowseComp、HLE 几乎每家都报,且各家技术报告里互相列对方成绩(DeepSeek 表引 Qwen/GLM/Kimi/Claude/GPT,GLM 表引 DeepSeek/Kimi/GPT/Claude,Qwen 表引 GLM/Kimi/Claude/GPT),好处是分数可直接横比、社区可复现。而 Claude 与 OpenAI 是闭源派,官方发布大量使用自建或垂类基准——Claude 的 FrontierCode、FrontierBench、CursorBench、OfficeQA、HealthBench、Finance Agent、GDPval-AA、AA-Briefcase、Legal Agent Benchmark、ChartQAPro、GraphWalks,OpenAI 的 MathArena、FrontierMath、OPQA、OpenAI PRs、SWE-Lancer、IC SWE 等,这些基准外部无法复现,且两家系统卡里对比的主要是自家历史模型,相对少与国产开源模型直接对表。

其二,透明度与可验证性差异。国产厂商全部开源权重并公开技术报告,测评数字往往附带评测代码(如 Kimi 的 K2 eval、Qwen 的 eval 脚本),分数可以被社区复跑验证;Claude/OpenAI 则只发布以安全为主的 System Card PDF 和挑选过的发布博客数字,许多能力成绩仅出现在图表中或第三方转载里(本文 OpenAI 篇的数据即因此只能依赖官方 System Card 与其他厂商明确标注”引用 OpenAI 官方”的转载),且同一测评集的两家口径(thinking effort、scaffold、采样次数、版本区间)各不相同,跨厂商横向比较天然带有不确定性——这也是本文在每个表头都标注口径差异的原因。

其三,测评重心不同。国产厂商更卷数学/推理竞赛(AIME、HMMT、IMO-AnswerBench、MATH-500、Codeforces、CNMO/全国高中数学联赛)和中文能力(C-Eval、C-SimpleQA、CLUEWSC、AlignBench 等,且表里保留了大量中文行),这既源于国内评测文化,也源于需要向社区证明推理实力;Claude/OpenAI 则更卷长时程、工具密集的 Agent 任务(SWE-bench Pro/Multimodal、Terminal-Bench、MCP-Atlas、OSWorld、BrowseComp、DeepSWE、FrontierCode、AutomationBench、GDPval-AA)和前沿难题(HLE、ARC-AGI-2/3、FrontierMath),2026 年两家 System Card 的能力章节已被 Agent 测评占据大半,传统学术基准退居末位。

其四,安全/对齐测评的公开程度不同。Claude 与 OpenAI 的 System Card 投入了大量篇幅报告安全测评(有害请求拒绝率、prompt injection 鲁棒性、生物/化学风险、网络攻防、模型福利等),这是闭源前沿厂商的责任性义务;国产开源派的安全测评公开很少(DeepSeek 仅在 V2.5 发布时报告过内部安全得分,其余各家官方报告基本以纯能力测评为主),安全数据更多出现在各自的开源评测工具或社区第三方报告中。总体而言,国产派的测评是”开源竞技场”逻辑——用统一的公共试卷证明自己,Claude/OpenAI 则是”闭源自我证明”逻辑——用自建高难度试卷和 Agent 实测来定义前沿,两者分数不能简单横向类比,只看各自官方向导即可。