岁月史书:主流llm
Published:
岁月史书:主流llm
DeepSeek
| 模型(按发布时间) | 知识/推理 MMLU | 知识/推理 MMLU-Pro | 知识/推理 GPQA-Diamond | 知识/推理 SimpleQA | 知识/推理 HLE | 对齐/偏好 IF-Eval | 对齐/偏好 AlpacaEval 2.0 | 对齐/偏好 ArenaHard | 对齐/偏好 AlignBench | 数学 AIME | 数学 MATH-500 | 数学 CNMO 2024 | 数学 HMMT | 数学 IMO-AnswerBench | 代码 HumanEval | 代码 LiveCodeBench | 代码 Codeforces | 代码 SWE-bench Verified | 代码 SWE-bench Multi | 代码 Aider | 代码 Terminal-Bench | Agent/搜索 BrowseComp | 中文 C-Eval | 中文 C-SimpleQA | 中文 CLUEWSC |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| DeepSeek-V2(2024-05-07) | 77.8 | — | — | — | — | — | 38.90 | 41.60 | 7.91 | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.0 | — | 89.9 |
| DeepSeek-Coder-V2(2024-06-17) | 79.2 | — | — | — | — | — | 36.92 | 65.00 | 7.84 | — | — | — | — | — | 90.2(Py) | 43.4(23.12–24.06) | — | — | — | — | — | — | 79.4 | — | 85.9 |
| DeepSeek-V2.5(2024-09-05) | — | — | — | — | — | — | 50.5 | 76.2 | 8.04 | — | — | — | — | — | 89.0(Py)/ 73.8(Multi) | 41.0(2024.01–09) | — | 16.8 | — | 72.2 | — | — | — | — | — |
| DeepSeek-V3(2024-12-26) | 88.5 | 75.9 | 59.1 | 24.9 | — | 86.1 | 70.0 | 85.5 | — | 39.2(2024) | 90.2 | 43.2 | — | — | 82.6(Multi) | 37.6 | 51.6(Pct) | 42.0 | — | 79.7(Edit)/ 49.6(Poly) | — | — | 86.5 | 64.8 | 90.9 |
| DeepSeek-R1(2025-01-20) | 90.8 | 84.0 | 71.5 | 30.1 | — | 83.3 | 87.6 | 92.3 | — | 79.8(2024) | 97.3 | 78.8 | — | — | — | 65.9 | 2029(R)/ 96.3(Pct) | 49.2 | — | 53.3 | — | — | 91.8 | 63.7 | 92.8 |
| DeepSeek-R1-0528(2025-05-28) | — | 85.0 | 81.0 | — | 17.7(无工具) | — | — | — | — | 91.4(2024)/ 87.5(2025) | — | 86.9 | 79.4(2025) | — | — | 73.3 | 1930(R) | 57.6 | — | 71.6 | — | — | — | — | — |
| DeepSeek-V3.1(2025-08-21) | — | 84.8 | 80.1 | 93.4 | 29.8(带工具) | — | — | — | — | 93.1(2024)/ 88.4(2025) | — | — | 84.2(2025) | — | — | 74.8(2408-2505) | 2091(R) | 66.0(Verified) | 54.5 | 76.3 | 31.3(2.0) | 30.0 | — | — | — |
| DeepSeek-V3.2(思考模式,2025-12-01) | — | 85.0 | 82.4 | — | 25.1(无工具) | — | — | — | — | 93.1(2025) | — | — | 92.5 / 90.2(2025 Feb / Nov) | 78.3(2025) | — | 83.3 | 2386(R) | 73.1(Verified) | 70.2 | — | 46.4(2.0) | 51.4/67.6(无工具/带工具) | — | — | — |
| DeepSeek-V4-Pro-0813(正式版,2026-08-13) | — | — | — | — | 42.7 / 60.0(无工具/带工具) | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 87.9(2.1) | — | — | — | — |
| DeepSeek-V4-Flash-0731(正式版,2026-07-31) | — | — | — | — | 37.8 / 51.5(无工具/带工具) | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.7(2.1) | — | — | — | — |
GLM
| 模型(按发布时间) | 知识/推理 MMLU | 知识/推理 MMLU-Pro | 知识/推理 GPQA-Diamond | 知识/推理 HLE | 数学 AIME | 数学 HMMT | 数学 IMO-AnswerBench | 数学 MATH-500 | 数学 MATH | 数学 GSM8K | 代码 HumanEval | 代码 LiveCodeBench | 代码 SWE-bench Verified | 代码 SWE-bench Pro | 代码 SWE-bench Multilingual | 代码 Terminal-Bench | 代码 BrowseComp | Agent/工具 τ²-Bench | Agent/工具 TAU-Bench | Agent/工具 BFCL V3 | Agent/工具 SciCode | Agent/工具 MCP-Atlas | 对齐 AlignBench |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GLM-4(2024-01-16) | 81.5 | — | 35.7 | — | — | — | — | — | 47.9 | 87.6 | 72.0 | — | — | — | — | — | — | — | — | — | — | — | 7.66 |
| GLM-4.5(2025-07-20) | 90.0 | 84.6 | 79.1 | 14.4(无工具) | 91.0(2024) | — | — | 98.2 | — | — | — | 72.9(v6) | 64.2(Verified) | — | — | 37.5 | 26.4(无工具) | — | 79.7 / 60.4 | 77.8 | 41.7 | — | — |
| GLM-4.5-Air(2025-07-20) | 87.4 | 81.4 | 75.0 | 10.6(无工具) | 89.4(2024) | — | — | 98.1 | — | — | — | 70.7(v6) | 57.6(Verified) | — | — | 30.0 | 21.3(无工具) | — | 77.9 / 60.8 | 76.4 | 37.3 | — | — |
| GLM-4.6(2025-09-29) | — | 83.2 | 81.0 | 17.2 / 30.4(无工具/带工具) | 93.9(2025) | 89.2 / 87.7(2025 Feb / Nov) | 73.5(2025) | — | — | — | — | 82.8(v6) | 68.0(Verified) | — | 53.8 | 24.5(2.0) | 45.1(无工具) | 75.2 | — | — | — | — | — |
| GLM-4.7(2025-12-22) | — | 84.3 | 85.7 | 24.8 / 42.8(无工具/带工具) | 95.7(2025) | 97.1 / 93.5(2025 Feb / Nov) | 82.0(2025) | — | — | — | — | 84.9(v6) | 73.8(Verified) | — | 66.7 | 41.0(2.0) | 52.0(无工具) | 87.4 | — | — | — | — | — |
| GLM-5(2026-02-11) | — | — | 86.0 | 30.5 / 50.4(无工具/带工具) | 92.7(2026) | 96.9(2025 Nov) | 82.5(2026) | — | — | — | — | — | 77.8(Verified) | — | 73.3 | 56.2(2.0) | 62.0(无工具) | 89.7 | — | — | — | 67.8 | — |
| GLM-5.1(2026-04-03) | — | — | 86.2 | 31.0 / 52.3(无工具/带工具) | 95.3(2026) | 94.0 / 82.6(2025 Nov / 2026 Feb) | 83.8(2026) | — | — | — | — | — | — | 58.4 | — | 63.5(2.0) | 68.0 / 79.3(无工具/带工具) | 70.6(τ³) | — | — | — | 71.8 | — |
| GLM-5.2(2026-06-16) | — | — | 91.2 | 40.5 / 54.7(无工具/带工具) | 99.2(2026) | 94.4 / 92.5(2025 Nov / 2026 Feb) | 91.0(2026) | — | — | — | — | — | — | 62.1 | — | 81.0(2.1) | — | — | — | — | — | 76.8 | — |
| GLM-5.3(2026-08-14) | — | — | — | — / 62.5(带工具) | — | — | — | — | — | — | — | — | — | — | — | 88.2(2.1) | — | — | — | — | — | — | — |
Kimi
| 模型(按发布时间) | 知识/推理 MMLU | 知识/推理 MMLU-Pro | 知识/推理 MMLU-Redux | 知识/推理 GPQA-Diamond | 知识/推理 HLE | 数学 AIME | 数学 HMMT | 数学 IMO-AnswerBench | 数学 MATH-500 | 数学 Codeforces | 代码 LiveCodeBench | 代码 SWE-bench Verified | 代码 SWE-bench Pro | 代码 SWE-bench Multilingual | 代码 Multi-SWE-bench | 代码 Terminal-Bench | 代码 BrowseComp | 代码 SciCode | Agent/工具 OJBench | Agent/工具 DeepSearchQA | Agent/工具 MCP-Atlas | Agent/工具 Toolathlon |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Kimi k1.5 long-CoT(2025-01-20) | — | — | — | — | — | 77.5(2024) | — | — | 96.2 | 94(Pct) | 62.5(v5,24.12–25.2) | — | — | — | — | — | — | — | — | — | — | — |
| Kimi K2(Instruct,2025-07-11) | 89.5 | 81.1 | 92.7 | 75.1 | 4.7(文本子集) | 69.6 / 49.5(2024 / 2025) | 38.8(2025) | — | 97.4 | — | 53.7(v6) | 65.8 | — | 47.3 | — | 30.0 / 25.0(自研 / Terminus) | — | — | — | — | — | — |
| Kimi K2 Thinking(2025-11-06) | — | 84.6 | 94.4 | 84.5 | 23.9 / 44.9(文本子集,无工具 / 带工具) | 94.5(2025) | 89.4(2025) | 78.6(2025) | — | — | 83.1(v6) | 71.3 | — | 61.1 | 41.9 | 47.1(Terminus-2 JSON) | 60.2(无工具) | 44.8(无工具) | 48.7(cpp) | — | — | — |
| Kimi K2.5(Thinking,2026-01-27) | — | 87.1 | — | 87.6 | 30.1 / 50.2(Full,无工具 / 带工具) | 96.1(2025) | 95.4(2025 Feb) | 81.8(2025) | — | — | 85.0(v6) | 76.8 | 50.7 | 73.0 | — | 50.8(2.0,Terminus-2) | 60.6(无工具) | 48.7(无工具) | 57.4(cpp) | — | — | — |
| Kimi K2.6(2026-04-20) | — | — | — | 90.5 | 34.7 / 54.0(Full,无工具 / 带工具) | 96.4(2026) | 92.7(2026 Feb) | 86.0(2026) | — | — | 89.6(v6) | 80.2 | 58.6 | 76.7 | — | 66.7(2.0,Terminus-2) | 83.2(无工具) | 52.2(无工具) | 60.6(python) | 92.5(无工具) | — | 50.0(无工具) |
| Kimi K3(2026-07-16) | — | — | — | 93.5 | 43.5 / 56.0(Full,无工具 / 带工具) | — | — | — | — | — | — | — | — | — | — | 88.3(2.1) | 91.2(无工具) | 58.7(无工具) | — | 95.0(无工具) | 84.2(无工具) | 76.5(Verified) |
Qwen
| 模型(按发布时间) | 知识/推理 MMLU | 知识/推理 MMLU-Pro | 知识/推理 MMLU-Redux | 知识/推理 GPQA-Diamond | 知识/推理 HLE | 数学 AIME | 数学 HMMT | 数学 IMO-AnswerBench | 数学 MATH-500 | 数学 MATH | 数学 GSM8K | 代码 LiveCodeBench | 代码 Codeforces | 代码 SWE-bench Verified | 代码 SWE-bench Pro | 代码 SWE-bench Multilingual | 代码 Terminal-Bench | Agent/搜索 BrowseComp | 对齐/通用 IFEval | 对齐/通用 Arena-Hard | 对齐/通用 C-Eval | 对齐/通用 LiveBench | 对齐/通用 AlignBench |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2-72B-Instruct(2024-06-07) | 82.3 | 64.4 | — | 42.4 | — | — | — | — | — | 69.0 | 93.2 | 35.7(v1) | — | — | — | — | — | — | 77.6 | 48.1 | 83.8 | — | 8.27 |
| Qwen2.5-72B-Instruct(2024-09-19) | — | 71.1 | 86.8 | 49.0 | — | — | — | — | — | 83.1 | 95.8 | 55.5(2305–2409) | — | — | — | — | — | — | 84.1 | 81.2 | — | 52.3 | — |
| Qwen2.5-Max(2025-01-28) | — | 76.1 | — | 60.1 | — | — | — | — | — | — | — | 38.7(24.08–24.11) | — | — | — | — | — | — | — | 89.4 | — | 62.2 | — |
| Qwen3-235B-A22B(思考模式,2025-04-29) | — | — | 92.7 | 71.1 | — | 85.7 / 81.5(2024 / 2025) | — | — | 98.0 | — | — | 70.7(v5) | 2056 / 98.2% | — | — | — | — | — | 83.4 | 95.6 | 89.6 | 77.1 | 8.94 |
| Qwen3.5-397B-A17B(2026-02-16) | — | 87.8 | 94.9 | 88.4 | 28.7(无工具) | 91.3(2026) | 94.8 / 92.7(2025 Feb / Nov) | 80.9(2025) | — | — | — | 83.6(v6) | — | 76.4(Verified) | — | 69.3(Multilingual) | 52.5(2.0) | 69.0 / 78.6(无工具/带工具) | 92.6 | — | 93.0 | — | — |
| Qwen3.6-35B-A3B(2026-04-16) | — | 85.2 | 93.3 | 86.0 | 21.4(无工具) | 92.7(2026) | 90.7 / 89.1 / 83.6(2025 Feb / 2025 Nov / 2026 Feb) | 78.9(2025) | — | — | — | 80.4(v6) | — | 73.4(Verified) | 49.5(Pro) | 67.2(Multilingual) | 51.5(2.0) | — | — | — | 90.0 | — | — |
| Qwen3.6-27B(2026-04-22) | — | 86.2 | 93.5 | 87.8 | 24.0(无工具) | 94.1(2026) | 93.8 / 90.7 / 84.3(2025 Feb / 2025 Nov / 2026 Feb) | 80.8(2025) | — | — | — | 83.9(v6) | — | 77.2(Verified) | 53.5(Pro) | 71.3(Multilingual) | 59.3(2.0) | — | — | — | 91.4 | — | — |
测评集分类与使用趋势小结
综合四家的官方测评,可以把主流 LLM 测评集归为五大类:知识/推理类、数学类、代码类、Agent/工具类 与 对齐/偏好类。知识/推理类包括 MMLU(57 学科的多选题)、MMLU-Pro(MMLU 的进阶推理版,目前各家仍普遍报告)、MMLU-Redux(MMLU 的数据修正版)、GPQA-Diamond(研究生级科学多选题,号称”谷歌搜不到答案”)、SuperGPQA(285 个学科的大规模科学题)、SimpleQA(OpenAI 的事实性短答,后被 SimpleQA-Verified 取代)、HLE(Humanity’s Last Exam,人类全学科前沿难题,2025 年后的旗舰标配)以及中文的 C-Eval、C-SimpleQA、CLUEWSC。数学类包括 AIME(美国数学邀请赛,2024/2025/2026 各届仍在轮换使用)、MATH 与 MATH-500(MATH 的 500 题子集,已取代完整 MATH)、GSM8K(小学数学应用题)、HMMT(哈佛-麻省理工数学锦标赛)、IMO-AnswerBench(国际数学奥林匹克)和 CNMO(中国数学奥林匹克)。代码类包括 HumanEval(函数级代码生成,已基本弃用)、MBPP/MultiPL-E/EvalPlus(同类早期基准)、LiveCodeBench(防污染的动态代码题,版本从 v1 迭代到 v6,2025 年起各家统一报 v6)、Codeforces(竞赛编程,报 Rating 或 Percentile)、SWE-bench Verified/Multilingual/Pro(真实 GitHub issue 的工程修复,Verified→Pro 逐步升级)、Terminal-Bench(终端命令行操作,1.x→2.0→2.1)、Aider(代码编辑)、SciCode、OJBench 等。Agent/工具类是 2025 年才兴起的新类别,包括 BrowseComp(复杂网页搜索)、τ²/τ³-Bench 与 TAU-Bench(多轮工具调用客服场景)、BFCL v3/v4(伯克利函数调用)、MCP-Atlas/MCPMark(MCP 协议工具调用)、Toolathlon 与 Tool-Decathlon(通用工具使用)、DeepSearchQA 与 WideSearch(深度搜索),以及 NL2Repo、Cybergym、DeepSWE、FrontierSWE、SWE-Marathon 等 2026 年最新出现的长时程编码 Agent 基准。对齐/偏好类则包括 IFEval/IFBench(指令遵循)、Arena-Hard 与 AlpacaEval 2.0(LLM 裁判的偏好胜率)、MT-Bench(多轮对话评判)和中文的 AlignBench。
从时间线看趋势非常清晰:2024 年早期各家还在报 MMLU、GSM8K、MATH、HumanEval、BBH、C-Eval 等”基础款”,但这些基准因分数饱和与数据污染,在 2024 年底之后已基本退出新模型的官方报告——MMLU 让位于 MMLU-Pro/MMLU-Redux,GSM8K/MATH 让位于 AIME/MATH-500/HMMT/IMO-AnswerBench,HumanEval 让位于 LiveCodeBench/SWE-bench,MT-Bench 也让位于 Arena-Hard/AlpacaEval,BFCL 从 v3 升级到 v4。当前(2025 下半年至 2026)各家旗舰一致在用的是:知识/推理类的 MMLU-Pro、GPQA-Diamond、HLE;数学类的 AIME(取最新一届)、HMMT、IMO-AnswerBench、MATH-500;代码类的 LiveCodeBench v6、SWE-bench Verified/Pro/Multilingual、Terminal-Bench;以及 2026 年新增的 Agent 类基准(BrowseComp、τ²/τ³-Bench、MCP-Atlas、Toolathlon、DeepSearchQA、Cybergym、NL2Repo 等)——从 DeepSeek-V4 正式版、GLM-5.2、Kimi K3 的官方报告可以看出,Agent/工具类测评的权重已超过传统学术基准,成为衡量前沿模型的主要标尺。那些”已不用”的基准并非完全消失,而是退化为 base 模型评测或内部消融测试使用(如 MMLU、C-Eval 仍出现在各家 base 模型报告中),不再作为旗舰模型的对外卖点。
Claude
| 模型(按发布时间) | 知识/推理 MMLU | 知识/推理 GPQA-Diamond | 知识/推理 MMMLU | 知识/推理 HLE | 知识/推理 ARC-AGI-2 | 数学 MATH | 数学 GSM8K | 数学 AIME | 代码 HumanEval | 代码 SWE-bench Verified | 代码 SWE-bench Pro | 代码 Terminal-Bench | 代码 DeepSWE | 代码 FrontierCode | Agent/工具 BrowseComp | Agent/工具 MCP-Atlas | Agent/工具 OSWorld | Agent/工具 τ²-Bench | Agent/工具 GDPval-AA | Agent/工具 AutomationBench |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Claude 2(2023-07-11) | 78.5 | — | — | — | — | — | 88.0 | — | 71.2(Codex) | — | — | — | — | — | — | — | — | — | — | — |
| Claude 3 Opus(2024-03-04) | 86.8 | 50.4 | — | — | — | 61 | 95.0 | — | 84.9 | — | — | — | — | — | — | — | — | — | — | — |
| Claude 4 Opus(2025-05-22) | — | 74.9 | 87.4 | — | — | — | — | 33.9(2025) | — | 72.5 | — | 43.2(2.0) | — | — | — | — | — | — | — | — |
| Claude Opus 4.5(2025-11-24) | — | 87.0 | 90.8 | 30.8/43.4(无工具/带工具) | 37.6 | — | — | 92.8(2025) | — | 80.9 | — | 59.3(2.0) | — | — | — | 62.3 | 66.3 | 88.9 | 1416 | — |
| Claude Opus 4.6(2026-02-05) | — | 91.3 | 91.1 | 40.0/53.0(无工具/带工具) | 68.8 | — | — | 99.8(2025) | — | 80.8 | 53.4 | 65.4(2.0) | — | — | 83.7(带工具) | 59.5 | 72.7 | 91.9 | 1606 | — |
| Claude Opus 4.7(2026-04-16) | — | 94.2 | 91.5 | 46.9 / 54.7(无工具/带工具) | 75.8 | — | — | — | — | 87.6 | 64.3 | 69.4(2.0) | — | — | 79.3(带工具) | 77.3 | 78.0 | — | 1753 | 9.9 |
| Claude Opus 4.8(2026-05-28) | — | 93.6 | — | 49.8 / 57.9(无工具/带工具) | 72.1 | — | — | — | — | 88.6 | 69.2 | 74.6(2.1) | — | 46.5 | 84.3(带工具) | 82.2 | 83.4 | — | 1890 | 15.5 |
| Claude Fable 5(2026-06) | — | — | — | — | — | — | — | — | — | 95 | 80 | 84.3(2.1) | — | 29.3 | — | — | 85.0 | — | 1932 | 17.4 |
| Claude Opus 5(2026-07-24) | — | — | — | 56.3 / 64.7(无工具/带工具) | 90.4 | — | — | — | — | 96.0 | 79.2 | — | 68.8 | 53.4 | 90.8(带工具) | 85.8 | 70.6(2.0) | — | 1861 | 26.0 |
GPT
| 模型(按发布时间) | 知识/推理 MMLU | 知识/推理 MMLU-Pro | 知识/推理 GPQA-Diamond | 知识/推理 HLE | 数学 MATH-500 | 数学 AIME | 数学 HMMT | 代码 HumanEval | 代码 LiveCodeBench | 代码 Codeforces | 代码 SWE-bench Verified | 代码 Terminal-Bench | Agent/工具 BrowseComp | Agent/工具 τ²-Bench |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GPT-4(2023-03-14) | 86.4 | — | 35.7 | — | — | — | — | 67.0 | — | — | — | — | — | — |
| GPT-4 Turbo(2023-11-06) | 84.7 | — | 42.5 | — | 64.3 | — | — | 83.7 | — | — | — | — | — | — |
| GPT-4o(2024-05-13) | 87.2 | — | 49.9 | — | 74.6 | 9.3(2024) | — | 91.0 | 32.9(v1) | 759(R) | — | — | — | — |
| o1(2024-12-05) | 91.8 | — | 75.7 | — | 96.4 | 74.3/79.2(2024/2025) | — | — | — | 1891(R) | 48.9 | — | — | — |
| o3(2025-04-16) | 92.9 | 85.3 | 83.3 | 20.3(无工具) | 97.8 | 91.6/88.9(2024/2025) | — | 87.4 | 78.4(v5) | 2706(R) | 69.1 | 30.2(2.0) | 49.7(带工具) | — |
| GPT-5(2025-08-07) | — | 87.1 | 85.7 | 24.8(无工具) | — | 94.6(2025) | 88.3 / 89.2(2025 Feb / Nov) | — | 84.5(v6) | 2537(R) | 74.9 | 43.8(2.0) | 54.9(带工具) | 81.1 |
测评集分类与使用趋势小结
Claude 与 OpenAI 两家闭源厂商的官方测评口径,同样可以归入知识/推理、数学、代码、Agent/工具四类,但与开源派(DeepSeek/GLM/Kimi/Qwen)相比各有鲜明特点。Claude 侧:2024 年(Claude 3/3.5/3.7)仍以传统学术基准为主——MMLU、GPQA-Diamond、MATH、GSM8K、HumanEval、BBH、DROP、ARC-Challenge、MGSM,其中 MMLU(87-90)、GPQA(50-59)、MATH(61-71)、HumanEval(85-92)是当时对外的主打数字;2025 年 Claude 4 系列开始加入 SWE-bench Verified、Terminal-Bench、AIME、MMMLU,并首次把多语言 MMMLU 作为常规项;2025 下半年起(Sonnet/Opus 4.5 之后)Claude 的测评口径明显转向Agent 与专业任务——SWE-bench Verified/Pro/Multilingual/Multimodal、Terminal-Bench、BrowseComp、HLE(无工具/带工具双分数)、MCP-Atlas、OSWorld、τ²-Bench、ARC-AGI-2,以及大量自建或垂类基准:FrontierCode、FrontierBench、CursorBench、DeepSWE、FrontierSWE、OfficeQA、HealthBench(Professional)、Finance Agent、GDPval-AA、AutomationBench、AA-Briefcase、Legal Agent Benchmark、ChartQAPro、GraphWalks(长上下文)等;2026 年 Opus/Sonnet 5 进一步以 Frontier-Bench、ARC-AGI-3、SWE-Marathon、CursorBench 3.2 作为旗舰卖点。OpenAI 侧:GPT-4/GPT-4 Turbo 时代用 MMLU、GSM8K、MATH、BBH、HumanEval;GPT-4o 过渡到 MMLU、GPQA、AIME、MATH-500、LiveCodeBench、Codeforces;o 系列(o1/o1-mini/o3-mini/o3/o4-mini)是纯推理模型,官方主打竞赛类推理基准——AIME、Codeforces、GPQA-Diamond、MATH-500、LiveCodeBench 以及 OpenAI 自有的 MathArena、FrontierMath 等(未公开全部细节);GPT-5 则全面拥抱 HLE、AIME 2025/HMMT/IMO-AnswerBench、SWE-bench Verified、Terminal-Bench、BrowseComp、τ²-Bench 这一套 2026 年的”标准盘”。从趋势看,两家与开源派高度同步:MMLU、GSM8K、MATH、HumanEval、BBH 这类早期基准在 2024 年底后已从两家旗舰模型的官方报告中消失(GPT-4o 是最后一批还在报 MMLU/HumanEval 的,Claude 3.5 Sonnet 之后也不再报);当前(2026)两家共同在用的是 GPQA-Diamond、HLE、AIME(取最新一届)、HMMT、SWE-bench Verified/Pro、Terminal-Bench、BrowseComp、τ²-Bench 这一核心盘;差异在于 Claude 更激进地扩展 Agent/工具与专业领域测评(MCP-Atlas、OSWorld、GDPval-AA、ARC-AGI-2/3、FrontierCode、DeepSWE、HealthBench、OfficeQA 等已占其 System Card 能力章节的大部分篇幅),而 OpenAI 相对保守,主要报推理竞赛与代码工程基准,且因闭源口径,MMMLU、MCP-Atlas、OSWorld 等不在其官方发布之列。总体而言,2026 年的前沿模型竞争已从”谁 MMLU 高”彻底转向”谁在 HLE/SWE-bench Pro/BrowseComp/Terminal-Bench 这类长时程、工具密集的 Agent 任务上更强”,Claude 与 OpenAI 的官方 System Card 正是这一转变的缩影。
中外厂商测评差异说明
综合上面的表格与小结,Claude、OpenAI 与 DeepSeek/GLM/Kimi/Qwen 这四家国产厂商在测评上有四点结构性区别:
其一,测评集的”公共池”与”自建池”差异。国产开源派之间测评高度同质、互相引用,形成一个公共测评池——MMLU-Pro、GPQA-Diamond、AIME、MATH-500、HMMT、IMO-AnswerBench、LiveCodeBench、SWE-bench Verified/Multilingual、Terminal-Bench、BrowseComp、HLE 几乎每家都报,且各家技术报告里互相列对方成绩(DeepSeek 表引 Qwen/GLM/Kimi/Claude/GPT,GLM 表引 DeepSeek/Kimi/GPT/Claude,Qwen 表引 GLM/Kimi/Claude/GPT),好处是分数可直接横比、社区可复现。而 Claude 与 OpenAI 是闭源派,官方发布大量使用自建或垂类基准——Claude 的 FrontierCode、FrontierBench、CursorBench、OfficeQA、HealthBench、Finance Agent、GDPval-AA、AA-Briefcase、Legal Agent Benchmark、ChartQAPro、GraphWalks,OpenAI 的 MathArena、FrontierMath、OPQA、OpenAI PRs、SWE-Lancer、IC SWE 等,这些基准外部无法复现,且两家系统卡里对比的主要是自家历史模型,相对少与国产开源模型直接对表。
其二,透明度与可验证性差异。国产厂商全部开源权重并公开技术报告,测评数字往往附带评测代码(如 Kimi 的 K2 eval、Qwen 的 eval 脚本),分数可以被社区复跑验证;Claude/OpenAI 则只发布以安全为主的 System Card PDF 和挑选过的发布博客数字,许多能力成绩仅出现在图表中或第三方转载里(本文 OpenAI 篇的数据即因此只能依赖官方 System Card 与其他厂商明确标注”引用 OpenAI 官方”的转载),且同一测评集的两家口径(thinking effort、scaffold、采样次数、版本区间)各不相同,跨厂商横向比较天然带有不确定性——这也是本文在每个表头都标注口径差异的原因。
其三,测评重心不同。国产厂商更卷数学/推理竞赛(AIME、HMMT、IMO-AnswerBench、MATH-500、Codeforces、CNMO/全国高中数学联赛)和中文能力(C-Eval、C-SimpleQA、CLUEWSC、AlignBench 等,且表里保留了大量中文行),这既源于国内评测文化,也源于需要向社区证明推理实力;Claude/OpenAI 则更卷长时程、工具密集的 Agent 任务(SWE-bench Pro/Multimodal、Terminal-Bench、MCP-Atlas、OSWorld、BrowseComp、DeepSWE、FrontierCode、AutomationBench、GDPval-AA)和前沿难题(HLE、ARC-AGI-2/3、FrontierMath),2026 年两家 System Card 的能力章节已被 Agent 测评占据大半,传统学术基准退居末位。
其四,安全/对齐测评的公开程度不同。Claude 与 OpenAI 的 System Card 投入了大量篇幅报告安全测评(有害请求拒绝率、prompt injection 鲁棒性、生物/化学风险、网络攻防、模型福利等),这是闭源前沿厂商的责任性义务;国产开源派的安全测评公开很少(DeepSeek 仅在 V2.5 发布时报告过内部安全得分,其余各家官方报告基本以纯能力测评为主),安全数据更多出现在各自的开源评测工具或社区第三方报告中。总体而言,国产派的测评是”开源竞技场”逻辑——用统一的公共试卷证明自己,Claude/OpenAI 则是”闭源自我证明”逻辑——用自建高难度试卷和 Agent 实测来定义前沿,两者分数不能简单横向类比,只看各自官方向导即可。
