DataLearner 标志

GPT-4o 评测详情

GPT-4o 当前已收录的代表性评测结果包括 HumanEval(8 / 101,得分 90)、MMLU(16 / 124,得分 88.70)、BBH(5 / 19,得分 91.70)。

评测结果

GPT-4o

评测结果

思考模式
工具使用

综合知识考试

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
88.70
16 / 124
MMLU-Pro
常规模式
77.90
77 / 175
MMLU-Pro
unknown
74.68
88 / 175
HLE
常规模式
5.30
223 / 235
HLE
unknown
2.72
235 / 235

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
HumanEval
常规模式
90
8 / 101

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
MATH
常规模式
75.90
16 / 42
MATH-500
常规模式
75.90
45 / 46
AIME2025
常规模式工具
42.10
102 / 110
AIME 2024
常规模式
9.30
61 / 61
FrontierMath
常规模式
0.30
57 / 60

综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
BBH
常规模式
91.70
5 / 19

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
70.10
182 / 253

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
38.20
22 / 46

仓库修复与多文件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式
31
111 / 116
23.30
6 / 8

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
35.10
110 / 125

图像感知与视觉推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMMU
unknown
70.70
43 / 74
MMMU-Pro
常规模式
56.30
187 / 229
MMMU-Pro
unknown
51.90
197 / 229

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
23.10
46 / 59
Terminal Bench Hard
常规模式工具
8.30
186 / 244

跨应用与工具编排

共 1 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
思考模式工具
71.10
31 / 38