DataLearner 标志

OpenAI o3 评测详情

OpenAI o3 当前已收录的代表性评测结果包括 Aider-Polyglot(5 / 59,得分 81.30)、MMMU(9 / 74,得分 82.90)、MATH-500(6 / 46,得分 98.10)。

评测结果

OpenAI o3

评测结果

思考模式
工具使用

综合知识考试

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
常规模式
85.60
25 / 175
HLE
思考水平·中
19.20
161 / 235
HLE
开启思考
20.32
153 / 235
HLE
思考水平·高
20.32
153 / 235

抽象归纳与泛化

共 8 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
思考水平·低
41.50
151 / 193
ARC-AGI-1
思考水平·中
53.83
141 / 193
ARC-AGI-1
开启思考
60.80
126 / 193
ARC-AGI-1
思考水平·高
60.83
125 / 193
ARC-AGI-2
思考水平·低
2
158 / 181
ARC-AGI-2
思考水平·中
2.98
153 / 181
ARC-AGI-2
开启思考
6.50
133 / 181
ARC-AGI-2
思考水平·高
6.53
132 / 181

科学知识与推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
思考水平·低
79.80
133 / 253
GPQA Diamond
思考水平·中
80.81
126 / 253
GPQA Diamond
开启思考
83.30
106 / 253
CritPt
开启思考
1.10
151 / 204

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
49.40
14 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
开启思考
69.10
67 / 116

数学

共 12 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
常规模式
98.10
6 / 46
AIME 2024
常规模式
91.60
12 / 61
AIME2025
开启思考
88.90
46 / 110
FrontierMath v2
思考水平·低
19.30
51 / 58
FrontierMath v2
思考水平·中
29.82
44 / 58
FrontierMath v2
思考水平·高
33.33
42 / 58
IMO-ProofBench
开启思考
20.50
11 / 16
20.50
10 / 24
FrontierMath
思考水平·低
10.30
25 / 60
FrontierMath
思考水平·中
10
28 / 60
FrontierMath
思考水平·高
10.30
25 / 60
FrontierMath - Tier 4
思考水平·高
2.10
56 / 80

算法与竞赛编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
CodeClash
常规模式工具
1343
3 / 8
LiveCodeBench
常规模式
75.80
42 / 125

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1675.60
34 / 110

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
76.90
9 / 59
Aider-Polyglot
思考水平·高
81.30
5 / 59
Terminal Bench Hard
开启思考工具
37.10
65 / 244
Terminal-Bench
开启思考
30.20
21 / 35

图像感知与视觉推理

共 8 项评测
评测名称 / 模式
得分
排名/总数
MMMU
常规模式
82.90
9 / 74
MMMU
开启思考
82.90
9 / 74
MMMU
unknown
82.90
9 / 74
MMMU-Pro
开启思考
70.10
130 / 229
MMMU-Pro
unknown
76.40
73 / 229
GeoBench ACW
思考水平·中
74
11 / 20
GeoBench ACW
思考水平·高
60
19 / 20
VPCT
思考水平·中
52
10 / 24

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
思考水平·高
53.10
50 / 96

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GSO
思考水平·高工具
8.80
15 / 21

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
思考水平·高工具
52.42
36 / 52

跨长文理解与整合

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
思考水平·中
88.90
6 / 16

能力边界度量

共 1 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
思考水平·中工具
91.27
14 / 22

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
思考水平·高工具
76.65
49 / 66
MedCode
思考水平·高工具
47.29
25 / 64

客服与业务流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SAGE
思考水平·高工具
41.77
39 / 64

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
146.88
60 / 167