DataLearner 标志

o3-pro 评测详情

o3-pro 当前已收录的代表性评测结果包括 Aider-Polyglot(3 / 59,得分 84.90)、Fiction.liveBench(1 / 16,得分 97.20)、AIME 2024(8 / 61,得分 93)。

评测结果

o3-pro

评测结果

思考模式
工具使用

抽象归纳与泛化

共 7 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
常规模式
59.33
128 / 193
ARC-AGI-1
思考水平·低工具
44.33
148 / 193
ARC-AGI-1
思考水平·中工具
57
134 / 193
ARC-AGI-1
思考水平·高
59.33
128 / 193
ARC-AGI-2
思考水平·低工具
2.05
157 / 181
ARC-AGI-2
思考水平·中工具
1.94
159 / 181
ARC-AGI-2
思考水平·高工具
4.86
140 / 181

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
常规模式
21
152 / 235

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
84
97 / 253

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
思考水平·高
75
39 / 116

数学

共 2 项评测
评测名称 / 模式
得分
排名/总数
AIME 2024
常规模式
93
8 / 61
AIME2025
常规模式
93
33 / 110

自主开发与终端任务

共 1 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
思考水平·高
84.90
3 / 59

跨应用与工具编排

共 1 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
常规模式工具
44.50
43 / 44

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
思考水平·高工具
58.21
30 / 52

跨长文理解与整合

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
思考水平·中
97.20
1 / 16

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
147.43
57 / 167