DataLearner 标志

OpenAI o3-mini (high) 评测详情

OpenAI o3-mini (high) 当前已收录的代表性评测结果包括 HumanEval(1 / 101,得分 97.60)、MATH(1 / 42,得分 97.90)、MATH-500(10 / 46,得分 97.90)。

评测结果

OpenAI o3-mini (high)

评测结果

思考模式

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
86.90
27 / 124

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
HumanEval
常规模式
97.60
1 / 101

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
MATH
常规模式
97.90
1 / 42
MATH-500
常规模式
97.90
10 / 46
AIME 2024
常规模式
87
18 / 61
FrontierMath
思考水平·高
11
23 / 60
FrontierMath - Tier 4
思考水平·高
4.20
40 / 80

抽象归纳与泛化

共 1 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
常规模式
34.50
160 / 193

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
79.70
134 / 253

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
13.80
37 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式
49.30
97 / 116

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
69.50
58 / 125