DataLearner 标志

GPT-5-Nano 评测详情

GPT-5-Nano 当前已收录的代表性评测结果包括 FrontierMath(31 / 60,得分 8.30)、AIME2025(57 / 110,得分 85)、ECI(98 / 167,得分 139.39)。

评测结果

GPT-5-Nano

评测结果

思考模式
工具使用

抽象归纳与泛化

共 6 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
思考水平·低工具
4.04
192 / 193
ARC-AGI-1
思考水平·中工具
20.71
174 / 193
ARC-AGI-1
思考水平·高工具
16.67
177 / 193
ARC-AGI-2
思考水平·低工具
0
176 / 181
ARC-AGI-2
思考水平·中工具
0.88
172 / 181
ARC-AGI-2
思考水平·高工具
2.61
154 / 181

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
思考水平·低
57.58
217 / 253

数学

共 9 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
思考水平·低工具
47.22
98 / 110
AIME2025
思考水平·高工具
85
57 / 110
FrontierMath v2
思考水平·低
5.96
57 / 58
FrontierMath v2
思考水平·高
20
50 / 58
FrontierMath
思考水平·中
7.20
33 / 60
FrontierMath
思考水平·高
8.30
31 / 60
FrontierMath Tier 4 v2
思考水平·高
2.44
37 / 42
FrontierMath - Tier 4
思考水平·中
2.10
56 / 80
FrontierMath - Tier 4
思考水平·高
0
72 / 80

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
704.90
107 / 110

图像感知与视觉推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
31.80
226 / 229
MMMU-Pro
思考水平·中
58.20
183 / 229
MMMU-Pro
思考水平·高
61
173 / 229
MMMU
常规模式
57.60
63 / 74

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
DocVQA
常规模式
78.30
5 / 5

跨能力综合测试

共 3 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
48.56
100 / 117
LiveBench
思考水平·低
34.34
115 / 117
LiveBench
思考水平·高
48.62
99 / 117

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench Hard
常规模式工具
6.80
194 / 244
Terminal Bench Hard
思考水平·中工具
17.40
158 / 244
Terminal Bench Hard
思考水平·高工具
12.10
178 / 244

跨应用与工具编排

共 1 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
思考模式工具
68.80
34 / 38

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
思考水平·高工具
72.86
56 / 66
MedCode
思考水平·高工具
30.44
59 / 64

客服与业务流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SAGE
思考水平·高工具
30.38
59 / 64

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
139.39
98 / 167