DataLearner 标志

GPT OSS 120B 评测详情

GPT OSS 120B 当前已收录的代表性评测结果包括 AIME 2024(2 / 61,得分 96.60)、MMLU(11 / 124,得分 90)、AIME2025(18 / 110,得分 97.90)。

评测结果

GPT OSS 120B

评测结果

思考模式
工具使用

综合知识考试

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMLU
思考模式
90
11 / 124
MMLU-Pro
思考模式
79
68 / 175
HLE
思考模式
14.90
178 / 235
HLE
思考模式工具
19
162 / 235

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
思考模式
80.10
130 / 253
CritPt
思考水平·高
1.10
151 / 204

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
思考模式
60.10
83 / 116

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
思考模式
83
59 / 110
AIME2025
思考模式工具
97.90
18 / 110
AIME2025
思考水平·高工具
90
40 / 110
AIME 2024
思考模式工具
96.60
2 / 61
MathArena Apex
思考水平·高工具
1.04
14 / 17

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
961
93 / 110

算法与竞赛编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
CodeForces
思考模式
2463
11 / 21
CodeForces
思考模式工具
2622
9 / 21

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
思考模式
22.10
89 / 96

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
思考水平·高
41.80
38 / 59
Terminal Bench Hard
思考水平·低工具
5.30
210 / 244
Terminal Bench Hard
思考水平·高工具
23.50
141 / 244

指令与格式遵循

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
常规模式
69
19 / 31

跨能力综合测试

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
46.09
104 / 117

跨应用与工具编排

共 2 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
思考模式工具
60.60
36 / 38
44.84
40 / 45

跨能力聚合指数

共 2 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
139.94
95 / 167
24.13
27 / 28

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
思考水平·高
34
123 / 134

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
思考水平·低工具
2.90
166 / 167
τ³-Banking
思考水平·高工具
12.80
122 / 167

法律

共 1 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
思考水平·高工具
13.89
44 / 44

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
思考水平·高
4
102 / 122