DataLearner 标志

GPT-4.1 评测详情

GPT-4.1 当前已收录的代表性评测结果包括 MMLU(9 / 124,得分 90.20)、GSM8K(6 / 68,得分 95.90)、MMLU-Pro(62 / 175,得分 80.50)。

评测结果

GPT-4.1

评测结果

思考模式
工具使用

综合知识考试

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
90.20
9 / 124
MMLU-Pro
常规模式
80.50
62 / 175
HLE
常规模式
3.70
233 / 235
HLE
unknown
5.40
222 / 235

数学

共 6 项评测
评测名称 / 模式
得分
排名/总数
GSM8K
常规模式
95.90
6 / 68
MATH-500
常规模式
92.80
32 / 46
AIME 2024
常规模式
48.10
49 / 61
AIME2025
常规模式
36.70
103 / 110
FrontierMath
常规模式
5.50
37 / 60
0
72 / 80

语言与阅读理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
DROP
常规模式
89.20
4 / 9

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
66.30
195 / 253

仓库修复与多文件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式
54.60
90 / 116
35.10
1 / 1
14.40
8 / 8

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
40.50
104 / 125

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1419.70
64 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
27
82 / 96

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
52.40
31 / 59
Terminal Bench Hard
常规模式工具
13.60
173 / 244

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
常规模式工具
54.70
33 / 44
τ²-Bench - Telecom
开启思考工具
34
30 / 30

图像感知与视觉推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GeoBench ACW
常规模式
72
12 / 20
MMMU-Pro
常规模式
61.20
172 / 229

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
常规模式工具
39.04
48 / 52

跨长文理解与整合

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
常规模式
63.90
15 / 16

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
136.79
106 / 167