DataLearner 标志

GPT-4.1 mini 评测详情

GPT-4.1 mini 当前已收录的代表性评测结果包括 MMLU(23 / 124,得分 87.50)、IC SWE-Lancer (Diamond)(4 / 8,得分 33)、FrontierMath(39 / 60,得分 4.50)。

评测结果

GPT-4.1 mini

评测结果

思考模式
工具使用

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
87.50
23 / 124

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
65
200 / 253

仓库修复与多文件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
33
4 / 8
SWE-bench Verified
常规模式
23.60
114 / 116

数学

共 2 项评测
评测名称 / 模式
得分
排名/总数
AIME 2024
常规模式
49.60
48 / 61
FrontierMath
常规模式
4.50
39 / 60

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1147
85 / 110

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
32.40
43 / 59
Terminal Bench Hard
常规模式工具
7.60
190 / 244

客服与业务流程

共 3 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
常规模式工具
53
34 / 44
τ²-Bench - Telecom
开启思考工具
48.90
29 / 30
τ³-Banking
常规模式工具
5.40
152 / 167

图像感知与视觉推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
58.70
180 / 229

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
135
110 / 167