DataLearner 标志

DeepSeek-R1 评测详情

DeepSeek-R1 当前已收录的代表性评测结果包括 MMLU(8 / 124,得分 90.80)、MMLU-Pro(40 / 175,得分 84)、MATH-500(14 / 46,得分 97.30)。

评测结果

DeepSeek-R1

评测结果

思考模式
工具使用

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
90.80
8 / 124
MMLU-Pro
常规模式
84
40 / 175

抽象归纳与泛化

共 1 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
常规模式
15.80
179 / 193

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
71.50
170 / 253
CritPt
开启思考
0.60
172 / 204

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
30.10
24 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式
49.20
98 / 116

数学

共 4 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
常规模式
97.30
14 / 46
AIME 2024
常规模式
79.80
28 / 61
AIME2025
常规模式
70
81 / 110
3.80
22 / 24

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
65.90
64 / 125

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1500
55 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
30.90
78 / 96

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
开启思考
56.90
25 / 59
Terminal Bench Hard
开启思考工具
6.10
204 / 244

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
开启思考
38.30
114 / 134

客服与业务流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
开启思考工具
6.40
147 / 167

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
常规模式工具
36.49
49 / 52

跨长文理解与整合

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
常规模式
69.40
11 / 16

逻辑与规划

共 1 项评测
评测名称 / 模式
得分
排名/总数
BALROG
常规模式工具
34.90
8 / 12

能力边界度量

共 1 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
常规模式工具
26.93
21 / 22

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
开启思考
2.40
109 / 122

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
138.98
100 / 167