DataLearner 标志

DeepSeek-V3.1 评测详情

DeepSeek-V3.1 当前已收录的代表性评测结果包括 MMLU(1 / 124,得分 93.40)、SimpleQA(4 / 46,得分 93.40)、AIME 2024(7 / 61,得分 93.10)。

评测结果

DeepSeek-V3.1

评测结果

思考模式
工具使用

综合知识考试

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
91.80
4 / 124
MMLU
思考模式
93.40
1 / 124
MMLU-Pro
常规模式
83.70
45 / 175
MMLU-Pro
思考模式
85
28 / 175
HLE
思考模式
15.90
176 / 235

科学知识与推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
74.90
159 / 253
GPQA Diamond
思考模式
80.10
130 / 253
CritPt
思考模式
2
131 / 204

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
思考模式
93.40
4 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式
66
76 / 116

数学

共 3 项评测
评测名称 / 模式
得分
排名/总数
AIME 2024
常规模式
66.30
40 / 61
AIME 2024
思考模式
93.10
7 / 61
AIME2025
思考模式
88.40
47 / 110

算法与竞赛编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
56.40
83 / 125
LiveCodeBench
思考模式
74.80
44 / 125

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1435.90
61 / 110

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench
常规模式工具
31.30
19 / 35
Terminal Bench Hard
常规模式工具
24.20
134 / 244
Terminal Bench Hard
思考模式工具
25
128 / 244

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
40
70 / 96

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
139.92
96 / 167