DataLearner 标志

DeepSeek-V3 评测详情

DeepSeek-V3 当前已收录的代表性评测结果包括 HumanEval(9 / 101,得分 89)、MMLU(18 / 124,得分 88.50)、BBH(3 / 19,得分 92.30)。

评测结果

DeepSeek-V3

评测结果

思考模式
工具使用

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
88.50
18 / 124
MMLU-Pro
常规模式
75.90
86 / 175

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
HumanEval
常规模式
89
9 / 101

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
MATH
常规模式
87.80
7 / 42
MATH-500
常规模式
87.80
41 / 46
AIME 2024
常规模式
39
52 / 61
4.30
21 / 24
FrontierMath
常规模式
1.70
49 / 60

综合推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
BBH
常规模式
92.30
3 / 19

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
59.10
214 / 253
GPQA
常规模式
59.10
8 / 17

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
24.90
31 / 46

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
34.60
112 / 125

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
18.90
92 / 96

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
48.40
34 / 59
Terminal Bench Hard
常规模式工具
6.80
194 / 244

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
常规模式
35.80
121 / 134

客服与业务流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
常规模式工具
4.70
159 / 167

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
常规模式
0.80
119 / 122

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
132.36
112 / 167