DataLearner 标志

DeepSeek-V3-0324 评测详情

DeepSeek-V3-0324 当前已收录的代表性评测结果包括 GSM8K(4 / 68,得分 96.30)、MMLU(29 / 124,得分 86.50)、GPQA(4 / 17,得分 68.40)。

评测结果

DeepSeek-V3-0324

评测结果

思考模式
工具使用

综合知识考试

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
86.50
29 / 124
MMLU-Pro
常规模式
81.20
57 / 175
HLE
常规模式
5.20
224 / 235

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
GSM8K
常规模式
96.30
4 / 68
MATH-500
常规模式
94
30 / 46
AIME 2024
常规模式
59.40
43 / 61
AIME2025
常规模式
47.70
96 / 110
IMO-ProofBench
常规模式
4.30
15 / 16

语言与阅读理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
DROP
常规模式
89.70
3 / 9

抽象归纳与泛化

共 1 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
常规模式
9
185 / 193

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
68.40
188 / 253
GPQA
常规模式
68.40
4 / 17

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
27.20
28 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式
38.80
107 / 116

算法与竞赛编程

共 3 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
49.20
97 / 125
IOI 2024 (Vals v1)
常规模式工具
1.70
9 / 10
IOI 2025 (Vals v1)
常规模式工具
1.70
9 / 9

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1472.30
59 / 110

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
55.10
27 / 59
Terminal Bench Hard
常规模式工具
15.20
168 / 244
Terminal-Bench
常规模式
13.30
34 / 35

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
27.20
81 / 96

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
常规模式工具
38.80
39 / 44
τ³-Banking
常规模式工具
4.70
159 / 167

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
常规模式
39
110 / 134

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
常规模式
1.60
112 / 122