DataLearner 标志

DeepSeek V3.2-Exp 评测详情

DeepSeek V3.2-Exp 当前已收录的代表性评测结果包括 SimpleQA(1 / 46,得分 97.10)、MMLU-Pro(28 / 175,得分 85)、Aider-Polyglot(11 / 59,得分 74.20)。

评测结果

DeepSeek V3.2-Exp

评测结果

思考模式
工具使用

综合知识考试

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
常规模式
84
40 / 175
MMLU-Pro
思考模式
85
28 / 175
HLE
常规模式
8.60
203 / 235
HLE
思考模式
19.80
157 / 235
HLE
思考模式工具
20.30
155 / 235

科学知识与推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
74
161 / 253
GPQA Diamond
思考模式
79.90
132 / 253
CritPt
常规模式
1.40
139 / 204
CritPt
思考模式
1.40
139 / 204

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
思考模式工具
97.10
1 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
思考模式工具
67.80
73 / 116

算法与竞赛编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
55
88 / 125
LiveCodeBench
思考模式
74.10
45 / 125

数学

共 2 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
58
92 / 110
AIME2025
思考模式
89.30
42 / 110

自主开发与终端任务

共 6 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
70.20
17 / 59
Aider-Polyglot
思考模式
74.20
11 / 59
Terminal-Bench
常规模式工具
23
30 / 35
Terminal-Bench
思考模式工具
37.70
14 / 35
Terminal Bench Hard
常规模式工具
25
128 / 244
Terminal Bench Hard
思考模式工具
31.10
105 / 244

客服与业务流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
思考模式工具
66.70
28 / 44

事实查找与深度检索

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
思考模式工具
40.10
53 / 58

跨能力综合测试

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
49.85
93 / 117
LiveBench
思考模式
58.90
75 / 117

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
145.02
77 / 167