DataLearner 标志

DeepSeek-V4-Flash 评测详情

DeepSeek-V4-Flash 当前已收录的代表性评测结果包括 LiveCodeBench(5 / 125,得分 91.60)、MMLU-Pro(18 / 175,得分 86.40)、CodeForces(3 / 21,得分 3289)。本页还提供与 3 个竞品模型及 2 个前代或同系列模型的对比,在有数据时会展示性能和价格视图。

评测结果

DeepSeek-V4-Flash

评测结果

思考模式
工具使用
联网能力

综合知识考试

共 9 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
常规模式
83
47 / 175
86.40
18 / 175
MMLU-Pro
最高
86.20
19 / 175
HLE
常规模式
8.10
208 / 235
HLE
高
29.40
121 / 235
HLE
高工具
40.30
84 / 235
HLE
最高
34.80
101 / 235
HLE
最高工具
51.50
35 / 235
HLE
思考水平·极高工具
45.10
59 / 235

科学知识与推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
71.20
174 / 253
CritPt
常规模式
0.30
186 / 204
3.40
113 / 204
CritPt
最高
7.10
91 / 204

仓库修复与多文件工程

共 11 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式工具
73.70
45 / 116
78.60
23 / 116
SWE-bench Verified
思考水平·极高工具
79
20 / 116
SWE-bench Multilingual
常规模式工具
69.70
24 / 30
70.20
22 / 30
SWE-bench Multilingual
思考水平·极高工具
73.30
17 / 30
NL2Repo-Bench
最高工具
54.20
12 / 16
DeepSWE
最高工具
53.32
63 / 92
SWE-Bench Pro - Public
常规模式工具
49.10
50 / 62
52.30
42 / 62
SWE-Bench Pro - Public
思考水平·极高工具
52.60
40 / 62

算法与竞赛编程

共 5 项评测
评测名称 / 模式
得分
排名/总数
2816
6 / 21
3289
3 / 21
LiveCodeBench
常规模式
55.20
86 / 125
88.40
12 / 125
91.60
5 / 125

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1559.10
48 / 110

常识推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
61.10
32 / 96
SimpleBench
常规模式
46.30
60 / 96

事实查找与深度检索

共 2 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
高工具
53.50
43 / 58
BrowseComp
思考水平·极高工具
73.20
31 / 58

跨能力综合测试

共 2 项评测
评测名称 / 模式
得分
排名/总数
SuperCLUE
unknown
65.60
9 / 13
LiveBench
常规模式
65.48
52 / 117

自主开发与终端任务

共 9 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench 2.0
常规模式工具
49.10
36 / 48
56.60
28 / 48
Terminal Bench 2.0
思考水平·极高工具
56.90
26 / 48
Terminal Bench Hard
常规模式工具
34.10
82 / 244
38.60
57 / 244
35.60
70 / 244
Terminal-Bench 3.0
最高工具
7.60
11 / 11
3
72 / 98
Terminal-Bench 4.0
最高工具
2.50
75 / 98

多轮记忆与持续上下文

共 2 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
26.47
117 / 126
Context Arena
开启思考
69.42
66 / 126

数学

共 7 项评测
评测名称 / 模式
得分
排名/总数
AIME 2026
最高工具
95.83
10 / 30
HMMT Feb 2026
最高工具
93.94
6 / 10
IMO-AnswerBench
常规模式
41.90
23 / 24
85.10
12 / 24
88.40
7 / 24
58.60
7 / 17
MathArena Apex
最高工具
27.08
12 / 17

跨应用与工具编排

共 3 项评测
评测名称 / 模式
得分
排名/总数
81.74
8 / 45
70.30
14 / 14
Agents' Last Exam
最高工具
25.20
21 / 24

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
最高工具
37.70
16 / 25

科学计算与科研编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
40.20
105 / 134
SciCode
最高
45.30
93 / 134

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
高工具
26.20
72 / 167
τ³-Banking
最高工具
30.90
58 / 167

法律

共 1 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
最高工具
81.33
31 / 44

漏洞发现与分析

共 2 项评测
评测名称 / 模式
得分
排名/总数
CyberGym
最高工具
76.70
10 / 11
SEC-Bench Pro
最高工具
30.90
6 / 6

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
高工具
43.76
44 / 52

综合偏好评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
1576.54
6 / 35

文档与图表理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
10.40
82 / 122
GDP.pdf
最高
10.80
81 / 122

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
最高工具联网
25
16 / 29

漏洞利用

共 1 项评测
评测名称 / 模式
得分
排名/总数
1.80
6 / 6

跨能力聚合指数

共 2 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
146.10
69 / 167
47.96
29 / 36

竞品对比

DeepSeek-V4-Flash 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项DeepSeek-V4-Flash当前GLM 5.1Qwen3.6-27BGemini 3.5 Flash
HLE
Accuracy
综合知识考试
51.50思考水平·高 | 工具
52.30开启思考 | 工具
24.00开启思考
40.20思考水平·高 | 工具
MMLU-Pro
Accuracy
综合知识考试
86.40思考水平·高
--
86.20开启思考
--
CritPt
Score
科学知识与推理
7.10思考水平·高
4.60开启思考
1.10开启思考
13.10思考水平·高
GPQA Diamond
Accuracy
科学知识与推理
71.20常规模式
86.20开启思考
87.80开启思考
92.80思考水平·高
DeepSWE
Pass@1 (DeepSWE v1.1)
仓库修复与多文件工程
53.32思考水平·高 | 工具
--
--
37.00思考水平·中 | 工具
SWE-bench Multilingual
Accuracy
仓库修复与多文件工程
73.30思考水平·极高 | 工具
--
71.30开启思考 | 工具
--
SWE-Bench Pro - Public
Accuracy
仓库修复与多文件工程
52.60思考水平·极高 | 工具
58.40开启思考 | 工具
53.50开启思考 | 工具
55.10思考水平·高 | 工具
SWE-bench Verified
Accuracy
仓库修复与多文件工程
79.00思考水平·极高 | 工具
--
77.20开启思考 | 工具
--
LiveCodeBench
Pass @K
算法与竞赛编程
91.60思考水平·高
--
83.90开启思考
--
Creative Writing
Elo、大模型评判两两对战
写作与创意表达
1559.10常规模式
1592.20常规模式
--
--
SimpleBench
Score (AVG@5)
常识推理
61.10常规模式
55.10常规模式
--
76.70常规模式
BrowseComp
Accuracy
事实查找与深度检索
73.20思考水平·极高 | 工具
79.30开启思考 | 工具
--
--
其余 17 个 benchmark 仍可在上方图表中查看。

DeepSeek-V4-Flash 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

模型供应商标准输入标准输出标准价适用于
DeepSeek-V4-Flash
DeepSeek-AI$0.14 / 1M tokens$0.28 / 1M tokens—
GLM 5.1
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens—
Gemini 3.5 Flash
Google DeepMind$1.5 / 1M tokens$9 / 1M tokens—

历代版本对比

DeepSeek-V4-Flash 系列各版本的评测成绩纵向对比

DeepSeek-V4-FlashDeepSeek V4DeepSeek V3.2
评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项DeepSeek-V4-Flash当前DeepSeek V3.2
HLE
Accuracy
综合知识考试
51.50思考水平·高 | 工具
25.10开启思考
CritPt
Score
科学知识与推理
7.10思考水平·高
2.90开启思考
GPQA Diamond
Accuracy
科学知识与推理
71.20常规模式
82.40开启思考
SWE-Bench Pro - Public
Accuracy
仓库修复与多文件工程
52.60思考水平·极高 | 工具
40.90开启思考
SWE-bench Verified
Accuracy
仓库修复与多文件工程
79.00思考水平·极高 | 工具
73.10开启思考 | 工具
CodeForces
Accuracy
算法与竞赛编程
3289.00思考水平·高
2386.00开启思考
LiveCodeBench
Pass @K
算法与竞赛编程
91.60思考水平·高
83.30开启思考
Creative Writing
Elo、大模型评判两两对战
写作与创意表达
1559.10常规模式
1515.00常规模式
BrowseComp
Accuracy
事实查找与深度检索
73.20思考水平·极高 | 工具
51.40开启思考
LiveBench
Accuracy
跨能力综合测试
65.48常规模式
62.20开启思考
Terminal Bench 2.0
Accuracy
自主开发与终端任务
56.90思考水平·极高 | 工具
46.40开启思考 | 工具
Terminal Bench Hard
Accuracy
自主开发与终端任务
38.60思考水平·高 | 工具
35.60开启思考 | 工具
其余 2 个 benchmark 仍可在上方图表中查看。

单评测历史趋势图

当前查看:HLE · 综合知识考试

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

DeepSeek-V4-Flash 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

模型供应商标准输入标准输出标准价适用于
DeepSeek-V4-Flash
DeepSeek-AI$0.14 / 1M tokens$0.28 / 1M tokens—
DeepSeek V3.2
DeepSeek-AI$0.28 / 1M tokens$0.42 / 1M tokens—