DataLearner 标志

DeepSeek-V4-Pro 评测深度分析

DeepSeek-V4-Pro 评测分析:LiveCodeBench 排名第一(93.50分),Codeforces 达3206分,数学推理IMO-AnswerBench得分89.80。本文对比GLM 5.1、Kimi K2.6及DeepSeek历代版本,解读各维度优劣与适用场景。

DeepSeek-V4-Pro 评测分析:编程能力独树一帜,综合能力仍有短板

DeepSeek-V4-Pro 是 DeepSeek 旗下目前评测数据最完整、成绩最突出的旗舰推理模型。从 DataLearner 收录的多维度评测结果来看,这个模型的优势集中而明显——代码生成与竞技编程领域几乎无对手,同代国产推理模型难以与之抗衡。但拉开视角看,在某些综合推理维度,它并不是最强的那一个。


编程是 V4 Pro 的核心优势,且差距明显

把编程类评测单独拿出来看,数字足够说明问题。

LiveCodeBench 是目前最能反映模型真实代码能力的动态评测之一,V4 Pro 深度思考模式下得分 93.50,在 DataLearner 收录的 118 个模型中排名第一。与 Kimi K2.6(89.60)相比领先约 4 个百分点,与上一代 DeepSeek V3.2(83.30)相比提升超过 10 个百分点,与 V3.1(74.80)和 R1-0528(73.30)相比提升幅度更接近 20 个百分点。这不是小步迭代,是在编程能力上的一次系统性跃升。

Codeforces 的竞技编程评分更直观:V4 Pro 深度思考模式下达到 3206 分,而 V3.2 是 2386 分,增幅超过 800 分。竞技编程的得分曲线是非线性的,3000 分以上意味着解题能力已经接近人类顶级程序员水平,这个分数在已知模型中排名第 4,属于第一梯队。

软件工程类评测(SWE-bench 系列)的结果稍微复杂一些。SWE-bench Verified 上 V4 Pro 得分 80.60,与 Kimi K2.6 的 80.20 基本持平,略微领先。但在 SWE-bench Multilingual(多语言代码库修复)上,V4 Pro 是 76.20,Kimi K2.6 是 76.70,差距同样微小。SWE-Bench Pro(更难的公开测试集)上,V4 Pro 是 55.40,反而低于 GLM 5.1 的 58.40 和 Kimi K2.6 的 58.60。这说明 V4 Pro 在竞技编程和代码生成上的优势是真实的,但在解决复杂工程软件缺陷这类任务上,它与竞品之间的差距已经微乎其微,甚至略处下风。


数学推理方向,V4 Pro 是同代国产模型里的最强选手

IMO-AnswerBench 是针对国际数学奥林匹克题目的评测,对于模型的深度数学推理能力有很强的区分度。V4 Pro 得分 89.80,GLM 5.1 是 83.80,Kimi K2.6 是 86.00,V4 Pro 领先幅度分别约 6 和 4 个百分点。在 DataLearner 收录的 17 个参测模型里,V4 Pro 排名第 3,已经属于全球前列。

GPQA Diamond 是科学推理和研究生级知识问答,V4 Pro 得分 90.10,Kimi K2.6 是 90.50,GLM 5.1 是 86.20。三者差距很小,V4 Pro 与 Kimi K2.6 实际上可以视为同一水平,均远超 GLM 5.1。

与自身系列纵向比较,数学和综合推理方面的进步同样可观。GPQA Diamond 从 V3.2 的 82.40 提升到 90.10,V3.1 是 80.10,R1-0528 是 81.00——后三者在这个维度的表现非常接近,V4 Pro 则拉开了约 8 个百分点的距离,是这一代迭代中最显著的进步点之一。


HLE 是 V4 Pro 的明显短板,同代竞品在这里更强

HLE(Humanity's Last Exam)是目前公认最难的综合知识推理评测,专门用来考查模型知识边界。V4 Pro 深度思考模式加工具联网的最高分是 48.20,而 GLM 5.1 在同等条件下是 52.30,Kimi K2.6 是 54.00。两个竞品分别高出约 4 到 6 个百分点,在 HLE 的量级上,这个差距是有意义的。

相比于系列历史来看,V4 Pro 的 HLE 成绩从 V3.2 的 25.10、V3.1 的 15.90 大幅提升,进步幅度在所有评测项里是最夸张的,接近翻倍。但即便如此,它在这个维度仍然落后于 Kimi K2.6 和 GLM 5.1,说明在极难跨领域知识推理上,V4 Pro 还有提升空间。


Agent 能力是 V4 Pro 的加分项,尤其是信息检索

BrowseComp 评测模型在有联网工具支持下的复杂信息检索能力。V4 Pro 得分 83.40,Kimi K2.6 是 83.20,GLM 5.1 是 79.30,三者中 V4 Pro 最高,但与 Kimi K2.6 几乎没有差异。

Terminal Bench 2.0 评测模型使用终端工具完成任务的能力,V4 Pro 得分 67.90,Kimi K2.6 是 66.70,GLM 5.1 是 63.50,V4 Pro 在这里有更明显的领先。

与系列自身纵向对比,Agent 能力的进步幅度是最大的:BrowseComp 从 V3.2 的 51.40 跳升到 83.40,Terminal Bench 2.0 从 V3.2 的 46.40 提升到 67.90,增幅都超过 40%。Agent 能力的系统性强化,看起来是 V4 Pro 这一代迭代的重要目标之一。


价格维度:V4 Pro 不是最便宜的,但定价逻辑合理

三个模型的标准 API 定价如下:V4 Pro 输入 $1.74/1M tokens、输出 $3.48/1M tokens;GLM 5.1 输入 $1.40/1M tokens、输出 $4.40/1M tokens;Kimi K2.6 输入 $0.95/1M tokens、输出 $4.00/1M tokens。

从性价比角度看,Kimi K2.6 输入价格最低,但输出价格接近 V4 Pro 的两倍,对于输出 token 密集的推理任务(比如长代码生成、复杂数学解题),V4 Pro 的实际成本不一定更高。GLM 5.1 输入价格最接近 V4 Pro,但输出价格是三者里最贵的。如果按照综合性能来算,V4 Pro 的定价在三者中处于中等,但拥有最强的编程和数学能力,对于代码密集型应用来说单位性价比并不差。


总结:定位清晰的专项强者

综合来看,DeepSeek-V4-Pro 在当前同代国产推理模型中有明确的优势领域:竞技编程和代码生成是绝对强项,数学推理同样处于第一梯队,Agent 工具使用能力相比前代有实质性提升。弱点同样明确:HLE 代表的超难跨领域综合推理,V4 Pro 落后于 GLM 5.1 和 Kimi K2.6,工程缺陷修复类任务(SWE-Bench Pro)也略处下风。

对于代码生成、数学解题、技术文档处理等任务,V4 Pro 是目前国产模型里最值得优先选择的;如果业务场景对宽域知识推理要求更高,Kimi K2.6 在 HLE 上的优势值得参考。

评测结果

DeepSeek-V4-Pro

评测结果

思考模式
工具使用
联网能力

综合知识考试

共 8 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
常规模式
82.90
50 / 175
87.10
14 / 175
MMLU-Pro
最高
87.50
12 / 175
HLE
常规模式
7.70
211 / 235
HLE
高
34.50
104 / 235
HLE
高工具
44.70
61 / 235
HLE
最高
37.70
88 / 235
HLE
思考水平·极高工具
48.20
50 / 235

科学知识与推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
72.90
168 / 253
CritPt
常规模式
0.90
162 / 204
10
74 / 204
CritPt
最高
12.90
65 / 204

仓库修复与多文件工程

共 12 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式工具
73.60
46 / 116
79.40
19 / 116
SWE-bench Verified
思考水平·极高工具
80.60
11 / 116
SWE-bench Multilingual
常规模式工具
69.80
23 / 30
74.10
13 / 30
SWE-bench Multilingual
思考水平·极高工具
76.20
11 / 30
DeepSWE
最高工具
62.83
46 / 92
DeepSWE
思考水平·极高工具
62.70
47 / 92
NL2Repo-Bench
思考水平·极高工具
61.50
4 / 16
SWE-Bench Pro - Public
常规模式工具
52.10
43 / 62
54.40
34 / 62
SWE-Bench Pro - Public
思考水平·极高工具
55.40
31 / 62

算法与竞赛编程

共 6 项评测
评测名称 / 模式
得分
排名/总数
2919
5 / 21
3206
4 / 21
LiveCodeBench
常规模式
56.80
80 / 125
89.80
9 / 125
93.50
1 / 125
IOI (Vals v2)
最高工具
51.61
17 / 26

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1553.20
50 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
50.90
53 / 96

事实查找与深度检索

共 2 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
高工具
80.40
19 / 58
BrowseComp
思考水平·极高工具
83.40
16 / 58

跨能力综合测试

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
71.57
32 / 117
SuperCLUE
unknown
70.10
6 / 13

自主开发与终端任务

共 8 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
思考水平·极高工具
87.90
7 / 57
Terminal Bench 2.0
常规模式工具
59.10
22 / 48
63.30
14 / 48
Terminal Bench 2.0
思考水平·极高工具
67.90
9 / 48
Terminal Bench Hard
常规模式工具
36.40
67 / 244
41.70
48 / 244
46.20
29 / 244
Terminal-Bench 4.0
最高工具
14.60
46 / 98

多轮记忆与持续上下文

共 2 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
31.43
115 / 126
Context Arena
开启思考
76.09
48 / 126

数学

共 10 项评测
评测名称 / 模式
得分
排名/总数
AIME 2026
最高工具
96.67
7 / 30
HMMT Feb 2026
最高工具
93.94
6 / 10
IMO-AnswerBench
常规模式
35.30
24 / 24
88
8 / 24
89.80
5 / 24
65.30
6 / 17
MathArena Apex
最高工具
28.12
11 / 17
50
18 / 28
45.26
31 / 58
2.44
37 / 42

跨能力聚合指数

共 3 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
155.39
24 / 167
Vals Index
最高工具
52.37
29 / 42
Vals Index v2.1
最高工具
47.63
30 / 36

跨应用与工具编排

共 4 项评测
评测名称 / 模式
得分
排名/总数
Toolathlon-Verified
思考水平·极高工具
74.10
6 / 14
MCPMark-Verified
最高工具
71.65
8 / 8
61.07
32 / 45
Agents' Last Exam
思考水平·极高工具
25.70
20 / 24

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
思考水平·极高工具
31.80
19 / 25

科学计算与科研编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SciCode
最高
50.80
68 / 134
3.80
17 / 18

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
高工具
26.20
72 / 167
τ³-Banking
最高工具
30.10
60 / 167

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
最高工具
84.40
24 / 44
40.87
17 / 42
7.50
15 / 43

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
Tax Agent Bench
最高工具
58.66
18 / 20
52.80
33 / 42
Finance Agent v2
最高工具
50.39
29 / 43

漏洞发现与分析

共 2 项评测
评测名称 / 模式
得分
排名/总数
CyberGym
思考水平·极高工具
83.30
7 / 11
SEC-Bench Pro
最高工具
56.40
5 / 6

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
最高
13.40
66 / 122

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
最高工具联网
18.75
19 / 29

漏洞利用

共 1 项评测
评测名称 / 模式
得分
排名/总数
5.40
5 / 6

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
最高工具
41.54
20 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
82.30
14 / 61

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
最高工具
80.17
40 / 66
MedCode
最高工具
42.47
38 / 64

竞品对比

DeepSeek-V4-Pro 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项DeepSeek-V4-Pro当前GLM 5.1Kimi K2.6Qwen3.8-Max
HLE
Accuracy
综合知识考试
48.20思考水平·极高 | 工具
52.30开启思考 | 工具
54.00开启思考 | 工具
56.20思考水平·极高 | 工具
CritPt
Score
科学知识与推理
12.90思考水平·高
4.60开启思考
8.00开启思考
20.00开启思考
GPQA Diamond
Accuracy
科学知识与推理
72.90常规模式
86.20开启思考
90.50开启思考
92.60思考水平·极高
DeepSWE
Pass@1 (DeepSWE v1.1)
仓库修复与多文件工程
62.83思考水平·高 | 工具
--
--
57.46思考水平·极高 | 工具
NL2Repo-Bench
Average test pass rate
仓库修复与多文件工程
61.50思考水平·极高 | 工具
--
--
55.90思考水平·极高 | 工具
SWE-bench Multilingual
Accuracy
仓库修复与多文件工程
76.20思考水平·极高 | 工具
--
76.70开启思考 | 工具
--
SWE-Bench Pro - Public
Accuracy
仓库修复与多文件工程
55.40思考水平·极高 | 工具
58.40开启思考 | 工具
58.60开启思考 | 工具
67.70思考水平·极高 | 工具
SWE-bench Verified
Accuracy
仓库修复与多文件工程
80.60思考水平·极高 | 工具
--
80.20开启思考 | 工具
--
LiveCodeBench
Pass @K
算法与竞赛编程
93.50思考水平·高
--
89.60开启思考
--
Creative Writing
Elo、大模型评判两两对战
写作与创意表达
1553.20常规模式
1592.20常规模式
1724.50常规模式
--
SimpleBench
Score (AVG@5)
常识推理
50.90常规模式
55.10常规模式
--
62.50思考水平·极高
BrowseComp
Accuracy
事实查找与深度检索
83.40思考水平·极高 | 工具
79.30开启思考 | 工具
83.20开启思考 | 工具
--
其余 22 个 benchmark 仍可在上方图表中查看。

DeepSeek-V4-Pro 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。

这些模型的价格币种或计费单位不一致,暂不直接绘制统一柱状图,以下展示原始价格。

DeepSeek-V4-Pro
供应商: DeepSeek-AI
标准输入: $0.435 / 1M tokens
标准输出: $0.87 / 1M tokens
GLM 5.1
供应商: 智谱AI
标准输入: $1.4 / 1M tokens
标准输出: $4.4 / 1M tokens
Kimi K2.6
供应商: Moonshot AI
标准输入: $0.95 / 1M tokens
标准输出: $4 / 1M tokens
Qwen3.8-Max
供应商: 阿里巴巴
标准输入: ¥12 / 1M tokens
标准输出: ¥36 / 1M tokens
模型供应商标准输入标准输出标准价适用于
DeepSeek-V4-Pro
DeepSeek-AI$0.435 / 1M tokens$0.87 / 1M tokens—
GLM 5.1
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens—
Kimi K2.6
Moonshot AI$0.95 / 1M tokens$4 / 1M tokens—
Qwen3.8-Max
阿里巴巴¥12 / 1M tokens¥36 / 1M tokens—

历代版本对比

DeepSeek-V4-Pro 系列各版本的评测成绩纵向对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项DeepSeek-V4-Pro当前DeepSeek V3.2DeepSeek-V3.1DeepSeek-R1-0528
HLE
Accuracy
综合知识考试
48.20思考水平·极高 | 工具
25.10开启思考
15.90开启思考
17.70开启思考
MMLU-Pro
Accuracy
综合知识考试
87.50思考水平·高
--
85.00开启思考
85.00开启思考
CritPt
Score
科学知识与推理
12.90思考水平·高
2.90开启思考
2.00开启思考
1.40开启思考
GPQA Diamond
Accuracy
科学知识与推理
72.90常规模式
82.40开启思考
80.10开启思考
81.00开启思考
SWE-Bench Pro - Public
Accuracy
仓库修复与多文件工程
55.40思考水平·极高 | 工具
40.90开启思考
--
--
SWE-bench Verified
Accuracy
仓库修复与多文件工程
80.60思考水平·极高 | 工具
73.10开启思考 | 工具
66.00常规模式
57.60开启思考
CodeForces
Accuracy
算法与竞赛编程
3206.00思考水平·高
2386.00开启思考
--
--
LiveCodeBench
Pass @K
算法与竞赛编程
93.50思考水平·高
83.30开启思考
74.80开启思考
73.30开启思考
Creative Writing
Elo、大模型评判两两对战
写作与创意表达
1553.20常规模式
1515.00常规模式
1435.90常规模式
1421.10常规模式
SimpleBench
Score (AVG@5)
常识推理
50.90常规模式
--
40.00常规模式
40.80开启思考
BrowseComp
Accuracy
事实查找与深度检索
83.40思考水平·极高 | 工具
51.40开启思考
--
--
LiveBench
Accuracy
跨能力综合测试
71.57常规模式
62.20开启思考
--
--
其余 4 个 benchmark 仍可在上方图表中查看。

单评测历史趋势图

当前查看:HLE · 综合知识考试

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

DeepSeek-V4-Pro 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

模型供应商标准输入标准输出标准价适用于
DeepSeek-V4-Pro
DeepSeek-AI$0.435 / 1M tokens$0.87 / 1M tokens—
DeepSeek V3.2
DeepSeek-AI$0.28 / 1M tokens$0.42 / 1M tokens—
DeepSeek-V3.1
Fireworks AI$0.56 / 1M tokens$1.68 / 1M tokens—
DeepSeek-R1-0528
Fireworks AI$1.35 / 1M tokens$5.4 / 1M tokens—

数据来源