DataLearner 标志
DE

DeepSeek-V4-Flash

预览版推理大模型编程大模型DeepSeek FlashDeepSeek V4

DeepSeek V4 Flash

发布时间: 2026-04-24更新于: 2026-09-10浏览量: 10,563
模型参数
2840亿
上下文长度
1M
多语言支持
支持
推理能力
5/5

V4 Flash 独立记录及生命周期保持不变:284B/13B MoE,保留原有权重和历史数据。补齐 2026-09-10 官方表中 0731 版本 max 评测,并区分当前 API 兼容路由与原模型历史价格。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

DeepSeek-V4-Flash

模型基本信息

推理过程
支持
思考模式
思考水平 · 最高 (Max) (默认)常规模式思考水平 · 高 (High)
上下文长度
1M tokens
最大输出长度
384K tokens
模型类型
推理大模型
输入/输出模态
文本 → 文本
发布时间
2026-04-24
模型文件大小
暂无数据
MoE架构
是
总参数 / 激活参数
2840亿 / 130亿
知识截止
暂无数据
DeepSeek-V4-Flash

开源和体验地址

代码开源状态
预训练权重开源
MIT License- 免费商用授权
GitHub 源码
暂无
在线体验
DeepSeek-V4-Flash

官方介绍与博客

DeepSeek-V4-Flash

API接口信息

接口速度
4/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.140/ 1M tokens$0.280/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—$0.0028/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

DeepSeek-V4-Flash

评测结果

DeepSeek-V4-Flash 当前已收录的代表性评测结果包括 LiveCodeBench(5 / 125,得分 91.60)、MMLU-Pro(18 / 175,得分 86.40)、CodeForces(3 / 21,得分 3289)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

综合知识考试

共 9 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
常规模式
83
47 / 175
86.40
18 / 175
MMLU-Pro
最高
86.20
19 / 175
HLE
常规模式
8.10
208 / 235
HLE
高
29.40
121 / 235
HLE
高工具
40.30
84 / 235
HLE
最高
34.80
101 / 235
HLE
最高工具
51.50
35 / 235
HLE
极高工具
45.10
59 / 235

科学知识与推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
71.20
174 / 253
CritPt
常规模式
0.30
186 / 204
3.40
113 / 204
CritPt
最高
7.10
91 / 204

仓库修复与多文件工程

共 11 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式工具
73.70
45 / 116
78.60
23 / 116
SWE-bench Verified
极高工具
79
20 / 116
SWE-bench Multilingual
常规模式工具
69.70
24 / 30
70.20
22 / 30
73.30
17 / 30
NL2Repo-Bench
最高工具
54.20
12 / 16
DeepSWE
最高工具
53.32
63 / 92
SWE-Bench Pro - Public
常规模式工具
49.10
50 / 62
52.30
42 / 62
52.60
40 / 62

算法与竞赛编程

共 5 项评测
评测名称 / 模式
得分
排名/总数
2816
6 / 21
3289
3 / 21
LiveCodeBench
常规模式
55.20
86 / 125
88.40
12 / 125
91.60
5 / 125

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1559.10
48 / 110

常识推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
61.10
32 / 96
SimpleBench
常规模式
46.30
60 / 96

事实查找与深度检索

共 2 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
高工具
53.50
43 / 58
BrowseComp
极高工具
73.20
31 / 58

跨能力综合测试

共 2 项评测
评测名称 / 模式
得分
排名/总数
SuperCLUE
unknown
65.60
9 / 13
LiveBench
常规模式
65.48
52 / 117

自主开发与终端任务

共 9 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench 2.0
常规模式工具
49.10
36 / 48
56.60
28 / 48
Terminal Bench 2.0
极高工具
56.90
26 / 48
Terminal Bench Hard
常规模式工具
34.10
82 / 244
38.60
57 / 244
35.60
70 / 244
Terminal-Bench 3.0
最高工具
7.60
11 / 11
3
72 / 98
Terminal-Bench 4.0
最高工具
2.50
75 / 98

多轮记忆与持续上下文

共 2 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
26.47
117 / 126
Context Arena
思考模式
69.42
66 / 126

数学

共 7 项评测
评测名称 / 模式
得分
排名/总数
AIME 2026
最高工具
95.83
10 / 30
HMMT Feb 2026
最高工具
93.94
6 / 10
IMO-AnswerBench
常规模式
41.90
23 / 24
85.10
12 / 24
88.40
7 / 24
58.60
7 / 17
MathArena Apex
最高工具
27.08
12 / 17

跨应用与工具编排

共 3 项评测
评测名称 / 模式
得分
排名/总数
81.74
8 / 45
70.30
14 / 14
Agents' Last Exam
最高工具
25.20
21 / 24

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
最高工具
37.70
16 / 25

科学计算与科研编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
40.20
105 / 134
SciCode
最高
45.30
93 / 134

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
高工具
26.20
72 / 167
τ³-Banking
最高工具
30.90
58 / 167

法律

共 1 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
最高工具
81.33
31 / 44

漏洞发现与分析

共 2 项评测
评测名称 / 模式
得分
排名/总数
CyberGym
最高工具
76.70
10 / 11
SEC-Bench Pro
最高工具
30.90
6 / 6

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
高工具
43.76
44 / 52

综合偏好评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
1576.54
6 / 35

文档与图表理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
10.40
82 / 122
GDP.pdf
最高
10.80
81 / 122

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
最高工具联网
25
16 / 29

漏洞利用

共 1 项评测
评测名称 / 模式
得分
排名/总数
1.80
6 / 6

跨能力聚合指数

共 2 项评测
评测名称 / 模式
得分
排名/总数

和其他模型对比

DeepSeek-V4-Flash

发布机构

DeepSeek V4 Flash

模型解读

2026-09-10 信息更新:V4 Flash 0731

本页继续保留 DeepSeek V4 Flash 独立模型记录与既有生命周期状态,不执行下线、删除或模型页面重定向。2026 年 9 月 10 日发布表中的 V4 Flash 0731 一栏补充了最新对比成绩;它不是 V4.1 Flash,参数、权重与历史评测不可互相覆盖。

0731 版本 max 模式评测

GPQA Diamond 89.9;HLE 纯文本子集 37.8(不是完整 HLE);Codeforces Rating 3289;MathArena Apex 58.6;Terminal-Bench 2.1/3.0/4.0:82.7/7.6/7.0;DeepSWE v1.1 54.4;NL2Repo-Bench 54.2;CyberGym 76.7;SEC-Bench Pro 30.9;ExploitGym 1.8(预算未注明);HLE(带工具)51.5;Automation-Bench 37.7;Agents’ Last Exam 25.2。

本次提供的成绩按 max effort 写入,标准知识、数学和竞赛编程项目区分为无工具,Agent 项与明确 w/tools 项区分为带工具;不额外推断联网。HLE 37.8 星号为纯文本子集,单列为独立基准,避免与完整 HLE 混合。ExploitGym 因时间预算未说明,不归入 2h/6h/unlimited。ProgramBench 和视觉评测列为破折号,表示没有给出成绩,不录成 0。0731 原表的 Toolathlon Verified 70.3 及其他已有模式、第三方历史成绩保留。Automation-Bench 本次表为 37.7,替换同一 max 带工具条目原 25.1;旧表来源与变化在本地数据记录中保留。

架构、权重及版本边界

保留既有规格:284B 总参数、13B 激活参数的 MoE,文本输入及文本输出、1M 上下文、384K 最大输出。V4 系列结合 Compressed Sparse Attention(CSA)、Heavily Compressed Attention(HCA)、mHC 超连接和 Muon 优化器。原 V4 Flash 开放权重及原有 MIT 许可不因 API 路由变化而改变;0731 是 API 后训练更新,不能视作此前开源权重同步升级。

API 兼容路由与历史价格

根据所给 2026-09-10 资料,deepseek-v4-flash 调用名暂时路由到 V4.1 Flash,推荐调用名为 deepseek-flash。当前通过该兼容名发出的请求执行的是新模型,并按新模型峰谷价计费;这与本页原 V4 Flash 模型记录的生命周期、权重和历史评测分开管理。

本页原模型价格记录为历史价格:每百万 tokens 缓存命中输入 $0.0028、未命中输入 $0.14、输出 $0.28,不是当前兼容名路由后的报价。V4.1 Flash 新价格另列于其页面:每百万 tokens 空闲时段缓存命中输入/未命中输入/输出为人民币 0.02/1/4 元,高峰为 0.04/2/8 元;高峰为北京时间工作日 09:00–12:00、14:00–18:00。

推理与接口历史

原模型支持非思考、high、max,原有思考模式及默认设置保留。既有接口能力包括 OpenAI/Anthropic 兼容格式、Responses API、JSON Output、Tool Calls、前缀补全,以及非思考模式 FIM。原模型是文本模型,不能因兼容名现在路由到原生视觉模型就改成本体支持图像。

来源与配置备注

最新成绩与兼容路由依据用户提供的 DeepSeek 2026-09-10 发布资料,未另行联网核实。原 0731 官方公开 Code Agent 测试备注为 DeepSeek Harness minimal mode、max effort、temperature=1.0、top_p=0.95;不能推断所有历史榜单均使用完全相同的配置。参考:DeepSeek 更新日志。

DeepSeek-V4-Flash

常见问题

本页的 V4 Flash 是否被下线或删除?

没有,本次只更新信息和评测,保留既有生命周期状态与独立模型记录。API 兼容名路由和原模型记录分开管理。

现在调用 deepseek-v4-flash 使用哪个模型和价格?

所给资料说明该兼容名暂时路由至 V4.1 Flash,并使用 V4.1 Flash 新价格;原 V4 Flash 页面上的美元价格是历史记录。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码