DataLearner 标志
DE

DeepSeek-V4.1-Flash

多模态大模型编程大模型DeepSeek FlashDeepSeek V4.1

DeepSeek V4.1 Flash

别名:deepseek-flash / deepseek-v4-flash / deepseek-v4-flash-vision-exp

发布时间: 2026-09-10更新于: 2026-09-27浏览量: 7,553
模型参数
5520亿
上下文长度
1M
多语言支持
支持
推理能力
4.5/5

552B 原生多模态开放权重 MoE,预填充/解码仅激活约 8B/16B 参数;Artificial Analysis 的 max 实测综合分 39、每任务约 $0.27,优势集中在 Agent 能力和高吞吐。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

DeepSeek-V4.1-Flash

模型基本信息

推理过程
支持
思考模式
思考水平 · 高 (High) (默认)常规模式思考水平 · 低 (Low)思考水平 · 最高 (Max)
上下文长度
1M tokens
最大输出长度
384K tokens
模型类型
多模态大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-09-10
模型文件大小
约 510.3 GB(48 个 safetensors 分片,约 475.3 GiB)
MoE架构
是
总参数 / 激活参数
5520亿 / 160亿
知识截止
暂无数据
DeepSeek-V4.1-Flash

开源和体验地址

代码开源状态
预训练权重开源
MIT License- 免费商用授权
GitHub 源码
暂无
在线体验
DeepSeek-V4.1-Flash

官方介绍与博客

DataLearnerAI博客
暂无
DeepSeek-V4.1-Flash

API接口信息

接口速度
暂无数据
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
off_peak
类型适用条件输入输出
文本-¥1.00/ 1M tokens¥4.00/ 1M tokens
文本-$0.150/ 1M tokens$0.600/ 1M tokens
peak
类型适用条件输入输出
文本-¥2.00/ 1M tokens¥8.00/ 1M tokens
文本-$0.300/ 1M tokens$1.20/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—¥0.020/ 1M tokens
文本-—$0.0030/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

DeepSeek-V4.1-Flash

评测结果

DeepSeek-V4.1-Flash 当前已收录的代表性评测结果包括 HLE(5 / 235,得分 63.90)、DeepSWE(3 / 92,得分 74.20)、Terminal-Bench 2.1(2 / 57,得分 90.60)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
HLE
最高
36.80
95 / 235
HLE
最高工具
63.90
5 / 235

科学知识与推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
90.90
32 / 253
21.17
11 / 13
CritPt
最高
14.30
61 / 204

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1540.10
51 / 110

算法与竞赛编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
3471
1 / 21
IOI (Vals v2)
高工具
40.28
23 / 26

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
66.70
22 / 96

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
最高工具
90.60
2 / 57
Terminal-Bench 3.0
最高工具
30
4 / 11
Terminal-Bench 4.0
最高工具
26.80
32 / 98

仓库修复与多文件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
最高工具
74.20
3 / 92
NL2Repo-Bench
最高工具
65.40
2 / 16

跨能力聚合指数

共 4 项评测
评测名称 / 模式
得分
排名/总数

跨应用与工具编排

共 1 项评测
评测名称 / 模式
得分
排名/总数
Agents' Last Exam
最高工具
31.80
8 / 24

程序生成与编辑

共 2 项评测
评测名称 / 模式
得分
排名/总数
84.74
11 / 61
Program Bench
最高工具
20.30
9 / 15

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
最高工具
54.80
1 / 25

图像感知与视觉推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
BabyVision
最高工具
89.60
3 / 9
MMMU-Pro
最高
77
70 / 229
ZeroBench Main
最高工具
49
3 / 6

科学计算与科研编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SciCode
最高
51.90
61 / 134
15.70
8 / 18

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
62.46
13 / 20
57.21
27 / 42
53.48
24 / 43

法律

共 2 项评测
评测名称 / 模式
得分
排名/总数
41.35
15 / 42
6.67
17 / 43

漏洞发现与分析

共 2 项评测
评测名称 / 模式
得分
排名/总数
CyberGym
最高工具
88.10
3 / 11
SEC-Bench Pro
最高工具
62.80
4 / 6

文档与图表理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
Chartography
最高工具
78.90
5 / 11
GDP.pdf
最高
12.80
70 / 122

数学

共 2 项评测
评测名称 / 模式
得分
排名/总数
65.60
4 / 17
54
16 / 28

漏洞利用

共 1 项评测
评测名称 / 模式
得分
排名/总数
15.30
3 / 6

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
45.62
11 / 43

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
64.28
14 / 26
SAGE
高工具
47.88
22 / 64

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
高工具
85.50
18 / 66
MedCode
高工具
41.17
42 / 64

跨能力综合测试

共 1 项评测
评测名称 / 模式
得分
排名/总数
SuperCLUE
unknown
71.81
2 / 13

和其他模型对比

DeepSeek-V4.1-Flash

发布机构

DeepSeek V4.1 Flash

模型解读

DeepSeek V4.1 Flash 是 DeepSeek 于 2026 年 9 月 10 日发布的原生多模态开放权重 MoE。它有 552B 骨干参数,但 Causal Encoder-Decoder(CED)结构把预填充阶段的激活参数压到约 8B、解码阶段约 16B,并把全局 KV Cache 压到每 token 约 890 bytes。DeepSeek 对这款模型的核心宣传不是“小模型追旗舰”,而是用更少的激活计算和缓存把 Agent 性能、吞吐与成本一起改善。独立测试基本验证了它相对 V4 Pro 的代际优势,但把比较对象换成 GLM-5.3 Flash、GPT-6 Luna 这类低价模型后,结论会变成:V4.1 Flash 的强项是 Agent 与速度,并不是所有任务上的最高综合分或最低价格。

用更少激活参数超过 V4 Pro,这个主张被独立测试基本验证

DeepSeek 官方模型卡给出的结构是 552B 参数、40 层 Transformer,其中 20 层 causal encoder 加 20 层 decoder;预填充每 token 激活约 8B,解码约 16B。CSA2、分层稀疏索引和 FP4 KV Cache 把全局 KV Cache 压到约 890 bytes/token,约为上一代 V4 Flash 的四分之一;模型从头用 45T token 多模态语料训练,并把上下文扩展到 1M。

Artificial Analysis 在 2026 年 9 月 27 日读取到的独立对比中,V4.1 Flash max 的 Intelligence Index 为 39,V4 Pro 0813 max 为 36;每任务成本约 $0.27 对 $0.67,输出速度约 236 对 89 token/s,首 token 延迟约 0.95 对 1.69 秒。这组数据支持“更快、更便宜、综合能力更高”的总体方向,但不是每项指标都赢:V4 Pro 在 Humanity's Last Exam 为 41% 对 39%,CritPt 为 18% 对 14%,AA-Omniscience 为 1 对 -5。所以官方“全面超越”更适合理解为总体产品效率,而不是逐 benchmark 全胜。

官方 Agent 成绩很强,但 max effort 和 scaffold 是成绩的一部分

DeepSeek 的官方评测并不是 API 默认配置。模型卡明确说明 instruct 结果全部使用 reasoning_effort=100 的最高推理强度,并使用 temperature=1.0、top_p=0.95。代码 Agent 任务还绑定具体 scaffold:Terminal-Bench 2.1/3.0/4.0、DeepSWE、NL2Repo 与 ProgramBench 使用 DeepSeek Harness 或基准指定 harness;视觉 Agent 使用 Claude Code harness。官方表里的 DeepSWE v1.1 为 74.2%、Terminal-Bench 4.0 为 31.2%、AutomationBench 为 54.8%、Agents' Last Exam 为 31.8%。

同一模型换 scaffold,数字会明显变化。DeepSeek 自己给出的 DeepSWE v1.1 多 scaffold 表中,Claude Code 为 69.8%、Codex 为 65.6%、OpenCode 为 65.5%、mini-SWE 为 74.2%;Terminal-Bench 2.1 则从 Codex 的 84.1% 到 DeepSeek Harness Minimal 的 90.6%。因此 74.2% 不是脱离运行框架的“纯模型能力”,对 Agent 模型尤其需要把 model、effort 和 scaffold 一起看。

换成同价位 Flash 对手后,V4.1 Flash 更像 Agent 专长而不是全能第一

Artificial Analysis 的 V4.1 Flash max 与 GLM-5.3 Flash 对比中,DeepSeek 综合分 39,GLM 为 42;AutomationBench-AA 是 DeepSeek 69% 对 GLM 60%,但 Terminal-Bench 4.0 是 27% 对 33%,两者 SciCode 都是 52%。AA 记录的 DeepSeek 峰值时段输入/输出价为每百万 token $0.30/$1.20,GLM 为 $0.15/$0.50,其 7:2:1 混合单价分别约 $0.184/$0.098。DeepSeek 官方同时提供 50% 的空闲时段折扣,即 Flash 空闲时段约为 $0.15/$0.60,所以实际价格差距取决于调用时间,不能只拿 AA 的峰值价当作全天成本。

GPT-6 Luna max提供了另一个低成本参照:综合分 37 对 39,但 AA 混合单价约 $0.077 对 $0.184。DeepSeek 在 AutomationBench-AA(69% 对 53%)和 Terminal-Bench 4.0(27% 对 13%)领先明显;Luna 在 SciCode(55% 对 52%)和 GDP.pdf(20% 对 13%)更高。这说明 V4.1 Flash 的差异化更集中在 Agent 工作负载,而不是以最低 API 价格换取最高综合分。

速度优势很明确,但 max reasoning 会用掉大量输出 token

Artificial Analysis 的 V4.1 Flash max 页面记录输出速度约 233–237 token/s、首 token 延迟约 1 秒,在同类开放权重模型里属于非常快的一档。代价是输出很长:其 Intelligence Index 每任务平均约 89K 输出 token,其中约 63K 是 reasoning token;整套指数累计输出约 250M token。非推理版本的综合分从 39 降到 25,每任务成本从约 $0.27 降到 $0.15,同时整套评测的输出 token 约从 250M 降到 45M。max 的能力提升很大,但“Flash”并不意味着高推理强度下每个任务都很短。

官方 API 只暴露 low/high/max 三档思考强度,默认 high,也可以关闭思考;技术报告/模型卡内部把 reasoning effort 描述为 1–100 的连续控制量。页面不应把官方 benchmark 的 max 结果理解为默认 API 调用表现。

适用边界:Agent、高吞吐和自部署是优势,最低成本或综合分优先时有更具体的替代项

需要开放权重、原生图像输入、约 1M 上下文,同时做大量工具调用或编码 Agent 时,V4.1 Flash 的组合优势很清楚:MIT 权重可自部署,官方 API 并发上限 2500,独立测试又显示较高的 Agent 分数和约 236 token/s 的输出速度。若目标更偏综合推理且仍要求低价,GLM-5.3 Flash 在 AA 当前指数中以 42 对 39领先且 token 单价更低;若接受闭源并优先压 API 成本,GPT-6 Luna max 的综合分只低 2 分,AA 混合单价却不到 DeepSeek 峰值价的一半。

还有一项旧资料需要纠正:DeepSeek 9 月 10 日发布时曾计划从 9 月 14 日起把 deepseek-v4-pro 请求路由到 V4.1 Flash,但当前官方更新日志和英文价格页已改为“应用户需求继续提供 V4 Pro API,后续变化另行通知”。因此旧稿中的“9 月 14 日后 V4 Pro 全部路由至 Flash”已经过期,本次解读不再保留。

DeepSeek-V4.1-Flash

常见问题

DeepSeek V4.1 Flash 的核心架构是什么?

它是 552B 参数的原生多模态 MoE,采用 20 层 causal encoder + 20 层 decoder 的 CED 架构。预填充阶段约激活 8B 参数、解码阶段约 16B,并通过 CSA2 与 FP4 KV Cache 把全局 KV 缓存压到约 890 bytes/token。

DeepSeek V4.1 Flash 比 V4 Pro 强吗?

整体上更强也更快。Artificial Analysis 的 max 对比中,V4.1 Flash 综合分 39、V4 Pro 0813 为 36,输出速度约 236 对 89 token/s,每任务成本约 $0.27 对 $0.67;但 V4 Pro 在 HLE、CritPt 和 AA-Omniscience 等个别指标仍更高。

DeepSeek V4.1 Flash 的 API 价格是多少?

DeepSeek 官方实行峰谷定价。每百万 token 空闲时段缓存命中/普通输入/输出约为 $0.003/$0.15/$0.60,高峰约为 $0.006/$0.30/$1.20;人民币页面对应 ¥0.02/¥1/¥4 与 ¥0.04/¥2/¥8。

为什么官方 DeepSWE 74.2% 和其他测试数字可能不同?

官方 instruct 评测使用 max reasoning effort,而且 Agent benchmark 绑定具体 scaffold。DeepSeek 自己的多 scaffold 表中,DeepSWE v1.1 从 OpenCode 65.5%、Codex 65.6%、Claude Code 69.8% 到 mini-SWE 74.2%,因此不能脱离 scaffold 比较。

DeepSeek V4.1 Flash 的上下文和最大输出是多少?

DeepSeek 当前 /models API 返回 context_window=1,048,576、max_output_tokens=393,216;页面展示可简写为约 1M 上下文和 384K 最大输出。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码