DeepSeek V4.1 Flash 的核心架构是什么?
它是 552B 参数的原生多模态 MoE,采用 20 层 causal encoder + 20 层 decoder 的 CED 架构。预填充阶段约激活 8B 参数、解码阶段约 16B,并通过 CSA2 与 FP4 KV Cache 把全局 KV 缓存压到约 890 bytes/token。
DeepSeek V4.1 Flash
别名:deepseek-flash / deepseek-v4-flash / deepseek-v4-flash-vision-exp
552B 原生多模态开放权重 MoE,预填充/解码仅激活约 8B/16B 参数;Artificial Analysis 的 max 实测综合分 39、每任务约 $0.27,优势集中在 Agent 能力和高吞吐。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | ¥1.00/ 1M tokens | ¥4.00/ 1M tokens |
| 文本 | - | $0.150/ 1M tokens | $0.600/ 1M tokens |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | ¥2.00/ 1M tokens | ¥8.00/ 1M tokens |
| 文本 | - | $0.300/ 1M tokens | $1.20/ 1M tokens |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | - | — | ¥0.020/ 1M tokens |
| 文本 | - | — | $0.0030/ 1M tokens |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
DeepSeek-V4.1-Flash 当前已收录的代表性评测结果包括 HLE(5 / 235,得分 63.90)、DeepSWE(3 / 92,得分 74.20)、Terminal-Bench 2.1(2 / 57,得分 90.60)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
DeepSeek V4.1 Flash 是 DeepSeek 于 2026 年 9 月 10 日发布的原生多模态开放权重 MoE。它有 552B 骨干参数,但 Causal Encoder-Decoder(CED)结构把预填充阶段的激活参数压到约 8B、解码阶段约 16B,并把全局 KV Cache 压到每 token 约 890 bytes。DeepSeek 对这款模型的核心宣传不是“小模型追旗舰”,而是用更少的激活计算和缓存把 Agent 性能、吞吐与成本一起改善。独立测试基本验证了它相对 V4 Pro 的代际优势,但把比较对象换成 GLM-5.3 Flash、GPT-6 Luna 这类低价模型后,结论会变成:V4.1 Flash 的强项是 Agent 与速度,并不是所有任务上的最高综合分或最低价格。
DeepSeek 官方模型卡给出的结构是 552B 参数、40 层 Transformer,其中 20 层 causal encoder 加 20 层 decoder;预填充每 token 激活约 8B,解码约 16B。CSA2、分层稀疏索引和 FP4 KV Cache 把全局 KV Cache 压到约 890 bytes/token,约为上一代 V4 Flash 的四分之一;模型从头用 45T token 多模态语料训练,并把上下文扩展到 1M。
Artificial Analysis 在 2026 年 9 月 27 日读取到的独立对比中,V4.1 Flash max 的 Intelligence Index 为 39,V4 Pro 0813 max 为 36;每任务成本约 $0.27 对 $0.67,输出速度约 236 对 89 token/s,首 token 延迟约 0.95 对 1.69 秒。这组数据支持“更快、更便宜、综合能力更高”的总体方向,但不是每项指标都赢:V4 Pro 在 Humanity's Last Exam 为 41% 对 39%,CritPt 为 18% 对 14%,AA-Omniscience 为 1 对 -5。所以官方“全面超越”更适合理解为总体产品效率,而不是逐 benchmark 全胜。
DeepSeek 的官方评测并不是 API 默认配置。模型卡明确说明 instruct 结果全部使用 reasoning_effort=100 的最高推理强度,并使用 temperature=1.0、top_p=0.95。代码 Agent 任务还绑定具体 scaffold:Terminal-Bench 2.1/3.0/4.0、DeepSWE、NL2Repo 与 ProgramBench 使用 DeepSeek Harness 或基准指定 harness;视觉 Agent 使用 Claude Code harness。官方表里的 DeepSWE v1.1 为 74.2%、Terminal-Bench 4.0 为 31.2%、AutomationBench 为 54.8%、Agents' Last Exam 为 31.8%。
同一模型换 scaffold,数字会明显变化。DeepSeek 自己给出的 DeepSWE v1.1 多 scaffold 表中,Claude Code 为 69.8%、Codex 为 65.6%、OpenCode 为 65.5%、mini-SWE 为 74.2%;Terminal-Bench 2.1 则从 Codex 的 84.1% 到 DeepSeek Harness Minimal 的 90.6%。因此 74.2% 不是脱离运行框架的“纯模型能力”,对 Agent 模型尤其需要把 model、effort 和 scaffold 一起看。
Artificial Analysis 的 V4.1 Flash max 与 GLM-5.3 Flash 对比中,DeepSeek 综合分 39,GLM 为 42;AutomationBench-AA 是 DeepSeek 69% 对 GLM 60%,但 Terminal-Bench 4.0 是 27% 对 33%,两者 SciCode 都是 52%。AA 记录的 DeepSeek 峰值时段输入/输出价为每百万 token $0.30/$1.20,GLM 为 $0.15/$0.50,其 7:2:1 混合单价分别约 $0.184/$0.098。DeepSeek 官方同时提供 50% 的空闲时段折扣,即 Flash 空闲时段约为 $0.15/$0.60,所以实际价格差距取决于调用时间,不能只拿 AA 的峰值价当作全天成本。
GPT-6 Luna max提供了另一个低成本参照:综合分 37 对 39,但 AA 混合单价约 $0.077 对 $0.184。DeepSeek 在 AutomationBench-AA(69% 对 53%)和 Terminal-Bench 4.0(27% 对 13%)领先明显;Luna 在 SciCode(55% 对 52%)和 GDP.pdf(20% 对 13%)更高。这说明 V4.1 Flash 的差异化更集中在 Agent 工作负载,而不是以最低 API 价格换取最高综合分。
Artificial Analysis 的 V4.1 Flash max 页面记录输出速度约 233–237 token/s、首 token 延迟约 1 秒,在同类开放权重模型里属于非常快的一档。代价是输出很长:其 Intelligence Index 每任务平均约 89K 输出 token,其中约 63K 是 reasoning token;整套指数累计输出约 250M token。非推理版本的综合分从 39 降到 25,每任务成本从约 $0.27 降到 $0.15,同时整套评测的输出 token 约从 250M 降到 45M。max 的能力提升很大,但“Flash”并不意味着高推理强度下每个任务都很短。
官方 API 只暴露 low/high/max 三档思考强度,默认 high,也可以关闭思考;技术报告/模型卡内部把 reasoning effort 描述为 1–100 的连续控制量。页面不应把官方 benchmark 的 max 结果理解为默认 API 调用表现。
需要开放权重、原生图像输入、约 1M 上下文,同时做大量工具调用或编码 Agent 时,V4.1 Flash 的组合优势很清楚:MIT 权重可自部署,官方 API 并发上限 2500,独立测试又显示较高的 Agent 分数和约 236 token/s 的输出速度。若目标更偏综合推理且仍要求低价,GLM-5.3 Flash 在 AA 当前指数中以 42 对 39领先且 token 单价更低;若接受闭源并优先压 API 成本,GPT-6 Luna max 的综合分只低 2 分,AA 混合单价却不到 DeepSeek 峰值价的一半。
还有一项旧资料需要纠正:DeepSeek 9 月 10 日发布时曾计划从 9 月 14 日起把 deepseek-v4-pro 请求路由到 V4.1 Flash,但当前官方更新日志和英文价格页已改为“应用户需求继续提供 V4 Pro API,后续变化另行通知”。因此旧稿中的“9 月 14 日后 V4 Pro 全部路由至 Flash”已经过期,本次解读不再保留。
它是 552B 参数的原生多模态 MoE,采用 20 层 causal encoder + 20 层 decoder 的 CED 架构。预填充阶段约激活 8B 参数、解码阶段约 16B,并通过 CSA2 与 FP4 KV Cache 把全局 KV 缓存压到约 890 bytes/token。
整体上更强也更快。Artificial Analysis 的 max 对比中,V4.1 Flash 综合分 39、V4 Pro 0813 为 36,输出速度约 236 对 89 token/s,每任务成本约 $0.27 对 $0.67;但 V4 Pro 在 HLE、CritPt 和 AA-Omniscience 等个别指标仍更高。
DeepSeek 官方实行峰谷定价。每百万 token 空闲时段缓存命中/普通输入/输出约为 $0.003/$0.15/$0.60,高峰约为 $0.006/$0.30/$1.20;人民币页面对应 ¥0.02/¥1/¥4 与 ¥0.04/¥2/¥8。
官方 instruct 评测使用 max reasoning effort,而且 Agent benchmark 绑定具体 scaffold。DeepSeek 自己的多 scaffold 表中,DeepSWE v1.1 从 OpenCode 65.5%、Codex 65.6%、Claude Code 69.8% 到 mini-SWE 74.2%,因此不能脱离 scaffold 比较。
DeepSeek 当前 /models API 返回 context_window=1,048,576、max_output_tokens=393,216;页面展示可简写为约 1M 上下文和 384K 最大输出。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
