DataLearner 标志

DeepSeek-V4.1-FlashvsKimi K3

在 19 个共同 benchmark 中,DeepSeek-V4.1-Flash 整体领先:DeepSeek-V4.1-Flash 领先 13 项,Kimi K3 领先 5 项,持平 1 项,平均分差 -25.42。

DeepSeek-AI
DeepSeek-V4.1-Flash

DeepSeek-AI · 2026-09-10 · 多模态大模型

Moonshot AI
Kimi K3

Moonshot AI · 2026-07-16 · 推理大模型

DeepSeek-V4.1-Flash13 项(68%)持平1(26%)5 项Kimi K3

评测分数

按能力类目分组,每组内按分差大小排列;共 19 项。

仓库修复与多文件工程

DeepSeek-V4.1-Flash 领先 2/2
评测项DeepSeek-V4.1-FlashKimi K3分差
NL2Repo-Bench65.402 / 16Max (With Tools)586 / 16Max (With Tools)+7.40
DeepSWE74.203 / 92Max (With Tools)68.5128 / 92Max (With Tools)+5.69

图像感知与视觉推理

DeepSeek-V4.1-Flash 领先 2/2
评测项DeepSeek-V4.1-FlashKimi K3分差
ZeroBench Main493 / 6Max (With Tools)414 / 6Max (With Tools)+8
BabyVision89.603 / 9Max (With Tools)85.705 / 9Max (With Tools)+3.90

文档与图表理解

胶着 2/2
评测项DeepSeek-V4.1-FlashKimi K3分差
Chartography78.905 / 11Max (With Tools)68.108 / 11Max (With Tools)+10.80
GDP.pdf12.8070 / 122Max (No Tools)2230 / 122Max (No Tools)-9.20

科学计算与科研编程

胶着 2/2
评测项DeepSeek-V4.1-FlashKimi K3分差
Terminal-Bench-Science 0.115.708 / 18Max (With Tools)7.1014 / 18Max (With Tools)+8.60
SciCode51.9061 / 134Max (No Tools)59.508 / 134Max (No Tools)-7.60

写作与创意表达

Kimi K3 领先 1/1
评测项DeepSeek-V4.1-FlashKimi K3分差
Creative Writing1,54051 / 110Normal (No Tools)2,0825 / 110Normal (No Tools)-542.20

办公与文档流程

DeepSeek-V4.1-Flash 领先 1/1
评测项DeepSeek-V4.1-FlashKimi K3分差
AutomationBench54.801 / 25Max (With Tools)46.7010 / 25Max (With Tools)+8.10

数学

胶着 1/1
评测项DeepSeek-V4.1-FlashKimi K3分差
MathArena Apex65.604 / 17Max (No Tools)65.604 / 17Max (No Tools)持平

机器学习工程

Kimi K3 领先 1/1
评测项DeepSeek-V4.1-FlashKimi K3分差
WeirdML v30.0612 / 13Thinking High (With Tools)0.0710 / 13Thinking High (With Tools)-0.01

漏洞发现与分析

DeepSeek-V4.1-Flash 领先 1/1
评测项DeepSeek-V4.1-FlashKimi K3分差
CyberGym88.103 / 11Max (With Tools)808 / 11Max (With Tools)+8.10

科学知识与推理

Kimi K3 领先 1/1
评测项DeepSeek-V4.1-FlashKimi K3分差
CritPt14.3061 / 204Max (No Tools)23.4030 / 204Max (No Tools)-9.10

程序生成与编辑

DeepSeek-V4.1-Flash 领先 1/1
评测项DeepSeek-V4.1-FlashKimi K3分差
Program Bench20.309 / 15Max (With Tools)17.5012 / 15Max (With Tools)+2.80

综合知识考试

DeepSeek-V4.1-Flash 领先 1/1
评测项DeepSeek-V4.1-FlashKimi K3分差
HLE63.905 / 235Max (With Tools)59.8010 / 235Max (With Tools)+4.10

自主开发与终端任务

DeepSeek-V4.1-Flash 领先 1/1
评测项DeepSeek-V4.1-FlashKimi K3分差
Terminal-Bench 3.0304 / 11Max (With Tools)17.708 / 11Max (With Tools)+12.30

跨应用与工具编排

DeepSeek-V4.1-Flash 领先 1/1
评测项DeepSeek-V4.1-FlashKimi K3分差
Agents' Last Exam31.808 / 24Max (With Tools)27.6013 / 24Max (With Tools)+4.20

跨能力综合测试

DeepSeek-V4.1-Flash 领先 1/1
评测项DeepSeek-V4.1-FlashKimi K3分差
SuperCLUE71.812 / 13Reported best (effort unspecified)70.685 / 13Reported best (effort unspecified)+1.13

规格对比

字段DeepSeek-V4.1-FlashKimi K3
发布机构DeepSeek-AIMoonshot AI
发布时间2026-09-102026-07-16
模型类型多模态大模型推理大模型
架构MoE 架构MoE 架构
参数规模5520亿2.8万亿
上下文长度1M1M
最大输出384K1M

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项DeepSeek-V4.1-FlashKimi K3
文本输入¥1 / 1M tokens¥20 / 1M tokens
文本输出¥4 / 1M tokens¥100 / 1M tokens
缓存读取¥0.02 / 1M tokens¥2 / 1M tokens

小结

  • DeepSeek-V4.1-Flash在以下类目领先:仓库修复与多文件工程 (2/2)、图像感知与视觉推理 (2/2)、办公与文档流程 (1/1)、漏洞发现与分析 (1/1)、程序生成与编辑 (1/1)、综合知识考试 (1/1)、自主开发与终端任务 (1/1)、跨应用与工具编排 (1/1)、跨能力综合测试 (1/1)
  • Kimi K3在以下类目领先:写作与创意表达 (1/1)、机器学习工程 (1/1)、科学知识与推理 (1/1)
  • 胶着类目:文档与图表理解、科学计算与科研编程、数学

19 个共同 benchmark 上,Kimi K3 平均高出 25.42 分。

单项差距最大的 benchmark:Creative Writing — DeepSeek-V4.1-Flash 1,540,Kimi K3 2,082(分差 -542.20)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。