DataLearner 标志

DeepSeek-V4.1-FlashvsClaude Opus 5

在 17 个共同 benchmark 中,Claude Opus 5 整体领先:DeepSeek-V4.1-Flash 领先 4 项,Claude Opus 5 领先 13 项,持平 0 项,平均分差 -40.79。

DeepSeek-AI
DeepSeek-V4.1-Flash

DeepSeek-AI · 2026-09-10 · 多模态大模型

Anthropic
Claude Opus 5

Anthropic · 2026-07-24 · 推理大模型

DeepSeek-V4.1-Flash4 项(24%)(76%)13 项Claude Opus 5

评测分数

按能力类目分组,每组内按分差大小排列;共 17 项。

图像感知与视觉推理

Claude Opus 5 领先 3/3
评测项DeepSeek-V4.1-FlashClaude Opus 5分差
MMMU-Pro7770 / 229Max (No Tools)84.708 / 229Max (No Tools)-7.70
BabyVision89.603 / 9Max (With Tools)94.101 / 9Max (With Tools)-4.50
ZeroBench Main493 / 6Max (With Tools)522 / 6Max (With Tools)-3

仓库修复与多文件工程

胶着 2/2
评测项DeepSeek-V4.1-FlashClaude Opus 5分差
NL2Repo-Bench65.402 / 16Max (With Tools)75.301 / 16Max (With Tools)-9.90
DeepSWE74.203 / 92Max (With Tools)73.658 / 92Max (With Tools)+0.55

文档与图表理解

Claude Opus 5 领先 2/2
评测项DeepSeek-V4.1-FlashClaude Opus 5分差
GDP.pdf12.8070 / 122Max (No Tools)21.6031 / 122Max (No Tools)-8.80
Chartography78.905 / 11Max (With Tools)843 / 11Max (With Tools)-5.10

科学计算与科研编程

Claude Opus 5 领先 2/2
评测项DeepSeek-V4.1-FlashClaude Opus 5分差
Terminal-Bench-Science 0.115.708 / 18Max (With Tools)305 / 18Max (With Tools)-14.30
SciCode51.9061 / 134Max (No Tools)56.4027 / 134Max (No Tools)-4.50

写作与创意表达

Claude Opus 5 领先 1/1
评测项DeepSeek-V4.1-FlashClaude Opus 5分差
Creative Writing1,54051 / 110Normal (No Tools)2,1333 / 110Normal (No Tools)-592.50

办公与文档流程

DeepSeek-V4.1-Flash 领先 1/1
评测项DeepSeek-V4.1-FlashClaude Opus 5分差
AutomationBench54.801 / 25Max (With Tools)50.306 / 25Max (With Tools)+4.50

漏洞利用

Claude Opus 5 领先 1/1
评测项DeepSeek-V4.1-FlashClaude Opus 5分差
ExploitGym (budget unspecified)15.303 / 6Max (With Tools)22.102 / 6Max (With Tools)-6.80

科学知识与推理

Claude Opus 5 领先 1/1
评测项DeepSeek-V4.1-FlashClaude Opus 5分差
CritPt14.3061 / 204Max (No Tools)29.1012 / 204Max (No Tools)-14.80

程序生成与编辑

Claude Opus 5 领先 1/1
评测项DeepSeek-V4.1-FlashClaude Opus 5分差
Program Bench20.309 / 15Max (With Tools)376 / 15Max (With Tools)-16.70

综合知识考试

DeepSeek-V4.1-Flash 领先 1/1
评测项DeepSeek-V4.1-FlashClaude Opus 5分差
HLE63.905 / 235Max (With Tools)63.606 / 235Max (With Tools)+0.30

自主开发与终端任务

Claude Opus 5 领先 1/1
评测项DeepSeek-V4.1-FlashClaude Opus 5分差
Terminal-Bench 3.0304 / 11Max (With Tools)43.301 / 11Max (With Tools)-13.30

跨应用与工具编排

DeepSeek-V4.1-Flash 领先 1/1
评测项DeepSeek-V4.1-FlashClaude Opus 5分差
Agents' Last Exam31.808 / 24Max (With Tools)28.6011 / 24Max (With Tools)+3.20

规格对比

字段DeepSeek-V4.1-FlashClaude Opus 5
发布机构DeepSeek-AIAnthropic
发布时间2026-09-102026-07-24
模型类型多模态大模型推理大模型
架构MoE 架构稠密模型
参数规模5520亿暂无数据
上下文长度1M1M
最大输出384K128K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项DeepSeek-V4.1-FlashClaude Opus 5
文本输入¥1 / 1M tokens$5 / 1M tokens
文本输出¥4 / 1M tokens$25 / 1M tokens
缓存读取¥0.02 / 1M tokens$0.5 / 1M tokens
缓存写入暂无公开价格$6.25 / 1M tokens

小结

  • DeepSeek-V4.1-Flash在以下类目领先:办公与文档流程 (1/1)、综合知识考试 (1/1)、跨应用与工具编排 (1/1)
  • Claude Opus 5在以下类目领先:图像感知与视觉推理 (3/3)、文档与图表理解 (2/2)、科学计算与科研编程 (2/2)、写作与创意表达 (1/1)、漏洞利用 (1/1)、科学知识与推理 (1/1)、程序生成与编辑 (1/1)、自主开发与终端任务 (1/1)
  • 胶着类目:仓库修复与多文件工程

17 个共同 benchmark 上,Claude Opus 5 平均高出 40.79 分。

单项差距最大的 benchmark:Creative Writing — DeepSeek-V4.1-Flash 1,540,Claude Opus 5 2,133(分差 -592.50)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。