DeepSeek-V4.1-FlashvsClaude Opus 5
在 17 个共同 benchmark 中,Claude Opus 5 整体领先:DeepSeek-V4.1-Flash 领先 4 项,Claude Opus 5 领先 13 项,持平 0 项,平均分差 -40.79。
DeepSeek-V4.1-Flash
DeepSeek-AI · 2026-09-10 · 多模态大模型
Claude Opus 5
Anthropic · 2026-07-24 · 推理大模型
DeepSeek-V4.1-Flash4 项(24%)(76%)13 项Claude Opus 5
评测分数
按能力类目分组,每组内按分差大小排列;共 17 项。
图像感知与视觉推理
Claude Opus 5 领先 3/3| 评测项 | DeepSeek-V4.1-Flash | Claude Opus 5 | 分差 |
|---|---|---|---|
| MMMU-Pro | 7770 / 229Max (No Tools) | 84.708 / 229Max (No Tools) | -7.70 |
| BabyVision | 89.603 / 9Max (With Tools) | 94.101 / 9Max (With Tools) | -4.50 |
| ZeroBench Main | 493 / 6Max (With Tools) | 522 / 6Max (With Tools) | -3 |
仓库修复与多文件工程
胶着 2/2| 评测项 | DeepSeek-V4.1-Flash | Claude Opus 5 | 分差 |
|---|---|---|---|
| NL2Repo-Bench | 65.402 / 16Max (With Tools) | 75.301 / 16Max (With Tools) | -9.90 |
| DeepSWE | 74.203 / 92Max (With Tools) | 73.658 / 92Max (With Tools) | +0.55 |
文档与图表理解
Claude Opus 5 领先 2/2| 评测项 | DeepSeek-V4.1-Flash | Claude Opus 5 | 分差 |
|---|---|---|---|
| GDP.pdf | 12.8070 / 122Max (No Tools) | 21.6031 / 122Max (No Tools) | -8.80 |
| Chartography | 78.905 / 11Max (With Tools) | 843 / 11Max (With Tools) | -5.10 |
科学计算与科研编程
Claude Opus 5 领先 2/2| 评测项 | DeepSeek-V4.1-Flash | Claude Opus 5 | 分差 |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | 15.708 / 18Max (With Tools) | 305 / 18Max (With Tools) | -14.30 |
| SciCode | 51.9061 / 134Max (No Tools) | 56.4027 / 134Max (No Tools) | -4.50 |
写作与创意表达
Claude Opus 5 领先 1/1| 评测项 | DeepSeek-V4.1-Flash | Claude Opus 5 | 分差 |
|---|---|---|---|
| Creative Writing | 1,54051 / 110Normal (No Tools) | 2,1333 / 110Normal (No Tools) | -592.50 |
办公与文档流程
DeepSeek-V4.1-Flash 领先 1/1| 评测项 | DeepSeek-V4.1-Flash | Claude Opus 5 | 分差 |
|---|---|---|---|
| AutomationBench | 54.801 / 25Max (With Tools) | 50.306 / 25Max (With Tools) | +4.50 |
漏洞利用
Claude Opus 5 领先 1/1| 评测项 | DeepSeek-V4.1-Flash | Claude Opus 5 | 分差 |
|---|---|---|---|
| ExploitGym (budget unspecified) | 15.303 / 6Max (With Tools) | 22.102 / 6Max (With Tools) | -6.80 |
科学知识与推理
Claude Opus 5 领先 1/1| 评测项 | DeepSeek-V4.1-Flash | Claude Opus 5 | 分差 |
|---|---|---|---|
| CritPt | 14.3061 / 204Max (No Tools) | 29.1012 / 204Max (No Tools) | -14.80 |
程序生成与编辑
Claude Opus 5 领先 1/1| 评测项 | DeepSeek-V4.1-Flash | Claude Opus 5 | 分差 |
|---|---|---|---|
| Program Bench | 20.309 / 15Max (With Tools) | 376 / 15Max (With Tools) | -16.70 |
综合知识考试
DeepSeek-V4.1-Flash 领先 1/1| 评测项 | DeepSeek-V4.1-Flash | Claude Opus 5 | 分差 |
|---|---|---|---|
| HLE | 63.905 / 235Max (With Tools) | 63.606 / 235Max (With Tools) | +0.30 |
自主开发与终端任务
Claude Opus 5 领先 1/1| 评测项 | DeepSeek-V4.1-Flash | Claude Opus 5 | 分差 |
|---|---|---|---|
| Terminal-Bench 3.0 | 304 / 11Max (With Tools) | 43.301 / 11Max (With Tools) | -13.30 |
跨应用与工具编排
DeepSeek-V4.1-Flash 领先 1/1| 评测项 | DeepSeek-V4.1-Flash | Claude Opus 5 | 分差 |
|---|---|---|---|
| Agents' Last Exam | 31.808 / 24Max (With Tools) | 28.6011 / 24Max (With Tools) | +3.20 |
规格对比
| 字段 | DeepSeek-V4.1-Flash | Claude Opus 5 |
|---|---|---|
| 发布机构 | DeepSeek-AI | Anthropic |
| 发布时间 | 2026-09-10 | 2026-07-24 |
| 模型类型 | 多模态大模型 | 推理大模型 |
| 架构 | MoE 架构 | 稠密模型 |
| 参数规模 | 5520亿 | 暂无数据 |
| 上下文长度 | 1M | 1M |
| 最大输出 | 384K | 128K |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | DeepSeek-V4.1-Flash | Claude Opus 5 |
|---|---|---|
| 文本输入 | ¥1 / 1M tokens | $5 / 1M tokens |
| 文本输出 | ¥4 / 1M tokens | $25 / 1M tokens |
| 缓存读取 | ¥0.02 / 1M tokens | $0.5 / 1M tokens |
| 缓存写入 | 暂无公开价格 | $6.25 / 1M tokens |
小结
- DeepSeek-V4.1-Flash在以下类目领先:办公与文档流程 (1/1)、综合知识考试 (1/1)、跨应用与工具编排 (1/1)
- Claude Opus 5在以下类目领先:图像感知与视觉推理 (3/3)、文档与图表理解 (2/2)、科学计算与科研编程 (2/2)、写作与创意表达 (1/1)、漏洞利用 (1/1)、科学知识与推理 (1/1)、程序生成与编辑 (1/1)、自主开发与终端任务 (1/1)
- 胶着类目:仓库修复与多文件工程
17 个共同 benchmark 上,Claude Opus 5 平均高出 40.79 分。
单项差距最大的 benchmark:Creative Writing — DeepSeek-V4.1-Flash 1,540,Claude Opus 5 2,133(分差 -592.50)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。