DataLearner 标志

GPT-6 LunavsDeepSeek-V4.1-Flash

在 9 个共同 benchmark 中,DeepSeek-V4.1-Flash 整体领先:GPT-6 Luna 领先 4 项,DeepSeek-V4.1-Flash 领先 5 项,持平 0 项,平均分差 -6.52。

OpenAI
GPT-6 Luna

OpenAI · 2026-09-22 · 推理大模型

DeepSeek-AI
DeepSeek-V4.1-Flash

DeepSeek-AI · 2026-09-10 · 多模态大模型

GPT-6 Luna4 项(44%)(56%)5 项DeepSeek-V4.1-Flash

评测分数

按能力类目分组,每组内按分差大小排列;共 9 项。

自主开发与终端任务

DeepSeek-V4.1-Flash 领先 2/2
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
Terminal-Bench 2.173.0338 / 57Max (With Tools)90.602 / 57Max (With Tools)-17.57
Terminal-Bench 4.012.6351 / 98Max (With Tools)26.8032 / 98Max (With Tools)-14.17

仓库修复与多文件工程

DeepSeek-V4.1-Flash 领先 1/1
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
DeepSWE66.6038 / 92Max (With Tools)74.203 / 92Max (With Tools)-7.60

办公与文档流程

DeepSeek-V4.1-Flash 领先 1/1
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
AutomationBench20.7024 / 25Max (With Tools)54.801 / 25Max (With Tools)-34.10

文档与图表理解

GPT-6 Luna 领先 1/1
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
GDP.pdf20.4038 / 122Max (No Tools)12.8070 / 122Max (No Tools)+7.60

科学知识与推理

GPT-6 Luna 领先 1/1
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
CritPt19.4342 / 204Max (No Tools)14.3061 / 204Max (No Tools)+5.13

科学计算与科研编程

GPT-6 Luna 领先 1/1
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
SciCode54.6342 / 134Max (No Tools)51.9061 / 134Max (No Tools)+2.73

程序生成与编辑

DeepSeek-V4.1-Flash 领先 1/1
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
Program Bench0.5015 / 15Max (With Tools)20.309 / 15Max (With Tools)-19.80

跨应用与工具编排

GPT-6 Luna 领先 1/1
评测项GPT-6 LunaDeepSeek-V4.1-Flash分差
Agents' Last Exam50.905 / 24Max (With Tools)31.808 / 24Max (With Tools)+19.10

规格对比

字段GPT-6 LunaDeepSeek-V4.1-Flash
发布机构OpenAIDeepSeek-AI
发布时间2026-09-222026-09-10
模型类型推理大模型多模态大模型
架构稠密模型MoE 架构
参数规模暂无数据5520亿
上下文长度1.05M1M
最大输出128K384K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GPT-6 LunaDeepSeek-V4.1-Flash
文本输入$0.1 / 1M tokens¥1 / 1M tokens
文本输出$0.5 / 1M tokens¥4 / 1M tokens
缓存读取$0.01 / 1M tokens¥0.02 / 1M tokens
缓存写入$0.125 / 1M tokens暂无公开价格

小结

  • GPT-6 Luna在以下类目领先:文档与图表理解 (1/1)、科学知识与推理 (1/1)、科学计算与科研编程 (1/1)、跨应用与工具编排 (1/1)
  • DeepSeek-V4.1-Flash在以下类目领先:自主开发与终端任务 (2/2)、仓库修复与多文件工程 (1/1)、办公与文档流程 (1/1)、程序生成与编辑 (1/1)

9 个共同 benchmark 上,DeepSeek-V4.1-Flash 平均高出 6.52 分。

单项差距最大的 benchmark:AutomationBench — GPT-6 Luna 20.70,DeepSeek-V4.1-Flash 54.80(分差 -34.10)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。