DataLearner 标志

GPT-6 Luna 评测详情

GPT-6 Luna 当前已收录的代表性评测结果包括 CritPt(42 / 204,得分 19.43)、Agents' Last Exam(5 / 24,得分 50.90)、Vibe Code Bench v1.1(15 / 61,得分 81.65)。本页还提供与 3 个竞品模型及 2 个前代或同系列模型的对比,在有数据时会展示性能和价格视图。

评测结果

GPT-6 Luna

评测结果

思考模式
工具使用

抽象归纳与泛化

共 24 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
常规模式
8.83
186 / 193
37.67
156 / 193
61
124 / 193
70.33
114 / 193
ARC-AGI-1
最高
86.67
85 / 193
ARC-AGI-1
极高
73
109 / 193
ARC-AGI-2
常规模式
0
176 / 181
4.58
144 / 181
18.06
117 / 181
31.39
107 / 181
ARC-AGI-2
最高
59.31
79 / 181
ARC-AGI-2
极高
41.94
99 / 181
ARC-AGI-3
常规模式
0.05
26 / 26
ARC-AGI-3
常规模式
0.03
48 / 51
0.24
25 / 26
0.03
48 / 51
0.32
24 / 26
0.19
37 / 51
0.38
23 / 26
0.18
38 / 51
ARC-AGI-3
最高
0.59
21 / 26
ARC-AGI-3
最高
0.10
45 / 51
ARC-AGI-3
极高
0.51
22 / 26
ARC-AGI-3
极高
0.16
43 / 51

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
最高工具
73.03
38 / 57
Terminal-Bench 4.0
最高工具
12.63
51 / 98

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
最高工具
66.60
38 / 92

跨能力聚合指数

共 3 项评测
评测名称 / 模式
得分
排名/总数
Vals Index
最高工具
58.45
18 / 42
Vals Index v2.1
最高工具
51.22
24 / 36
37.26
25 / 29

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld 2.0
最高工具
52.70
12 / 14

跨应用与工具编排

共 1 项评测
评测名称 / 模式
得分
排名/总数
Agents' Last Exam
最高工具
50.90
5 / 24

程序生成与编辑

共 3 项评测
评测名称 / 模式
得分
排名/总数
81.65
15 / 61
42.40
11 / 11
Program Bench
最高工具
0.50
15 / 15

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
最高工具
20.70
24 / 25

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
CritPt
最高
19.43
42 / 204
MysteryMechanism
最高工具
19.37
12 / 13

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
最高
54.63
42 / 134

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
68.52
11 / 42
Tax Agent Bench
最高工具
58.86
17 / 20
Finance Agent v2
最高工具
49.87
30 / 43

法律

共 2 项评测
评测名称 / 模式
得分
排名/总数
30.29
31 / 42
2.92
28 / 43

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
最高
20.40
38 / 122

生物与基因

共 1 项评测
评测名称 / 模式
得分
排名/总数
BioMysteryBench
最高工具
61.48
4 / 4

医学知识与健康咨询

共 4 项评测
评测名称 / 模式
得分
排名/总数

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v3
极高工具
0.08
8 / 13

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
最高工具
42.55
19 / 43

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
最高工具
55.56
14 / 26

数学

共 1 项评测
评测名称 / 模式
得分
排名/总数
64
11 / 28

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
57.65
21 / 26
SAGE
最高工具
48.09
21 / 64

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
最高工具
83.71
29 / 66
MedCode
最高工具
44.69
30 / 64

竞品对比

GPT-6 Luna 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项GPT-6 Luna当前DeepSeek-V4.1-FlashGLM-5.3-FlashClaude Sonnet 5
ARC-AGI-1
Score (%)
抽象归纳与泛化
86.67思考水平·高
--
91.00思考水平·高
--
ARC-AGI-2
Score (% solved); cost per task (USD)
抽象归纳与泛化
59.31思考水平·高
--
65.83思考水平·高
--
Terminal-Bench 2.1
Accuracy
自主开发与终端任务
73.03思考水平·高 | 工具
90.60思考水平·高 | 工具
84.30思考水平·高 | 工具
80.40思考水平·极高 | 工具
Terminal-Bench 4.0
Resolution rate (%)
自主开发与终端任务
12.63思考水平·高 | 工具
26.80思考水平·高 | 工具
32.80开启思考 | 工具
12.42思考水平·高 | 工具
DeepSWE
Pass@1 (DeepSWE v1.1)
仓库修复与多文件工程
66.60思考水平·高 | 工具
74.20思考水平·高 | 工具
63.39思考水平·高 | 工具
54.00深度思考模式 | 工具
Vals Index
跨行业任务准确率综合指数
跨能力聚合指数
58.45常规模式 | 工具
57.86思考水平·高 | 工具
47.22思考水平·高 | 工具
59.61思考水平·高 | 工具
Vals Index v2.1
GDP-weighted accuracy (%)
跨能力聚合指数
51.22常规模式 | 工具
51.32思考水平·高 | 工具
--
51.77常规模式 | 工具
Agents' Last Exam
Score
跨应用与工具编排
50.90思考水平·高 | 工具
31.80思考水平·高 | 工具
26.30思考水平·高 | 工具
--
Program Bench
Score
程序生成与编辑
0.50思考水平·高 | 工具
20.30思考水平·高 | 工具
--
--
Vibe Code Bench v1.1
Pass rate (%)
程序生成与编辑
81.65思考水平·高 | 工具
84.74思考水平·高 | 工具
30.76思考水平·高 | 工具
81.33思考水平·高 | 工具
AutomationBench
Pass Rate
办公与文档流程
20.70思考水平·高 | 工具
54.80思考水平·高 | 工具
48.80思考水平·高 | 工具
--
CritPt
Score
科学知识与推理
19.43思考水平·高
14.30思考水平·高
15.40开启思考
16.90思考水平·高
其余 16 个 benchmark 仍可在上方图表中查看。

GPT-6 Luna 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

若存在上下文阈值,图中标准价仅适用于以下范围:

GPT-6 Luna: 标准价适用于 <= 272000
模型供应商标准输入标准输出标准价适用于
GPT-6 Luna
OpenAI$0.1 / 1M tokens$0.5 / 1M tokens<= 272000
GLM-5.3-Flash
智谱AI$0.15 / 1M tokens$0.5 / 1M tokens—
Claude Sonnet 5
Anthropic$2 / 1M tokens$10 / 1M tokens—

历代版本对比

GPT-6 Luna 系列各版本的评测成绩纵向对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项GPT-6 Luna当前GPT-5.6 LunaGPT-5.4 mini
ARC-AGI-1
Score (%)
抽象归纳与泛化
86.67思考水平·高
88.00思考水平·高
63.67思考水平·极高 | 工具
ARC-AGI-2
Score (% solved); cost per task (USD)
抽象归纳与泛化
59.31思考水平·高
59.54思考水平·高
18.90思考水平·极高 | 工具
ARC-AGI-3 (Standard)
Action efficiency score(按相同评测环境比较,越高越好)
抽象归纳与泛化
0.19思考水平·中
0.18思考水平·高
--
Terminal-Bench 2.1
Accuracy
自主开发与终端任务
73.03思考水平·高 | 工具
84.70思考水平·高
--
Terminal-Bench 4.0
Resolution rate (%)
自主开发与终端任务
12.63思考水平·高 | 工具
17.27思考水平·高 | 工具
2.00思考水平·极高 | 工具
DeepSWE
Pass@1 (DeepSWE v1.1)
仓库修复与多文件工程
66.60思考水平·高 | 工具
67.20思考水平·极高 | 工具
--
Vals Index
跨行业任务准确率综合指数
跨能力聚合指数
58.45常规模式 | 工具
59.88思考水平·高 | 工具
39.63思考水平·极高 | 工具
Vals Index v2.1
GDP-weighted accuracy (%)
跨能力聚合指数
51.22常规模式 | 工具
51.69常规模式 | 工具
33.17思考水平·极高 | 工具
Agents' Last Exam
Score
跨应用与工具编排
50.90思考水平·高 | 工具
50.30思考水平·极高 | 工具
--
Vibe Code Bench v1.1
Pass rate (%)
程序生成与编辑
81.65思考水平·高 | 工具
77.06思考水平·高 | 工具
47.97思考水平·极高 | 工具
CritPt
Score
科学知识与推理
19.43思考水平·高
20.60思考水平·极高
10.00思考水平·极高
MysteryMechanism
Accuracy (%)
科学知识与推理
19.37思考水平·高 | 工具
14.41思考水平·高 | 工具
--
其余 15 个 benchmark 仍可在上方图表中查看。

单评测历史趋势图

当前查看:ARC-AGI-1 · 抽象归纳与泛化

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

GPT-6 Luna 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

若存在上下文阈值,图中标准价仅适用于以下范围:

GPT-6 Luna: 标准价适用于 <= 272000
模型供应商标准输入标准输出标准价适用于
GPT-6 Luna
OpenAI$0.1 / 1M tokens$0.5 / 1M tokens<= 272000
GPT-5.6 Luna
OpenAI$0.2 / 1M tokens$1.2 / 1M tokens—
GPT-5.4 mini
OpenAI$0.75 / 1M tokens$4.5 / 1M tokens—