DataLearner 标志
GP

GPT-5.6 Luna

推理大模型工具使用LunaGPT-5.6

GPT-5.6 Luna

发布时间: 2026-06-26更新于: 2026-08-23知识截止: 2026-02-16浏览量: 1,031
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1.05M
多语言支持
支持
推理能力
3/5

GPT-5.6 Luna 是 OpenAI 于 2026 年 6 月 26 日限定预览、7 月 9 日正式全面开放的 GPT-5.6 系列低成本模型,面向摘要、起草、分类和常规自动化等高吞吐日常任务。2026 年 7 月 30 日 OpenAI 将其价格一次性下调 80%,当前为每百万 tokens 输入 0.20 美元、输出 1.20 美元,比旗舰 Sol 便宜约 25 倍。反直觉的是它的智能体成绩并不低:Agents’ Last Exam 50.3 分,与 Terra 的 50.4 和 Sol 的 53.6 仅差 3.3 分;其余为 AA Intelligence Index 51、Terminal-Bench 2.1 84.70、DeepSWE 67.20、AA Coding Agent Index 74.6,每任务成本约 0.21 美元。但它有一个必须避开的硬伤:MRCR 长上下文召回仅 41.3%,而 Sol 为 91.5%、Terra 为 89.6%,因此尽管名义上下文同为 1.05M tokens,也不应用于大文档分析或长代码库推理,只适合较短、范围明确的任务。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GPT-5.6 Luna

模型基本信息

推理过程
支持
思考模式
思考水平 · 中 (Medium) (默认)常规模式思考水平 · 低 (Low)思考水平 · 高 (High)
上下文长度
1.05M tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-06-26
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2026-02-16
GPT-5.6 Luna

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
暂无
GPT-5.6 Luna

官方介绍与博客

DataLearnerAI博客
暂无
GPT-5.6 Luna

API接口信息

接口速度
5/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.200/ 1M tokens$1.20/ 1M tokens
long-context
类型适用条件输入输出
文本-$0.400/ 1M tokens$1.80/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本30m$0.250/ 1M tokens$0.020/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

GPT-5.6 Luna

评测结果

GPT-5.6 Luna 当前已收录的代表性评测结果包括 PinchBench v2(4 / 45,得分 88.67)、GPQA Diamond(28 / 253,得分 91.60)、ECI(21 / 167,得分 156.32)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

抽象归纳与泛化

共 15 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
低工具
34.17
162 / 193
ARC-AGI-1
中工具
56.50
136 / 193
ARC-AGI-1
高工具
76.50
103 / 193
ARC-AGI-1
最高
88
76 / 193
ARC-AGI-1
极高工具
87.67
78 / 193
ARC-AGI-2
低工具
5.14
139 / 181
ARC-AGI-2
中工具
7.36
131 / 181
ARC-AGI-2
高工具
29.31
110 / 181
ARC-AGI-2
最高
59.54
78 / 181
ARC-AGI-2
极高工具
47.64
94 / 181
0.17
41 / 51
0.17
41 / 51
0.10
45 / 51
0.18
38 / 51
0.02
50 / 51

科学知识与推理

共 10 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
63.64
205 / 253
82.32
113 / 253
91.60
28 / 253
CritPt
常规模式
0.30
186 / 204
2.60
125 / 204
4.90
102 / 204
16.60
54 / 204
CritPt
最高
20.60
38 / 204
CritPt
极高
20.60
38 / 204
MysteryMechanism
最高工具
14.41
13 / 13

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1828.70
20 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
46.80
57 / 96

多轮记忆与持续上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
81.80
34 / 126

自主开发与终端任务

共 11 项评测
评测名称 / 模式
得分
排名/总数
84.70
20 / 57
Terminal-Bench 2.1
最高工具
75.70
35 / 57
16
43 / 43
22.20
42 / 43
29.40
33 / 43
CursorBench 4.0
最高工具
35.90
21 / 43
CursorBench 4.0
极高工具
33
27 / 43
0.50
93 / 98
2.50
75 / 98
Terminal-Bench 4.0
极高工具
3.50
71 / 98

仓库修复与多文件工程

共 5 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
低工具
1.55
92 / 92
DeepSWE
中工具
11.28
91 / 92
DeepSWE
高工具
44.25
73 / 92
DeepSWE
最高工具
67.19
34 / 92
DeepSWE
极高工具
67.20
33 / 92

跨能力聚合指数

共 5 项评测
评测名称 / 模式
得分
排名/总数

编码综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数

跨应用与工具编排

共 2 项评测
评测名称 / 模式
得分
排名/总数
88.67
4 / 45
Agents' Last Exam
极高工具
50.30
7 / 24

图像感知与视觉推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
60.30
175 / 229
74
99 / 229
75.80
80 / 229
77.60
66 / 229
MMMU-Pro
最高
78.60
55 / 229
MMMU-Pro
极高
78.60
55 / 229

科学计算与科研编程

共 6 项评测
评测名称 / 模式
得分
排名/总数
46.10
88 / 134
46.80
85 / 134
51.60
62 / 134
SciCode
最高
53.60
51 / 134
SciCode
极高
50.50
70 / 134
3.30
18 / 18

客服与业务流程

共 8 项评测
评测名称 / 模式
得分
排名/总数
61.16
18 / 26
SAGE
最高工具
44.22
34 / 64
τ³-Banking
常规模式工具
9.70
134 / 167
τ³-Banking
低工具
12.80
122 / 167
τ³-Banking
中工具
17.70
99 / 167
τ³-Banking
高工具
25.20
77 / 167
τ³-Banking
最高工具
31.10
57 / 167
τ³-Banking
极高工具
28.70
67 / 167

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
最高工具
87.90
16 / 44
36.54
26 / 42
1.25
32 / 43

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
67.12
13 / 42
Tax Agent Bench
最高工具
60.81
15 / 20
Finance Agent v2
最高工具
55.04
16 / 43

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
FrontierMath v2
常规模式
39.65
36 / 58
41.40
35 / 58
82.11
8 / 58
60.98
9 / 42
60
12 / 28

机器学习工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
高工具
60.86
27 / 52

综合偏好评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
1522.94
15 / 35

文档与图表理解

共 5 项评测
评测名称 / 模式
得分
排名/总数
14.20
64 / 122
15.20
61 / 122
22.20
29 / 122
GDP.pdf
最高
24
21 / 122
GDP.pdf
极高
23.80
24 / 122

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
最高工具
44.55
15 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
77.06
21 / 61

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
最高工具
61.78
10 / 26

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
最高工具
84.39
24 / 66
MedCode
最高工具
42.39
39 / 64

和其他模型对比

GPT-5.6 Luna

发布机构

GPT-5.6 Luna

模型解读

系列里最便宜的一档,便宜得很夸张

GPT-5.6 Luna 是 OpenAI 于 2026 年 6 月 26 日限定预览、2026 年 7 月 9 日随 GPT-5.6 系列正式全面开放的低成本高吞吐模型,面向摘要、起草、分类和常规自动化这类量大、单价敏感的日常任务。

它最戏剧性的变化发生在 2026 年 7 月 30 日:OpenAI 一次性把 Luna 的价格下调了 80%,当前为每百万 tokens 输入 0.20 美元、输出 1.20 美元,缓存输入 0.02 美元。对比同系列旗舰 Sol(促销价 4/20 美元),Luna 在输入和输出两端都便宜 约 25 倍。

令人意外的是,它的智能体成绩并不低

便宜 25 倍通常意味着能力断崖,但 Luna 在部分基准上的表现相当反直觉:Agents’ Last Exam 50.3 分,而旗舰 Sol 是 53.6、Terra 是 50.4——三者只差 3.3 分。其它成绩包括 Artificial Analysis Intelligence Index(max 档)51 分、Terminal-Bench 2.1 84.70、DeepSWE 67.20、AA Coding Agent Index 74.6,每任务成本约 0.21 美元,约为 Sol 的五分之一,折算下来性价比约为每美元 24 个基准分。

但有一个硬伤,必须避开

Luna 的长上下文召回是整个系列的明显断点:MRCR 仅 41.3%,而 Sol 为 91.5%、Terra 为 89.6%。这不是「略差一些」,而是量级差异。

它的直接含义是:不要把 Luna 用在大文档分析、长代码库推理或任何需要跨长上下文准确检索的场景——哪怕它名义上也支持 1.05M tokens 的上下文窗口,塞进去的内容它未必找得回来。真正适合它的是较短、范围明确、单步能完成的任务。需要读长文档时,升到 Terra 的成本仍然远低于 Sol。

规格与安全评估

上下文窗口 1.05M tokens(输入最高 922K、最大输出 128K),知识截止 2026 年 2 月 16 日,输入支持文本与图像。与系列一致,单次输入超过 272K tokens 后按输入 2 倍、输出 1.5 倍计费。

Luna 与 Sol、Terra 共享同一份 OpenAI GPT-5.6 系统卡,网络安全与生物/化学两项风险能力评级均为 High,详细披露见 GPT-5.6 Sol 页面。

官方来源

GPT-5.6 Luna

常见问题

Luna、Terra、Sol 三个怎么选?

按任务难度和成本敏感度选。Luna 面向成本敏感、高吞吐的日常任务(摘要、起草、常规自动化),AA Intelligence Index 51 分、每任务约 $0.21;Terra 面向高并发生产场景(客服、内部工具、文档分析),55 分、约 $0.55;Sol 面向最高难度的编程、科研与安全任务,59 分、约 $1.0 量级。Luna 的性价比约为每美元 24 个基准分,是三者中最高的。

Luna 不适合做什么?

不适合大文档长链路工作流。它的长上下文召回相对偏弱,MRCR 只有 41.3%,虽然名义上下文是 1.05M tokens,但实际在超长上下文里精确检索信息的能力跟不上。官方和实测都指向同一结论:把它用在较短、范围明确的任务上。

Luna 的价格是多少?

每百万 tokens 输入 $1.00、缓存命中输入 $0.10、输出 $6.00(另有 $2.00 / $9.00 一档的计价档位)。作为对比,Terra 是 $2.50 / $15.00,Sol 是 $5.00 / $30.00——Luna 大约是 Sol 的五分之一。

Luna 的实测成绩怎么样?

在库内已收录的成绩中,Terminal-Bench 2.1 无工具档 84.70 排 44 个模型第 10,DeepSWE 67.20 排 27 个第 6,Agents' Last Exam 50.30 排 11 个第 3,FrontierMath v2 82.11 排 34 个第 8,GPQA Diamond 91.60 排 226 个第 27。作为系列里最便宜的一档,这些成绩相当能打。但 AA Intelligence Index 51 分在 8 个模型中排第 7,综合智能水平确实是三者最低。

Luna 的安全评级如何?

Luna 与 Sol、Terra 共享同一份 OpenAI GPT-5.6 system card 安全评估,网络安全与生物/化学风险两项能力评级均为「High」。详细披露内容在 GPT-5.6 Sol 页面。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码