DataLearner 标志
GP

GPT-6 Sol

推理大模型编程大模型SolGPT-6

OpenAI GPT-6 Sol

别名:GPT 6 Sol

发布时间: 2026-09-22更新于: 2026-09-23知识截止: 2026-04-20浏览量: 1,558
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1.05M
多语言支持
支持
推理能力
4/5

OpenAI 面向复杂编程与 Agent 工作流的 GPT-6 推理模型,标准 API 为每百万 token 输入 $2、输出 $10;Artificial Analysis 中 high 到 max 的综合分从 43 升至 48,但每任务成本从 $0.37 增至 $1.06。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GPT-6 Sol

模型基本信息

推理过程
支持
思考模式
思考水平 · 中 (Medium) (默认)常规模式思考水平 · 低 (Low)思考水平 · 高 (High)思考水平 · 极高 (Extra-High)思考水平 · 最高 (Max)
上下文长度
1.05M tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-09-22
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2026-04-20
GPT-6 Sol

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
GPT-6 Sol

官方介绍与博客

DataLearnerAI博客
暂无
GPT-6 Sol

API接口信息

接口速度
4/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本上下文长度 <= 272000$2.00/ 1M tokens$10.00/ 1M tokens
文本上下文长度 > 272000$4.00/ 1M tokens$15.00/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-$2.50/ 1M tokens
上下文长度 <= 272000
$0.200/ 1M tokens
上下文长度 <= 272000
文本-$5.00/ 1M tokens
上下文长度 > 272000
$0.400/ 1M tokens
上下文长度 > 272000

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

GPT-6 Sol

评测结果

GPT-6 Sol 当前已收录的代表性评测结果包括 CritPt(6 / 204,得分 30.86)、Creative Writing(4 / 110,得分 2124.70)、Agents' Last Exam(2 / 24,得分 56.40)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

抽象归纳与泛化

共 24 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
常规模式
29.33
167 / 193
72.17
112 / 193
83.67
96 / 193
91
65 / 193
ARC-AGI-1
最高
95.50
32 / 193
ARC-AGI-1
极高
92.67
50 / 193
ARC-AGI-2
常规模式
1.67
163 / 181
31.53
106 / 181
57.78
82 / 181
68.89
57 / 181
ARC-AGI-2
最高
89.58
17 / 181
ARC-AGI-2
极高
78.06
42 / 181
1.21
20 / 26
0.28
34 / 51
0.13
44 / 51
0.42
30 / 51
0.90
24 / 51
4.62
16 / 51
1.80
21 / 51

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
2124.70
4 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
73.10
16 / 96

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
最高工具
83.15
24 / 57
Terminal-Bench 4.0
最高工具
43.94
19 / 98

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
最高工具
68.80
26 / 92

跨能力聚合指数

共 3 项评测
评测名称 / 模式
得分
排名/总数

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld 2.0
最高工具
64.40
8 / 14

跨应用与工具编排

共 1 项评测
评测名称 / 模式
得分
排名/总数
Agents' Last Exam
最高工具
56.40
2 / 24

程序生成与编辑

共 3 项评测
评测名称 / 模式
得分
排名/总数
87.82
7 / 61
49.30
8 / 11
Program Bench
最高工具
2
14 / 15

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
极高工具
33.20
17 / 25

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
CritPt
最高
30.86
6 / 204

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
最高
57.64
17 / 134

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
71.53
8 / 42
Tax Agent Bench
最高工具
53.05
20 / 20
Finance Agent v2
最高工具
49.05
32 / 43

法律

共 2 项评测
评测名称 / 模式
得分
排名/总数
28.85
32 / 42
1.67
31 / 43

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
最高
24.80
18 / 122

生物与基因

共 1 项评测
评测名称 / 模式
得分
排名/总数
BioMysteryBench
最高工具
74.81
2 / 4

医学知识与健康咨询

共 4 项评测
评测名称 / 模式
得分
排名/总数

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
最高工具
57.20
4 / 43

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
最高工具
82.61
7 / 26

数学

共 1 项评测
评测名称 / 模式
得分
排名/总数
83
7 / 28

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
56.63
22 / 26
SAGE
最高工具
44.79
32 / 64

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
最高工具
82.03
37 / 66
MedCode
最高工具
47.07
27 / 64

多轮记忆与持续上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
EBR-bench
最高工具
53.33
4 / 23

和其他模型对比

GPT-6 Sol

发布机构

OpenAI GPT-6 Sol

模型解读

GPT-6 Sol 是 OpenAI 于 2026 年 9 月 22 日发布的 GPT-6 推理模型,面向复杂编程和 Agent 工作流,价格与定位介于 GPT-6 Astra 和 Luna 之间。OpenAI 把这一代的重点放在成本效率上:标准 API 输入从 GPT-5.6 Sol 的每百万 token 4 美元降到 2 美元,输出从 20 美元降到 10 美元。独立测试基本支持“更便宜但能力没有掉下去”这条主张,但也暴露出更重要的选型变量:同一个 Sol 从 high 提到 max,Artificial Analysis Intelligence Index 只从 43 升到 48,每任务成本却从 0.37 美元升到 1.06 美元。Sol 的价值因此不在于“总是开最高档”,而在于能用 reasoning effort 在能力、成本和延迟之间换挡。

50% 的 token 降价在同档位独立测试里基本站得住

OpenAI 的发布页把 GPT-6 Sol 的标准输入/输出单价列为每百万 token $2/$10,正好是 GPT-5.6 Sol 促销价格 $4/$20 的一半。把两代模型放在相同的 high effort 下,Artificial Analysis 的独立结果是 GPT-6 Sol 综合分 43、每任务 $0.37,GPT-5.6 Sol 为 42、每任务 $0.81。按这组任务计算,Sol 的每任务成本低约 54%,同时综合分高 1 分。

这不是全面碾压。相同 high 档位下,GPT-5.6 Sol 在 SciCode 是 58%,GPT-6 Sol 是 55%;Humanity's Last Exam 也是 46% 对 44%。GPT-6 Sol 的优势主要来自 Agent 与工具任务,例如 AutomationBench-AA 为 60% 对 55%,Terminal-Bench 4.0 为 26% 对 21%。这说明新一代更像是把相近能力重新压到更低的运行成本,而不是每个 benchmark 都刷新前代上限。

官方最亮眼的对比主要选了高价模型,换成同价位对手后结论更接近“有竞争力”

OpenAI 在发布页重点展示 AutomationBench:GPT-6 Sol xhigh 得 33.2%,单任务约 $0.27;Claude Opus 5 max 得 26.9%,成本是 Sol 的 11.1 倍。这个对比确实说明 Sol 可以用很低的成本完成部分长流程 Agent 任务,但对手属于明显更贵的前沿档。OpenAI 自己也注明:GPT 模型是在研究环境或 API 中评估,可能与生产版 ChatGPT 不同;竞品成绩取自公开报告;Fable 5.1 的一项成本还没有计入约 40% 任务触发的 Opus fallback。

同价位附近的独立数据更适合做选型。Artificial Analysis 中,GPT-6 Sol max 的 Intelligence Index 是 48,Kimi K3 max 是 44;两者每任务成本分别是 $1.06 和 $2.00。Sol 在 Terminal-Bench 4.0 上是 44% 对 13%,但 Kimi K3 在 AA-LCR v1.1 是 89% 对 84%,SciCode 也以 59% 略高于 Sol 的 58%。对 GLM-5.3 max,Sol 综合分 48 对 45;GLM-5.3 的 token 单价更低(输入/输出 $1.40/$4.40 对 $2/$10),但在这套评估里平均每任务输出约 71K token,而 Sol 约 31K,最终每任务成本反而是 $2.01 对 $1.06。这组结果支持 OpenAI 的成本效率主张,但不是“所有同价位模型、所有任务都更强”。

reasoning effort 比型号名更能决定 Sol 的实际性价比

Artificial Analysis 对同一模型不同 effort 的测试显示,high 到 max 时 Intelligence Index 从 43 升到 48,每任务成本从 $0.37 升到 $1.06,约为原来的 2.86 倍。平均每任务输出 token 从约 10K 增到 31K,推理 token 从约 5K 增到 21K;首 token 延迟从约 9.2 秒 增到 178.3 秒。max 的提升主要集中在更难的长程任务,例如 Terminal-Bench 4.0 从 26% 升到 44%;但 GDP.pdf 从 28% 降到 25%,AA-Omniscience 都是 27,AA-LCR v1.1 都是 84%。

Artificial Analysis 说明其综合指数基于 10 组评测,当前方法估计整体 95% 置信区间小于 ±1 分,但单项评测的区间可能更宽。因而 43 到 48 的综合差距不太像一次运行的随机波动;同时也不能把某一个子 benchmark 的两三个百分点变化当作稳定排序。对 Sol 来说,reasoning effort 不是一个无关紧要的“质量旋钮”,而是直接改变每次任务要消耗多少推理 token、要等多久,以及最终成本的核心配置。

105 万官方上下文与第三方的 872K 标注不一致,长上下文还会触发额外加价

OpenAI API 文档明确列出 GPT-6 Sol 的上下文窗口为 1,050,000 token、最大输出 128,000 token,知识截止日期为 2026 年 4 月 20 日;本站结构化字段因此继续采用官方的 105 万。Artificial Analysis 的 GPT-6 Sol 测试页则把上下文标为 872K token,页面没有解释两者为何不同。这里不应把第三方数字覆盖到官方规格上,但这处差异需要保留为未解释的数据冲突。

长上下文的价格也不是统一的 $2/$10。OpenAI 规定单次请求输入超过 272K token 后,整次请求的输入和缓存费率按 2 倍计,输出按 1.5 倍计,也就是标准文本输入/输出变为每百万 token $4/$15。因此 105 万上下文代表可用容量,不代表把上下文拉满后仍维持短请求的单位成本。

适用边界:高强度 Agent 可从 high 起步,绝对能力和极低成本都有更具体的替代项

如果工作负载是持续的编程、工具调用和 Agent 任务,同时要控制成本,独立数据里的 high 是一个更低成本的运行点:综合分 43、每任务 $0.37;当任务确实依赖更强的长程编码能力时,max 在 Terminal-Bench 4.0 上把成绩从 26% 提到 44%,这时额外成本有明确回报。若目标是当前公开综合评测中的绝对能力,Artificial Analysis 的榜首 Claude Opus 5.5 max 得 58 分,Sol max 为 48;对应每任务成本约 $5.98 和 $1.06。OpenAI 自己也把 GPT-6 Astra 定位为 GPT-6 家族“across the board”的最佳模型。

若更看重开放权重或更低的 token 单价,GLM-5.3 max 是更接近 Sol 能力区间的候选:综合分 45,输入/输出为 $1.40/$4.40;DeepSeek V4.1 Flash max 则把输入/输出压到 $0.30/$1.20,综合分为 39、每任务约 $0.27,而 AutomationBench-AA 反而以 69% 高于 Sol max 的 62%。这些对手说明 GPT-6 Sol 的优势最清楚地落在“较强 Agent/编码能力 + 可调 effort + 中等 API 成本”的组合上,而不是单独某一项指标。

GPT-6 Sol

常见问题

GPT-6 Sol 的 API 价格是多少?

标准文本价格为每百万 token 输入 $2、缓存输入 $0.20、缓存写入 $2.50、输出 $10。单次请求输入超过 272K token 后,整次请求的输入/缓存按 2 倍、输出按 1.5 倍计,即输入 $4、输出 $15。

GPT-6 Sol 的 high 和 max 差距有多大?

Artificial Analysis 的 2026-09-27 数据中,high 的 Intelligence Index 为 43、每任务约 $0.37;max 为 48、每任务约 $1.06。max 综合分高 5 分,但任务成本约为 high 的 2.86 倍,首 token 延迟也从约 9 秒升到约 178 秒。

GPT-6 Sol 比 GPT-5.6 Sol 更划算吗?

在 Artificial Analysis 的相同 high effort 下,GPT-6 Sol 为 43 分、$0.37/任务,GPT-5.6 Sol 为 42 分、$0.81/任务;这组测试中能力基本持平而每任务成本下降约 54%。但不同 benchmark 上仍各有胜负。

GPT-6 Sol 是当前能力最强的模型吗?

不是。Artificial Analysis 2026-09-27 的 Intelligence Index 中,Claude Opus 5.5 max 为 58 分,GPT-6 Sol max 为 48 分;对应每任务成本约 $5.98 和 $1.06。Sol 更突出的是成本效率而非绝对榜首。

为什么本站写 105 万上下文,而 Artificial Analysis 写 872K?

OpenAI 官方 API 文档明确给出 1,050,000 token 上下文,所以本站结构化规格采用官方值。Artificial Analysis 的测试页标为 872K,但没有说明差异来源,因此这处数据冲突保留为待核实项,而不是用第三方值覆盖官方规格。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码