DataLearner 标志
GP

GPT-5.5

推理大模型编程大模型GPTGPT-5.5

GPT-5.5

发布时间: 2026-04-23更新于: 2026-08-23浏览量: 8,377
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1000K
多语言支持
支持
推理能力
4/5

OpenAI 于 2026-09-14 宣布:GPT-5.5 将于 2026-10-14 从所有套餐的 ChatGPT、ChatGPT Work 和 Codex 下架,包括个人、Business、Enterprise 和 Edu 套餐。本次下架不适用于 OpenAI API。使用 ChatGPT 登录 Codex 的用户应在下架前将 gpt-5.5 切换为 GPT-5.6 Sol(gpt-5.6-sol)。 GPT-5.5(代号 Spud)是 OpenAI 于 2026 年 4 月发布的旗舰推理模型,专为 Agent 编程、计算机操控与知识工作设计,支持 100 万 token 上下文。本页收录完整基准评测、API 定价与模型解读。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GPT-5.5

模型基本信息

推理过程
支持
思考模式
思考水平 · 极高 (Extra-High) (默认)常规模式思考水平 · 低 (Low)思考水平 · 中 (Medium)思考水平 · 高 (High)思考水平 · 最高 (Max)
上下文长度
1000K tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-04-23
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
GPT-5.5

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
GPT-5.5

官方介绍与博客

GPT-5.5

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$5.00/ 1M tokens$30.00/ 1M tokens
批量模式
类型适用条件输入输出
文本-$2.50/ 1M tokens$15.00/ 1M tokens
加速模式
类型适用条件输入输出
文本-$12.50/ 1M tokens$75.00/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—$0.500/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

GPT-5.5

评测结果

GPT-5.5 当前已收录的代表性评测结果包括 LiveBench(1 / 117,得分 79.91)、Terminal Bench 2.0(1 / 48,得分 82.70)、Terminal Bench Hard(7 / 244,得分 60.60)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

抽象归纳与泛化

共 10 项评测
评测名称 / 模式
得分
排名/总数
76.17
105 / 193
92.17
56 / 193
94.50
38 / 193
ARC-AGI-1
极高
95
36 / 193
33.33
104 / 181
70.42
54 / 181
83.33
35 / 181
ARC-AGI-2
高工具
83.33
35 / 181
ARC-AGI-2
极高
85
29 / 181
0.43
29 / 51

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
HLE
高
41.40
79 / 235
HLE
高工具
52.20
33 / 235

科学知识与推理

共 8 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
77.27
148 / 253
90.66
33 / 253
94
9 / 253
CritPt
常规模式
1.40
139 / 204
8
85 / 204
18.60
44 / 204
25.40
28 / 204
CritPt
极高
27.10
21 / 204

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1843.90
15 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
69
20 / 96

数学

共 10 项评测
评测名称 / 模式
得分
排名/总数
AIME 2026
极高工具
100
1 / 30
HMMT Feb 2026
极高工具
98.48
1 / 10
85.26
6 / 58
MathArena Apex
极高工具
80.21
2 / 17
72.50
7 / 42
71.90
3 / 24
FrontierMath
高工具
51.70
2 / 60
35.40
7 / 80
35.40
7 / 80
0
2 / 5

仓库修复与多文件工程

共 5 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
低工具
26.99
88 / 92
DeepSWE
中工具
53.98
58 / 92
DeepSWE
高工具
64.38
43 / 92
DeepSWE
极高工具
67.04
35 / 92
58.60
18 / 62

事实查找与深度检索

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
高工具联网
84.40
11 / 58

跨能力综合测试

共 4 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
72.15
28 / 117
68.66
44 / 117
78.75
4 / 117
LiveBench
深度
79.91
1 / 117

自主开发与终端任务

共 10 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
极高工具
83.10
25 / 57
82.70
1 / 48
Terminal Bench Hard
常规模式工具
49.20
24 / 244
52.30
19 / 244
57.60
11 / 244
59.80
9 / 244
60.60
7 / 244
5.10
67 / 98
9.10
60 / 98
Terminal-Bench 4.0
极高工具
14.60
46 / 98

多轮记忆与持续上下文

共 6 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
41.93
98 / 126
87.46
20 / 126
90.79
13 / 126
92.01
12 / 126
94.18
6 / 126
EBR-bench
极高工具
34.29
8 / 23

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
78.70
11 / 28

跨应用与工具编排

共 3 项评测
评测名称 / 模式
得分
排名/总数
MCPMark-Verified
极高工具
92.91
2 / 8
75.50
18 / 45
MCP-Atlas
极高工具
75.30
26 / 44

跨能力聚合指数

共 3 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
159.25
8 / 167
Vals Index
极高工具
57.41
21 / 42

图像感知与视觉推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
71.40
121 / 229
79
51 / 229
81.20
32 / 229
81.10
34 / 229
MMMU-Pro
极高
79.90
44 / 229

科学计算与科研编程

共 3 项评测
评测名称 / 模式
得分
排名/总数
54.50
43 / 134
56.10
30 / 134
SciCode
极高
55.80
32 / 134

客服与业务流程

共 7 项评测
评测名称 / 模式
得分
排名/总数
60.89
19 / 26
SAGE
极高工具
51.53
9 / 64
τ³-Banking
常规模式工具
14.80
113 / 167
τ³-Banking
低工具
24.90
79 / 167
τ³-Banking
中工具
29.90
61 / 167
τ³-Banking
高工具
36.70
43 / 167
τ³-Banking
极高工具
44.59
19 / 167

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
极高工具
86.28
18 / 44
40.38
19 / 42
3.75
25 / 43

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
64.54
19 / 42
Tax Agent Bench
极高工具
60.46
16 / 20
Finance Agent v2
极高工具
51.76
26 / 43

维护、优化与工程管理

共 2 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
极高工具
45.16
12 / 43
GSO
极高工具
40.20
4 / 21

机器学习工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
常规模式工具
67.15
22 / 52
WeirdML v2
高工具
83.90
6 / 52
WeirdML v2
极高工具
84.91
5 / 52

综合偏好评测

共 2 项评测
评测名称 / 模式
得分
排名/总数
1478.93
21 / 35
1504.74
18 / 35

文档与图表理解

共 3 项评测
评测名称 / 模式
得分
排名/总数
20.60
37 / 122
22.60
28 / 122
GDP.pdf
极高
21.20
32 / 122

专业数据分析

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
常规模式工具联网
7.50
28 / 29
AA-AnalystAgent
极高工具联网
50
5 / 29

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
69.85
27 / 61

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
极高工具
86.87
13 / 66
MedCode
极高工具
49.10
18 / 64

和其他模型对比

GPT-5.5

发布机构

GPT-5.5

模型解读

下架计划(不影响 OpenAI API)

OpenAI 于 2026-09-14 宣布:GPT-5.5 将于 2026-10-14 从所有套餐的 ChatGPT、ChatGPT Work 和 Codex 下架,包括个人、Business、Enterprise 和 Edu 套餐。本次下架不适用于 OpenAI API。使用 ChatGPT 登录 Codex 的用户应在下架前将 gpt-5.5 切换为 GPT-5.6 Sol(gpt-5.6-sol)。

OpenAI 官方下架公告

OpenAI 于北京时间 4 月 24 日正式发布 GPT-5.5,内部代号"Spud"。距 GPT-5.4 发布不过六周,头部实验室已从"大版本攒够再发"切换成了滚动迭代模式。


定位与核心变化

OpenAI 联席总裁 Greg Brockman 把 GPT-5.5 定位为向"agentic 与直觉式计算"迈进的关键一步,核心叙事只有一句话:在更少外部引导下完成更复杂的多步任务。以前需要手把手给指令,现在可以把一个半成品任务直接交给它,让它自己拆解、规划、执行、检查、再继续。

首席研究官 Mark Chen 补充,本次重点改进集中在四个方向:Agentic Coding、Computer Use、通用知识工作,以及科学研究辅助。单 token 延迟与 GPT-5.4 持平,但完成同样任务消耗的 token 数更少——"更贵但更省"是官方卖点,高吞吐量场景建议用自己的业务数据实测再做判断。

关于 GPT-5.5 Pro 有一点值得注意:它并非独立训练的更大模型,而是同一底层模型在推理时启用并行测试时计算(parallel test-time compute)后得到的高精度模式。定价是标准版的六倍,买的是计算时长而不是参数规模。

API 定价方面,有一个结构化模块里没有体现的隐藏成本:超过 272,000 个输入 token 的请求,整个会话会按 2 倍输入 + 1.5 倍输出计费,长上下文场景需要提前测算。数据驻留(区域端点)另加 10% 费率。


基准成绩背后的结构性判断

Agent 执行类基准上,GPT-5.5 的进步是真实的:相比 GPT-5.4,ARC-AGI-2 提升了 11.7 个百分点,Terminal-Bench 2.0 提升 7.6 个百分点,MCP Atlas 提升 8.1 个百分点。OSWorld-Verified(真实计算机操控)78.7%,在目前公开有成绩的模型中处于前列。

但切换到纯推理场景,结构性短板同样清晰。Humanity's Last Exam(无工具条件)上,GPT-5.5 Pro 得分 43.1%,低于 Claude Opus 4.7 的 46.9%,与 Mythos Preview 的 56.8% 差距更明显。第三方平台 BenchLM.ai 的综合榜(112 个模型)也印证了这一点:Agentic 类任务排第 2,多模态与有根基理解排第 64。

这个能力分布有清晰的实践含义:GPT-5.5 更适合作为执行层工具,负责规划、操控、工具调用和多步任务完成;深度推理链路如果对准确率要求高,综合选型仍有必要。


科研辅助:两个值得记录的案例

OpenAI 在发布时格外强调了科研方向,这里有两个具体案例可以帮助判断能力边界:一是配了定制推理框架的 GPT-5.5 内部版本,参与发现了拉姆齐数(Ramsey Numbers)的一个新证明,这是组合数学的核心研究对象,说明模型贡献已不只是检索与整理,而是在推理生成层面有了真实参与;二是一位免疫学教授用 GPT-5.5 Pro 分析了包含 62 个样本、近 2.8 万个基因的基因表达数据集,产出了含关键洞察与研究问题的完整报告,他表示原本需要团队花费数月。

两个案例都值得打折扣看:前者是内部特化版本,后者是单个专家的主观评估。但方向上指向的是同一件事:模型正在从"搜索替代品"向"协作型研究工具"转变。


渠道格局重塑:AWS Bedrock 与 Azure 独家授权终止

这是本次发布周期里影响最深远的变化,却容易被技术性能讨论掩盖。

4 月 27 日,微软与 OpenAI 正式修订协议,结束自 2019 年以来长达七年的 Azure 排他授权。4 月 28 日,OpenAI 随即宣布与 AWS 扩大战略合作:GPT-5.5 和 GPT-5.4 在 Amazon Bedrock 上线限量预览,Codex 首次进入多云环境,同步推出 Amazon Bedrock Managed Agents powered by OpenAI。AWS 获得 OpenAI Frontier 企业 Agent 平台的独家第三方分发权,双方还在联合开发跨调用保留上下文的有状态运行时环境(Stateful Runtime Environment)。

对企业开发者的直接意义是:有 AWS 存量承诺消费的团队现在可以直接在 Bedrock 调用 GPT-5.5,复用现有 IAM、PrivateLink 和审计体系,不需要另开 OpenAI 账户。OpenAI 产品正式进入多云可选格局,企业侧的供应链集中度风险也随之重新分布。


DataLearner 的判断

GPT-5.5 是一次以 Agent 执行能力为核心的定向升级,不是全面碾压式的代际跃迁。对大多数场景,最值得关注的实际上不是 benchmark 排名的微小变化,而是:token 效率提升能否覆盖价格翻倍的成本、长上下文的隐藏计费规则、以及 Bedrock 上架带来的企业采购路径变化。这三件事对实际部署决策的影响,远比又赢了哪个 benchmark 更实质。

GPT-5.5

常见问题

GPT-5.5 何时下架?API 是否受影响?

OpenAI 于 2026-09-14 宣布:GPT-5.5 将于 2026-10-14 从所有套餐的 ChatGPT、ChatGPT Work 和 Codex 下架,包括个人、Business、Enterprise 和 Edu 套餐。本次下架不适用于 OpenAI API。使用 ChatGPT 登录 Codex 的用户应在下架前将 gpt-5.5 切换为 GPT-5.6 Sol(gpt-5.6-sol)。 https://developers.openai.com/codex/models#gpt-55-retirement

GPT-5.5 是什么模型?

GPT-5.5(代号 Spud)是 OpenAI 于 2026 年 4 月发布的旗舰推理模型,专为 Agent 编程、计算机操控与知识工作设计,支持 100 万 token 上下文。本页收录完整基准评测、API 定价与模型解读。

GPT-5.5 支持哪些输入和输出模态?

当前官方资料记录其支持文本、图像输入,并生成文本输出。

GPT-5.5 的上下文窗口和最大输出是多少?

上下文窗口为 1000K,最大输出为 128K。未公开或无法确认的规格不做推测。

GPT-5.5 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、多语言相关任务;实际效果应结合具体工作流验证。

GPT-5.5 是否提供 API,价格如何查看?

页面已收录 OpenAI 的 30 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。

GPT-5.5 是否开源?

代码与模型权重按 不开源 记录;使用前仍应核对官方许可原文。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码