DataLearner 标志
GP

GPT-5.1

推理大模型GPTGPT-5.1

GPT-5.1

发布时间: 2025-11-12更新于: 2026-06-15浏览量: 1,054
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
400K
多语言支持
支持
推理能力
4/5

GPT-5.1 是由 OpenAI 发布的 AI 模型,发布时间为 2025-11-12,定位为 推理大模型,上下文长度为 400K,采用 不开源 许可,在 Text Arena (Coding) 上取得 1387.00 分。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GPT-5.1

模型基本信息

推理过程
支持
思考模式
常规模式 (默认)思考模式
上下文长度
400K tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2025-11-12
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
GPT-5.1

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
GPT-5.1

官方介绍与博客

GPT-5.1

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$1.25/ 1M tokens$10.00/ 1M tokens
图像-$1.25/ 1M tokens—
批量模式
类型适用条件输入输出
文本-$0.625/ 1M tokens$5.00/ 1M tokens
图像-$0.625/ 1M tokens—
缓存定价Prompt缓存
类型有效期写入读取
文本-$0.0000/ 1M tokens$0.125/ 1M tokens
图像-$0.0000/ 1M tokens
缓存状态 = write
—
图像-—$0.125/ 1M tokens
缓存状态 = hit

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

GPT-5.1

评测结果

GPT-5.1 当前已收录的代表性评测结果包括 MMMU(2 / 74,得分 85.40)、Terminal Bench Hard(33 / 244,得分 45.50)、FrontierMath(13 / 60,得分 26.70)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

抽象归纳与泛化

共 7 项评测
评测名称 / 模式
得分
排名/总数
33.20
163 / 193
57.70
133 / 193
72.83
110 / 193
ARC-AGI-2
常规模式
0.42
174 / 181
1.90
162 / 181
6.50
133 / 181
17.64
119 / 181

综合知识考试

共 3 项评测
评测名称 / 模式
得分
排名/总数
HLE
思考模式
26.50
129 / 235
HLE
高
25.70
132 / 235
HLE
高工具联网
42.70
75 / 235

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
思考模式
88.10
60 / 253
4.90
102 / 204

仓库修复与多文件工程

共 4 项评测
评测名称 / 模式
得分
排名/总数
76.30
34 / 116
76.30
34 / 116
50.80
46 / 62

数学

共 7 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
高工具
94.17
31 / 110
FrontierMath
高工具
26.70
13 / 60
4.20
40 / 80
12.50
29 / 80
12.50
29 / 80
7.10
16 / 24
1.04
14 / 17

图像感知与视觉推理

共 8 项评测
评测名称 / 模式
得分
排名/总数
MMMU
高
85.40
2 / 74
MMMU
unknown
85.40
2 / 74
MMMU-Pro
常规模式
62.40
165 / 229
MMMU-Pro
思考模式
79
51 / 229
75.50
83 / 229
MMMU-Pro
unknown
76
78 / 229
VPCT
中
53.30
9 / 24
VPCT
高
58.70
7 / 24

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
53.20
48 / 96

事实查找与深度检索

共 1 项评测
评测名称 / 模式
得分
排名/总数
50.80
46 / 58

跨能力综合测试

共 4 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
42.65
108 / 117
59.95
73 / 117
69.17
40 / 117
72.04
29 / 117

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
47.60
39 / 48
Terminal Bench Hard
常规模式工具
22.70
143 / 244
45.50
33 / 244

跨应用与工具编排

共 1 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
高工具
50.10
42 / 44

客服与业务流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
高工具
15.90
105 / 167

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GSO
高工具
13.70
13 / 21

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
高工具
60.77
28 / 52

综合偏好评测

共 2 项评测
评测名称 / 模式
得分
排名/总数
1359
34 / 35
1387
32 / 35

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
149.66
49 / 167

和其他模型对比

GPT-5.1

发布机构

GPT-5.1

模型解读

2025年11月12日,OpenAI正式发布了GPT-5.1模型,其中GPT-5.1 Thinking是推理版本的模型,在官方的介绍中,是用于替换GPT-5的,对简单问题比 GPT-5 Thinking 更快,但对难任务会刻意拉长推理时间换准确率;典型「慢工出细活」。目前,付费用户已经可以在ChatGPT网站使用,但是模型的API和更多信息并没有在当天披露。

-------------------以下为此前暴露信息----------------

在 GPT-5.1 相关泄露信息中,GPT-5.1 Reasoning 被多次提及为该家族中的推理强化版本,与基础的 GPT-5.1 和面向企业场景的 GPT-5.1 Pro 共同构成三成员模型系列。

根据 TestingCatalog 的整理以及社交媒体上对前端代码的截图,OpenAI 内部配置中出现了以 GPT-5.1 Reasoning 命名的条目,与 GPT-5.1 Pro 一同被描述为针对企业与高强度推理工作负载的变体。与此同时,GPT-5.1 Thinking 这一内部标识在 ChatGPT 的后端代码中被发现,并被多家科技媒体解读为优化多步推理与更为审慎回答过程的配置,用于处理复杂问题求解与长链条规划任务。

在开源报道中,GPT-5.1 Reasoning 通常被视为承接 GPT-5 Pro 系列“扩展推理能力”定位的后续版本:通过更长的思考过程、更高的计算预算以及更精细的推理策略来提升在复杂推理任务、研究级问题以及多步骤工具调用场景中的稳定性。然而,目前尚无公开的系统卡或技术报告详细说明该版本的参数规模、上下文窗口、思考预算配置或在标准基准(如 MMLU、GPQA 等)上的具体得分。

因此,从公开可验证的信息出发,可以将 GPT-5.1 Reasoning 谨慎地归类为 GPT-5.1 家族中面向深度推理与多步骤问题求解的强化版本,其核心特点在于对推理路径与答案可靠性的优化,而非仅仅提升生成速度或通用对话体验。关于其具体硬件需求、性能边界以及与基础版 GPT-5.1 的量化差异,目前仍缺乏来自 OpenAI 官方的详细数据说明。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码