DataLearner 标志

GPT-5.1vsGPT-5

在 15 个共同 benchmark 中,GPT-5.1 整体领先:GPT-5.1 领先 7 项,GPT-5 领先 6 项,持平 2 项,平均分差 -0.58。

OpenAI
GPT-5.1

OpenAI · 2025-11-12 · 推理大模型

OpenAI
GPT-5

OpenAI · 2025-08-07 · 基础大模型

GPT-5.17 项(47%)持平2(40%)6 项GPT-5

评测分数

按能力类目分组,每组内按分差大小排列;共 15 项。

数学

胶着 4/4
评测项GPT-5.1GPT-5分差
IMO-ProofBench Advanced7.1016 / 24Thinking (No Tools)2011 / 24Thinking (No Tools)-12.90
FrontierMath26.7013 / 60Thinking High (With Tools)26.3014 / 60Thinking High (With Tools)+0.40
FrontierMath - Tier 412.5029 / 80Thinking High (No Tools)12.5029 / 80Thinking High (No Tools)持平
MathArena Apex1.0414 / 17Thinking High (With Tools)1.0414 / 17Thinking High (With Tools)持平

仓库修复与多文件工程

GPT-5.1 领先 2/2
评测项GPT-5.1GPT-5分差
SWE-Bench Pro - Public50.8046 / 62Thinking High (No Tools)36.3059 / 62Thinking High (No Tools)+14.50
SWE-bench Verified76.3034 / 116Thinking High (No Tools)72.8051 / 116Thinking High (No Tools)+3.50

图像感知与视觉推理

胶着 2/2
评测项GPT-5.1GPT-5分差
VPCT58.707 / 24Thinking High (No Tools)665 / 24Thinking High (No Tools)-7.30
MMMU-Pro62.40165 / 229Normal (No Tools)62.10167 / 229Normal (No Tools)+0.30

客服与业务流程

GPT-5 领先 1/1
评测项GPT-5.1GPT-5分差
τ³-Banking15.90105 / 167Thinking High (With Tools)22.1086 / 167Thinking High (With Tools)-6.20

常识推理

GPT-5 领先 1/1
评测项GPT-5.1GPT-5分差
SimpleBench53.2048 / 96Thinking High (No Tools)56.7043 / 96Thinking High (No Tools)-3.50

机器学习工程

GPT-5.1 领先 1/1
评测项GPT-5.1GPT-5分差
WeirdML v260.7728 / 52Thinking High (With Tools)60.7029 / 52Thinking High (With Tools)+0.07

科学知识与推理

GPT-5 领先 1/1
评测项GPT-5.1GPT-5分差
CritPt4.90102 / 204Thinking High (No Tools)5.7092 / 204Thinking High (No Tools)-0.80

维护、优化与工程管理

GPT-5.1 领先 1/1
评测项GPT-5.1GPT-5分差
GSO13.7013 / 21Thinking High (With Tools)6.9016 / 21Thinking High (With Tools)+6.80

综合偏好评测

GPT-5 领先 1/1
评测项GPT-5.1GPT-5分差
Text Arena (Coding)1,38732 / 35Thinking Medium (No Tools)1,39529 / 35Thinking Medium (No Tools)-8

自主开发与终端任务

GPT-5.1 领先 1/1
评测项GPT-5.1GPT-5分差
Terminal Bench Hard22.70143 / 244Normal (With Tools)18.20154 / 244Normal (With Tools)+4.50

规格对比

字段GPT-5.1GPT-5
发布机构OpenAIOpenAI
发布时间2025-11-122025-08-07
模型类型推理大模型基础大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度400K400K
最大输出128K128K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GPT-5.1GPT-5
文本输入$1.25 / 1M tokens$1.25 / 1M tokens
文本输出$10 / 1M tokens$10 / 1M tokens
缓存读取$0.125 / 1M tokens$0.125 / 1M tokens
缓存写入$0 / 1M tokens$0 / 1M tokens

小结

  • GPT-5.1在以下类目领先:仓库修复与多文件工程 (2/2)、机器学习工程 (1/1)、维护、优化与工程管理 (1/1)、自主开发与终端任务 (1/1)
  • GPT-5在以下类目领先:客服与业务流程 (1/1)、常识推理 (1/1)、科学知识与推理 (1/1)、综合偏好评测 (1/1)
  • 胶着类目:数学、图像感知与视觉推理

15 个共同 benchmark 上,GPT-5 平均高出 0.58 分。

单项差距最大的 benchmark:SWE-Bench Pro - Public — GPT-5.1 50.80,GPT-5 36.30(分差 +14.50)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。