DataLearner 标志

Claude Opus 5vsGPT-5.6 Sol

在 36 个共同 benchmark 中,Claude Opus 5 整体领先:Claude Opus 5 领先 29 项,GPT-5.6 Sol 领先 7 项,持平 0 项,平均分差 +9.26。

Anthropic
Claude Opus 5

Anthropic · 2026-07-24 · 推理大模型

OpenAI
GPT-5.6 Sol

OpenAI · 2026-06-26 · 推理大模型

Claude Opus 529 项(81%)(19%)7 项GPT-5.6 Sol

评测分数

按能力类目分组,每组内按分差大小排列;共 36 项。

仓库修复与多文件工程

Claude Opus 5 领先 3/4
评测项Claude Opus 5GPT-5.6 Sol分差
NL2Repo-Bench75.301 / 16Max (With Tools)56.809 / 16Max (With Tools)+18.50
SWE-Bench Pro V2 Hard981 / 11Extra-High (With Tools)82.408 / 11Extra-High (With Tools)+15.60
SWE-Bench Pro V299.401 / 10Extra-High (With Tools)95.506 / 10Extra-High (With Tools)+3.90
SWE-Atlas-QnA52.704 / 6Reported best (effort unspecified)53.503 / 6Reported best (effort unspecified)-0.80

法律

Claude Opus 5 领先 3/3
评测项Claude Opus 5GPT-5.6 Sol分差
Legal Research Bench55.291 / 42Max (With Tools)48.087 / 42Max (With Tools)+7.21
Harvey Lab-AA93.464 / 44Max (With Tools)87.1817 / 44Max (With Tools)+6.28
Harvey's Legal Agent Benchmark6.6717 / 43Max (With Tools)2.5029 / 43Max (With Tools)+4.17

金融

Claude Opus 5 领先 3/3
评测项Claude Opus 5GPT-5.6 Sol分差
Tax Agent Bench75.062 / 20Max (With Tools)67.958 / 20Max (With Tools)+7.11
Finance Agent v258.638 / 43Max (With Tools)53.7621 / 43Max (With Tools)+4.87
EMB (Excel Modeling)73.564 / 42Max (With Tools)72.345 / 42Max (With Tools)+1.22

临床工作与医疗决策

Claude Opus 5 领先 2/2
评测项Claude Opus 5GPT-5.6 Sol分差
MedCode63.571 / 64Max (With Tools)43.9732 / 64Max (With Tools)+19.60
MedScribe90.983 / 66Max (With Tools)85.2320 / 66Max (With Tools)+5.75

图像感知与视觉推理

胶着 2/2
评测项Claude Opus 5GPT-5.6 Sol分差
BabyVision94.101 / 9Max (With Tools)88.904 / 9Max (With Tools)+5.20
ZeroBench Main522 / 6Max (With Tools)531 / 6Max (With Tools)-1

多轮记忆与持续上下文

Claude Opus 5 领先 2/2
评测项Claude Opus 5GPT-5.6 Sol分差
EBR-bench45.715 / 23Max (With Tools)44.766 / 23Max (With Tools)+0.95
Context Arena97.721 / 126Max (No Tools)97.632 / 126Max (No Tools)+0.09

客服与业务流程

胶着 2/2
评测项Claude Opus 5GPT-5.6 Sol分差
Public Benefits Bench v1.176.931 / 26Max (With Tools)66.5110 / 26Max (With Tools)+10.42
SAGE49.4314 / 64Max (With Tools)52.564 / 64Max (With Tools)-3.13

数学

胶着 2/2
评测项Claude Opus 5GPT-5.6 Sol分差
ProofBench v1.1 (Lean 4)993 / 28Max (With Tools)837 / 28Max (With Tools)+16
FrontierMath v285.615 / 58Max (No Tools)89.121 / 58Max (No Tools)-3.51

程序生成与编辑

Claude Opus 5 领先 2/2
评测项Claude Opus 5GPT-5.6 Sol分差
Program Bench376 / 15Max (With Tools)238 / 15Max (With Tools)+14
Vibe Code Bench v1.188.406 / 61Max (With Tools)80.5017 / 61Max (With Tools)+7.90

自主开发与终端任务

Claude Opus 5 领先 2/2
评测项Claude Opus 5GPT-5.6 Sol分差
Terminal-Bench 3.043.301 / 11Max (With Tools)34.402 / 11Max (With Tools)+8.90
CursorBench 4.046.605 / 43Max (With Tools)41.7010 / 43Max (With Tools)+4.90

专业数据分析

Claude Opus 5 领先 1/1
评测项Claude Opus 5GPT-5.6 Sol分差
AA-AnalystAgent53.753 / 29Max (With Tools + Internet)47.507 / 29Max (With Tools + Internet)+6.25

写作与创意表达

Claude Opus 5 领先 1/1
评测项Claude Opus 5GPT-5.6 Sol分差
Creative Writing2,1333 / 110Normal (No Tools)1,9729 / 110Normal (No Tools)+161

办公与文档流程

Claude Opus 5 领先 1/1
评测项Claude Opus 5GPT-5.6 Sol分差
AutomationBench50.306 / 25Max (With Tools)45.8011 / 25Max (With Tools)+4.50

文档与图表理解

Claude Opus 5 领先 1/1
评测项Claude Opus 5GPT-5.6 Sol分差
Chartography843 / 11Max (With Tools)79.904 / 11Max (With Tools)+4.10

机器学习工程

Claude Opus 5 领先 1/1
评测项Claude Opus 5GPT-5.6 Sol分差
WeirdML v30.195 / 13Extra-High (With Tools)0.157 / 13Extra-High (With Tools)+0.04

漏洞利用

GPT-5.6 Sol 领先 1/1
评测项Claude Opus 5GPT-5.6 Sol分差
ExploitGym (budget unspecified)22.102 / 6Max (With Tools)33.701 / 6Max (With Tools)-11.60

科学知识与推理

Claude Opus 5 领先 1/1
评测项Claude Opus 5GPT-5.6 Sol分差
MysteryMechanism37.394 / 13Max (With Tools)33.337 / 13Max (With Tools)+4.06

科学计算与科研编程

Claude Opus 5 领先 1/1
评测项Claude Opus 5GPT-5.6 Sol分差
Terminal-Bench-Science 0.1305 / 18Max (With Tools)22.406 / 18Max (With Tools)+7.60

算法与竞赛编程

GPT-5.6 Sol 领先 1/1
评测项Claude Opus 5GPT-5.6 Sol分差
IOI (Vals v2)84.336 / 26Max (With Tools)91.173 / 26Max (With Tools)-6.84

维护、优化与工程管理

Claude Opus 5 领先 1/1
评测项Claude Opus 5GPT-5.6 Sol分差
Code Migration57.473 / 43Max (With Tools)52.927 / 43Max (With Tools)+4.55

综合知识考试

GPT-5.6 Sol 领先 1/1
评测项Claude Opus 5GPT-5.6 Sol分差
HLE-Verified54.403 / 6Reported best (effort unspecified)54.502 / 6Reported best (effort unspecified)-0.10

跨能力聚合指数

Claude Opus 5 领先 1/1
评测项Claude Opus 5GPT-5.6 Sol分差
Vals Index v2.163.675 / 36Max (task-specific tools)58.019 / 36Max (task-specific tools)+5.66

规格对比

字段Claude Opus 5GPT-5.6 Sol
发布机构AnthropicOpenAI
发布时间2026-07-242026-06-26
模型类型推理大模型推理大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度1M1.05M
最大输出128K128K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Claude Opus 5GPT-5.6 Sol
文本输入$5 / 1M tokens$4 / 1M tokens
文本输出$25 / 1M tokens$20 / 1M tokens
缓存读取$0.5 / 1M tokens$0.4 / 1M tokens
缓存写入$6.25 / 1M tokens$5 / 1M tokens

小结

  • Claude Opus 5在以下类目领先:仓库修复与多文件工程 (3/4)、法律 (3/3)、金融 (3/3)、临床工作与医疗决策 (2/2)、多轮记忆与持续上下文 (2/2)、程序生成与编辑 (2/2)、自主开发与终端任务 (2/2)、专业数据分析 (1/1)、写作与创意表达 (1/1)、办公与文档流程 (1/1)、文档与图表理解 (1/1)、机器学习工程 (1/1)、科学知识与推理 (1/1)、科学计算与科研编程 (1/1)、维护、优化与工程管理 (1/1)、跨能力聚合指数 (1/1)
  • GPT-5.6 Sol在以下类目领先:漏洞利用 (1/1)、算法与竞赛编程 (1/1)、综合知识考试 (1/1)
  • 胶着类目:图像感知与视觉推理、客服与业务流程、数学

36 个共同 benchmark 上,Claude Opus 5 平均高出 9.26 分。

单项差距最大的 benchmark:Creative Writing — Claude Opus 5 2,133,GPT-5.6 Sol 1,972(分差 +161)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。