DataLearner 标志

GPT-5.6 SolvsClaude Opus 4.8

在 23 个共同 benchmark 中,GPT-5.6 Sol 整体领先:GPT-5.6 Sol 领先 13 项,Claude Opus 4.8 领先 10 项,持平 0 项,平均分差 +8.56。

OpenAI
GPT-5.6 Sol

OpenAI · 2026-06-26 · 推理大模型

Anthropic
Claude Opus 4.8

Anthropic · 2026-05-28 · 推理大模型

GPT-5.6 Sol13 项(57%)(43%)10 项Claude Opus 4.8

评测分数

按能力类目分组,每组内按分差大小排列;共 23 项。

法律

Claude Opus 4.8 领先 2/3
评测项GPT-5.6 SolClaude Opus 4.8分差
Harvey's Legal Agent Benchmark2.5029 / 43Max (With Tools)9.5812 / 43Max (With Tools)-7.08
Legal Research Bench48.087 / 42Max (With Tools)43.7512 / 42Max (With Tools)+4.33
Harvey Lab-AA87.1817 / 44Max (With Tools)91.0811 / 44Max (With Tools)-3.90

临床工作与医疗决策

Claude Opus 4.8 领先 2/2
评测项GPT-5.6 SolClaude Opus 4.8分差
MedCode43.9732 / 64Max (With Tools)53.228 / 64Max (With Tools)-9.25
MedScribe85.2320 / 66Max (With Tools)85.7517 / 66Max (With Tools)-0.52

多轮记忆与持续上下文

GPT-5.6 Sol 领先 2/2
评测项GPT-5.6 SolClaude Opus 4.8分差
EBR-bench44.766 / 23Max (With Tools)28.5710 / 23Max (With Tools)+16.19
Context Arena97.632 / 126Max (No Tools)90.0415 / 126Max (No Tools)+7.59

客服与业务流程

Claude Opus 4.8 领先 2/2
评测项GPT-5.6 SolClaude Opus 4.8分差
SAGE52.564 / 64Max (With Tools)54.792 / 64Max (With Tools)-2.23
Public Benefits Bench v1.166.5110 / 26Max (With Tools)68.138 / 26Max (With Tools)-1.62

自主开发与终端任务

GPT-5.6 Sol 领先 2/2
评测项GPT-5.6 SolClaude Opus 4.8分差
Terminal-Bench 4.037.2724 / 98Max (With Tools)23.6435 / 98Max (With Tools)+13.63
Terminal Bench Hard65.901 / 244Max (With Tools)58.3010 / 244Max (With Tools)+7.60

跨应用与工具编排

胶着 2/2
评测项GPT-5.6 SolClaude Opus 4.8分差
MCPMark-Verified92.912 / 8Max (With Tools)76.386 / 8Max (With Tools)+16.53
PinchBench v284.197 / 45Reported best (effort unspecified)90.542 / 45Reported best (effort unspecified)-6.35

金融

胶着 2/2
评测项GPT-5.6 SolClaude Opus 4.8分差
EMB (Excel Modeling)72.345 / 42Max (With Tools)69.3710 / 42Max (With Tools)+2.97
Finance Agent v253.7621 / 43Max (With Tools)53.9219 / 43Max (With Tools)-0.16

专业数据分析

GPT-5.6 Sol 领先 1/1
评测项GPT-5.6 SolClaude Opus 4.8分差
AA-AnalystAgent47.507 / 29Max (With Tools + Internet)459 / 29Max (With Tools + Internet)+2.50

写作与创意表达

GPT-5.6 Sol 领先 1/1
评测项GPT-5.6 SolClaude Opus 4.8分差
Creative Writing1,9729 / 110Normal (No Tools)1,84018 / 110Normal (No Tools)+131.80

数学

GPT-5.6 Sol 领先 1/1
评测项GPT-5.6 SolClaude Opus 4.8分差
FrontierMath v289.121 / 58Max (No Tools)809 / 58Max (No Tools)+9.12

科学知识与推理

Claude Opus 4.8 领先 1/1
评测项GPT-5.6 SolClaude Opus 4.8分差
GPQA Diamond82.83109 / 253Normal (No Tools)85.3585 / 253Normal (No Tools)-2.53

科学计算与科研编程

GPT-5.6 Sol 领先 1/1
评测项GPT-5.6 SolClaude Opus 4.8分差
Terminal-Bench-Science 0.122.406 / 18Max (With Tools)10.5011 / 18Max (With Tools)+11.90

程序生成与编辑

Claude Opus 4.8 领先 1/1
评测项GPT-5.6 SolClaude Opus 4.8分差
Vibe Code Bench v1.180.5017 / 61Max (With Tools)82.7213 / 61Max (With Tools)-2.22

维护、优化与工程管理

GPT-5.6 Sol 领先 1/1
评测项GPT-5.6 SolClaude Opus 4.8分差
Code Migration52.927 / 43Max (With Tools)47.2510 / 43Max (With Tools)+5.67

跨能力聚合指数

GPT-5.6 Sol 领先 1/1
评测项GPT-5.6 SolClaude Opus 4.8分差
Vals Index v2.158.019 / 36Max (task-specific tools)55.1012 / 36Max (task-specific tools)+2.91

规格对比

字段GPT-5.6 SolClaude Opus 4.8
发布机构OpenAIAnthropic
发布时间2026-06-262026-05-28
模型类型推理大模型推理大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度1.05M1M
最大输出128K125K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GPT-5.6 SolClaude Opus 4.8
文本输入$4 / 1M tokens$5 / 1M tokens
文本输出$20 / 1M tokens$25 / 1M tokens
缓存读取$0.4 / 1M tokens$0.5 / 1M tokens
缓存写入$5 / 1M tokens$6.25 / 1M tokens

小结

  • GPT-5.6 Sol在以下类目领先:多轮记忆与持续上下文 (2/2)、自主开发与终端任务 (2/2)、专业数据分析 (1/1)、写作与创意表达 (1/1)、数学 (1/1)、科学计算与科研编程 (1/1)、维护、优化与工程管理 (1/1)、跨能力聚合指数 (1/1)
  • Claude Opus 4.8在以下类目领先:法律 (2/3)、临床工作与医疗决策 (2/2)、客服与业务流程 (2/2)、科学知识与推理 (1/1)、程序生成与编辑 (1/1)
  • 胶着类目:跨应用与工具编排、金融

23 个共同 benchmark 上,GPT-5.6 Sol 平均高出 8.56 分。

单项差距最大的 benchmark:Creative Writing — GPT-5.6 Sol 1,972,Claude Opus 4.8 1,840(分差 +131.80)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。