DataLearner 标志

Claude Sonnet 5vsGPT-5.6 Terra

在 28 个共同 benchmark 中,GPT-5.6 Terra 整体领先:Claude Sonnet 5 领先 12 项,GPT-5.6 Terra 领先 15 项,持平 1 项,平均分差 -7.24。

Anthropic
Claude Sonnet 5

Anthropic · 2026-06-30 · 多模态大模型

OpenAI
GPT-5.6 Terra

OpenAI · 2026-06-26 · 推理大模型

Claude Sonnet 512 项(43%)持平1(54%)15 项GPT-5.6 Terra

评测分数

按能力类目分组,每组内按分差大小排列;共 28 项。

客服与业务流程

Claude Sonnet 5 领先 2/3
评测项Claude Sonnet 5GPT-5.6 Terra分差
Public Benefits Bench v1.166.0311 / 26Max (With Tools)62.3816 / 26Max (With Tools)+3.65
SAGE48.9217 / 64Max (With Tools)4726 / 64Max (With Tools)+1.92
τ³-Banking15.70107 / 167Normal (With Tools)15.70107 / 167Normal (With Tools)持平

数学

GPT-5.6 Terra 领先 2/3
评测项Claude Sonnet 5GPT-5.6 Terra分差
FrontierMath Tier 4 v229.2720 / 42Max (No Tools)70.738 / 42Max (No Tools)-41.46
FrontierMath v265.6120 / 58Max (No Tools)85.964 / 58Max (No Tools)-20.35
ProofBench v1.1 (Lean 4)779 / 28Max (With Tools)7410 / 28Max (With Tools)+3

法律

Claude Sonnet 5 领先 3/3
评测项Claude Sonnet 5GPT-5.6 Terra分差
Harvey Lab-AA90.0714 / 44Max (With Tools)85.1820 / 44Max (With Tools)+4.89
Harvey's Legal Agent Benchmark523 / 43Max (With Tools)0.8333 / 43Max (With Tools)+4.17
Legal Research Bench41.8314 / 42Max (With Tools)41.3515 / 42Max (With Tools)+0.48

金融

GPT-5.6 Terra 领先 2/3
评测项Claude Sonnet 5GPT-5.6 Terra分差
Tax Agent Bench62.2714 / 20Max (With Tools)65.2011 / 20Max (With Tools)-2.93
Finance Agent v253.9120 / 43Max (With Tools)54.4417 / 43Max (With Tools)-0.53
EMB (Excel Modeling)66.3216 / 42Max (With Tools)66.2017 / 42Max (With Tools)+0.12

临床工作与医疗决策

胶着 2/2
评测项Claude Sonnet 5GPT-5.6 Terra分差
MedScribe76.0553 / 66Max (With Tools)82.8735 / 66Max (With Tools)-6.82
MedCode47.5424 / 64Max (With Tools)43.4134 / 64Max (With Tools)+4.13

仓库修复与多文件工程

Claude Sonnet 5 领先 2/2
评测项Claude Sonnet 5GPT-5.6 Terra分差
SWE-Bench Pro V2 Hard88.204 / 11Extra-High (With Tools)86.306 / 11Extra-High (With Tools)+1.90
SWE-Bench Pro V293.158 / 10Extra-High (With Tools)92.379 / 10Extra-High (With Tools)+0.78

自主开发与终端任务

GPT-5.6 Terra 领先 2/2
评测项Claude Sonnet 5GPT-5.6 Terra分差
Terminal-Bench 4.012.4255 / 98Max (With Tools)21.5236 / 98Max (With Tools)-9.10
CursorBench 4.034.1023 / 43Max (With Tools)41.3013 / 43Max (With Tools)-7.20

写作与创意表达

GPT-5.6 Terra 领先 1/1
评测项Claude Sonnet 5GPT-5.6 Terra分差
Creative Writing1,79424 / 110Normal (No Tools)1,85514 / 110Normal (No Tools)-60.90

图像感知与视觉推理

Claude Sonnet 5 领先 1/1
评测项Claude Sonnet 5GPT-5.6 Terra分差
MMMU-Pro71.90118 / 229Normal (No Tools)66.70148 / 229Normal (No Tools)+5.20

多轮记忆与持续上下文

GPT-5.6 Terra 领先 1/1
评测项Claude Sonnet 5GPT-5.6 Terra分差
Context Arena79.5340 / 126Max (No Tools)92.1711 / 126Max (No Tools)-12.64

机器学习工程

GPT-5.6 Terra 领先 1/1
评测项Claude Sonnet 5GPT-5.6 Terra分差
WeirdML v268.7820 / 52Thinking High (With Tools)78.2710 / 52Thinking High (With Tools)-9.49

科学知识与推理

GPT-5.6 Terra 领先 1/1
评测项Claude Sonnet 5GPT-5.6 Terra分差
CritPt1.10151 / 204Normal (No Tools)2131 / 204Normal (No Tools)-0.90

程序生成与编辑

Claude Sonnet 5 领先 1/1
评测项Claude Sonnet 5GPT-5.6 Terra分差
Vibe Code Bench v1.181.3316 / 61Max (With Tools)74.5923 / 61Max (With Tools)+6.74

算法与竞赛编程

GPT-5.6 Terra 领先 1/1
评测项Claude Sonnet 5GPT-5.6 Terra分差
IOI (Vals v2)4520 / 26Max (With Tools)87.615 / 26Max (With Tools)-42.61

维护、优化与工程管理

GPT-5.6 Terra 领先 1/1
评测项Claude Sonnet 5GPT-5.6 Terra分差
Code Migration44.3916 / 43Max (With Tools)47.808 / 43Max (With Tools)-3.41

综合知识考试

GPT-5.6 Terra 领先 1/1
评测项Claude Sonnet 5GPT-5.6 Terra分差
HLE-Verified316 / 6Reported best (effort unspecified)51.105 / 6Reported best (effort unspecified)-20.10

跨能力聚合指数

GPT-5.6 Terra 领先 1/1
评测项Claude Sonnet 5GPT-5.6 Terra分差
Vals Index v2.151.7720 / 36Max (task-specific tools)53.0918 / 36Max (task-specific tools)-1.32

规格对比

字段Claude Sonnet 5GPT-5.6 Terra
发布机构AnthropicOpenAI
发布时间2026-06-302026-06-26
模型类型多模态大模型推理大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度1M1.05M
最大输出128K128K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Claude Sonnet 5GPT-5.6 Terra
文本输入$2 / 1M tokens$2 / 1M tokens
文本输出$10 / 1M tokens$12 / 1M tokens
缓存读取$0.2 / 1M tokens$0.2 / 1M tokens
缓存写入$2.5 / 1M tokens$2.5 / 1M tokens

小结

  • Claude Sonnet 5在以下类目领先:客服与业务流程 (2/3)、法律 (3/3)、仓库修复与多文件工程 (2/2)、图像感知与视觉推理 (1/1)、程序生成与编辑 (1/1)
  • GPT-5.6 Terra在以下类目领先:数学 (2/3)、金融 (2/3)、自主开发与终端任务 (2/2)、写作与创意表达 (1/1)、多轮记忆与持续上下文 (1/1)、机器学习工程 (1/1)、科学知识与推理 (1/1)、算法与竞赛编程 (1/1)、维护、优化与工程管理 (1/1)、综合知识考试 (1/1)、跨能力聚合指数 (1/1)
  • 胶着类目:临床工作与医疗决策

28 个共同 benchmark 上,GPT-5.6 Terra 平均高出 7.24 分。

单项差距最大的 benchmark:Creative Writing — Claude Sonnet 5 1,794,GPT-5.6 Terra 1,855(分差 -60.90)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。