DataLearner 标志

GPT-5.6 SolvsClaude Fable 5

在 28 个共同 benchmark 中,Claude Fable 5 整体领先:GPT-5.6 Sol 领先 10 项,Claude Fable 5 领先 17 项,持平 1 项,平均分差 -0.18。

OpenAI
GPT-5.6 Sol

OpenAI · 2026-06-26 · 推理大模型

Anthropic
Claude Fable 5

Anthropic · 2026-06-09 · 推理大模型

GPT-5.6 Sol10 项(36%)持平1(61%)17 项Claude Fable 5

评测分数

按能力类目分组,每组内按分差大小排列;共 28 项。

自主开发与终端任务

胶着 4/4
评测项GPT-5.6 SolClaude Fable 5分差
Terminal-Bench 4.037.2724 / 98Max (With Tools)44.5518 / 98Max (With Tools)-7.28
CursorBench 3.267.204 / 5Max (With Tools)70.502 / 5Max (With Tools)-3.30
Terminal Bench Hard65.901 / 244Max (With Tools)62.902 / 244Max (With Tools)+3
Terminal-Bench 3.034.402 / 11Max (With Tools)34.103 / 11Max (With Tools)+0.30

法律

Claude Fable 5 领先 3/3
评测项GPT-5.6 SolClaude Fable 5分差
Harvey's Legal Agent Benchmark2.5029 / 43Max (With Tools)11.258 / 43Max (With Tools)-8.75
Harvey Lab-AA87.1817 / 44Max (With Tools)93.563 / 44Max (With Tools)-6.38
Legal Research Bench48.087 / 42Max (With Tools)49.525 / 42Max (With Tools)-1.44

跨应用与工具编排

GPT-5.6 Sol 领先 2/3
评测项GPT-5.6 SolClaude Fable 5分差
PinchBench v284.197 / 45Reported best (effort unspecified)54.8435 / 45Reported best (effort unspecified)+29.35
MCPMark-Verified92.912 / 8Max (With Tools)86.614 / 8Max (With Tools)+6.30
APEX-Agents56.703 / 7Max (With Tools)59.201 / 7Max (With Tools)-2.50

临床工作与医疗决策

Claude Fable 5 领先 2/2
评测项GPT-5.6 SolClaude Fable 5分差
MedCode43.9732 / 64Max (With Tools)56.073 / 64Max (With Tools)-12.10
MedScribe85.2320 / 66Max (With Tools)88.529 / 66Max (With Tools)-3.29

客服与业务流程

胶着 2/2
评测项GPT-5.6 SolClaude Fable 5分差
Public Benefits Bench v1.166.5110 / 26Max (With Tools)70.434 / 26Max (With Tools)-3.92
SAGE52.564 / 64Max (With Tools)51.897 / 64Max (With Tools)+0.67

数学

胶着 2/2
评测项GPT-5.6 SolClaude Fable 5分差
ProofBench v1.1 (Lean 4)837 / 28Max (With Tools)955 / 28Max (With Tools)-12
FrontierMath v289.121 / 58Max (No Tools)87.023 / 58Max (No Tools)+2.11

机器学习工程

GPT-5.6 Sol 领先 1/2
评测项GPT-5.6 SolClaude Fable 5分差
WeirdML v288.762 / 52Thinking High (With Tools)87.853 / 52Thinking High (With Tools)+0.91
WeirdML v30.157 / 13Extra-High (With Tools)0.166 / 13Extra-High (With Tools)持平

金融

Claude Fable 5 领先 2/2
评测项GPT-5.6 SolClaude Fable 5分差
Finance Agent v253.7621 / 43Max (With Tools)56.3113 / 43Max (With Tools)-2.55
EMB (Excel Modeling)72.345 / 42Max (With Tools)73.673 / 42Max (With Tools)-1.33

专业数据分析

Claude Fable 5 领先 1/1
评测项GPT-5.6 SolClaude Fable 5分差
AA-AnalystAgent47.507 / 29Max (With Tools + Internet)48.756 / 29Max (With Tools + Internet)-1.25

写作与创意表达

GPT-5.6 Sol 领先 1/1
评测项GPT-5.6 SolClaude Fable 5分差
Creative Writing1,9729 / 110Normal (No Tools)1,94310 / 110Normal (No Tools)+28.50

多轮记忆与持续上下文

GPT-5.6 Sol 领先 1/1
评测项GPT-5.6 SolClaude Fable 5分差
EBR-bench44.766 / 23Max (With Tools)39.527 / 23Max (With Tools)+5.24

抽象归纳与泛化

Claude Fable 5 领先 1/1
评测项GPT-5.6 SolClaude Fable 5分差
ARC-AGI-197.5011 / 193Extra-High (No Tools)98.501 / 193Extra-High (No Tools)-1

科学计算与科研编程

GPT-5.6 Sol 领先 1/1
评测项GPT-5.6 SolClaude Fable 5分差
Terminal-Bench-Science 0.122.406 / 18Max (With Tools)21.407 / 18Max (With Tools)+1

程序生成与编辑

Claude Fable 5 领先 1/1
评测项GPT-5.6 SolClaude Fable 5分差
Vibe Code Bench v1.180.5017 / 61Max (With Tools)90.352 / 61Max (With Tools)-9.85

维护、优化与工程管理

Claude Fable 5 领先 1/1
评测项GPT-5.6 SolClaude Fable 5分差
Code Migration52.927 / 43Max (With Tools)55.065 / 43Max (With Tools)-2.14

跨能力聚合指数

Claude Fable 5 领先 1/1
评测项GPT-5.6 SolClaude Fable 5分差
Vals Index v2.158.019 / 36Max (task-specific tools)61.397 / 36Max (task-specific tools)-3.38

规格对比

字段GPT-5.6 SolClaude Fable 5
发布机构OpenAIAnthropic
发布时间2026-06-262026-06-09
模型类型推理大模型推理大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度1.05M1M
最大输出128K128K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GPT-5.6 SolClaude Fable 5
文本输入$4 / 1M tokens$10 / 1M tokens
文本输出$20 / 1M tokens$50 / 1M tokens
缓存读取$0.4 / 1M tokens$1 / 1M tokens
缓存写入$5 / 1M tokens$12.5 / 1M tokens

小结

  • GPT-5.6 Sol在以下类目领先:跨应用与工具编排 (2/3)、机器学习工程 (1/2)、写作与创意表达 (1/1)、多轮记忆与持续上下文 (1/1)、科学计算与科研编程 (1/1)
  • Claude Fable 5在以下类目领先:法律 (3/3)、临床工作与医疗决策 (2/2)、金融 (2/2)、专业数据分析 (1/1)、抽象归纳与泛化 (1/1)、程序生成与编辑 (1/1)、维护、优化与工程管理 (1/1)、跨能力聚合指数 (1/1)
  • 胶着类目:自主开发与终端任务、客服与业务流程、数学

28 个共同 benchmark 上,Claude Fable 5 平均高出 0.18 分。

单项差距最大的 benchmark:PinchBench v2 — GPT-5.6 Sol 84.19,Claude Fable 5 54.84(分差 +29.35)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。