DataLearner 标志

Claude Sonnet 4.5vsClaude Sonnet 4

在 26 个共同 benchmark 中,Claude Sonnet 4.5 整体领先:Claude Sonnet 4.5 领先 23 项,Claude Sonnet 4 领先 1 项,持平 2 项,平均分差 +19.52。

Anthropic
Claude Sonnet 4.5

Anthropic · 2025-09-30 · 聊天大模型

Anthropic
Claude Sonnet 4

Anthropic · 2025-05-23 · 推理大模型

Claude Sonnet 4.523 项(88%)持平2(4%)1 项Claude Sonnet 4

评测分数

按能力类目分组,每组内按分差大小排列;共 26 项。

客服与业务流程

Claude Sonnet 4.5 领先 3/4
评测项Claude Sonnet 4.5Claude Sonnet 4分差
τ²-Bench - Telecom983 / 30Thinking (With Tools)6525 / 30Thinking (With Tools)+33
τ²-Bench7126 / 44Normal (With Tools)5235 / 44Normal (With Tools)+19
τ³-Banking24.5081 / 167Thinking (With Tools)16.70102 / 167Thinking (With Tools)+7.80
SAGE32.8851 / 64Normal (With Tools)3549 / 64Normal (With Tools)-2.12

数学

Claude Sonnet 4.5 领先 1/3
评测项Claude Sonnet 4.5Claude Sonnet 4分差
FrontierMath5.2038 / 60Normal (No Tools)4.1041 / 60Normal (No Tools)+1.10
IMO-ProofBench27.108 / 16Thinking (No Tools)27.108 / 16Thinking (No Tools)持平
IMO-ProofBench Advanced4.8019 / 24Thinking (No Tools)4.8019 / 24Thinking (No Tools)持平

临床工作与医疗决策

Claude Sonnet 4.5 领先 2/2
评测项Claude Sonnet 4.5Claude Sonnet 4分差
MedScribe84.5222 / 66Normal (With Tools)72.4157 / 66Normal (With Tools)+12.11
MedCode40.5745 / 64Normal (With Tools)33.9454 / 64Normal (With Tools)+6.63

仓库修复与多文件工程

Claude Sonnet 4.5 领先 2/2
评测项Claude Sonnet 4.5Claude Sonnet 4分差
SWE-bench Verified828 / 116Parallel Thinking (With Tools)80.2014 / 116Parallel Thinking (With Tools)+1.80
SWE-Bench Pro - Public43.6054 / 62Thinking (No Tools)42.7055 / 62Thinking (No Tools)+0.90

综合知识考试

Claude Sonnet 4.5 领先 2/2
评测项Claude Sonnet 4.5Claude Sonnet 4分差
MMLU-Pro888 / 175Thinking (No Tools)8440 / 175Thinking (No Tools)+4
HLE7.10214 / 235Normal (No Tools)5.52220 / 235Normal (No Tools)+1.58

自主开发与终端任务

Claude Sonnet 4.5 领先 2/2
评测项Claude Sonnet 4.5Claude Sonnet 4分差
Terminal Bench Hard28.80116 / 244Normal (With Tools)27.30120 / 244Normal (With Tools)+1.50
Terminal-Bench2725 / 35Normal (With Tools)2626 / 35Normal (With Tools)+1

跨应用与工具编排

Claude Sonnet 4.5 领先 2/2
评测项Claude Sonnet 4.5Claude Sonnet 4分差
Claw Bench88.1013 / 29Thinking (With Tools)77.8023 / 29Thinking (With Tools)+10.30
Pinch Bench88.205 / 38Thinking (With Tools)80.5023 / 38Thinking (With Tools)+7.70

写作与创意表达

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
Creative Writing1,67833 / 110Normal (No Tools)1,48357 / 110Normal (No Tools)+194.80

图像感知与视觉推理

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
MMMU-Pro65.20153 / 229Normal (No Tools)62.40165 / 229Normal (No Tools)+2.80

抽象归纳与泛化

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
ARC-AGI-125.50169 / 193Normal (No Tools)23.80170 / 193Normal (No Tools)+1.70

指令与格式遵循

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
IF Bench57.3024 / 31Thinking (With Tools)5525 / 31Thinking (With Tools)+2.30

桌面工作流

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
OSWorld-Verified61.4024 / 28Thinking (With Tools)42.2026 / 28Thinking (With Tools)+19.20

科学知识与推理

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
GPQA Diamond73.70162 / 253Normal (No Tools)68191 / 253Normal (No Tools)+5.70

算法与竞赛编程

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
CodeClash1,3891 / 8Normal (With Tools)1,2234 / 8Normal (With Tools)+166

跨能力综合测试

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
LiveBench53.6985 / 117Normal (No Tools)50.9891 / 117Normal (No Tools)+2.71

跨行业工作评估

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Claude Sonnet 4分差
GDPval-AA3910 / 15Thinking (No Tools)3313 / 15Thinking (No Tools)+6

规格对比

字段Claude Sonnet 4.5Claude Sonnet 4
发布机构AnthropicAnthropic
发布时间2025-09-302025-05-23
模型类型聊天大模型推理大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度1000K200K
最大输出64K64K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Claude Sonnet 4.5Claude Sonnet 4
文本输入$3 / 1M tokens$3 / 1M tokens
文本输出$15 / 1M tokens$15 / 1M tokens
缓存读取$0.3 / 1M tokens$0.3 / 1M tokens
缓存写入$3.75 / 1M tokens$3.75 / 1M tokens

小结

  • Claude Sonnet 4.5在以下类目领先:客服与业务流程 (3/4)、数学 (1/3)、临床工作与医疗决策 (2/2)、仓库修复与多文件工程 (2/2)、综合知识考试 (2/2)、自主开发与终端任务 (2/2)、跨应用与工具编排 (2/2)、写作与创意表达 (1/1)、图像感知与视觉推理 (1/1)、抽象归纳与泛化 (1/1)、指令与格式遵循 (1/1)、桌面工作流 (1/1)、科学知识与推理 (1/1)、算法与竞赛编程 (1/1)、跨能力综合测试 (1/1)、跨行业工作评估 (1/1)

26 个共同 benchmark 上,Claude Sonnet 4.5 平均高出 19.52 分。

单项差距最大的 benchmark:Creative Writing — Claude Sonnet 4.5 1,678,Claude Sonnet 4 1,483(分差 +194.80)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。