DataLearner 标志

Claude Sonnet 4.5vsGemini 2.5-Pro

在 16 个共同 benchmark 中,Gemini 2.5-Pro 整体领先:Claude Sonnet 4.5 领先 7 项,Gemini 2.5-Pro 领先 8 项,持平 1 项,平均分差 +32.29。

Anthropic
Claude Sonnet 4.5

Anthropic · 2025-09-30 · 聊天大模型

Google DeepMind
Gemini 2.5-Pro

Google DeepMind · 2025-06-05 · 推理大模型

Claude Sonnet 4.57 项(44%)持平1(50%)8 项Gemini 2.5-Pro

评测分数

按能力类目分组,每组内按分差大小排列;共 16 项。

数学

Gemini 2.5-Pro 领先 3/4
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
IMO-ProofBench27.108 / 16Thinking (No Tools)55.203 / 16Thinking (No Tools)-28.10
IMO-ProofBench Advanced4.8019 / 24Thinking (No Tools)17.6014 / 24Thinking (No Tools)-12.80
FrontierMath5.2038 / 60Normal (No Tools)1123 / 60Normal (No Tools)-5.80
FrontierMath - Tier 42.1056 / 80Normal (No Tools)2.1056 / 80Normal (No Tools)持平

图像感知与视觉推理

Gemini 2.5-Pro 领先 2/2
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
VPCT3820 / 24Normal (No Tools)46.4012 / 24Normal (No Tools)-8.40
MMMU77.8023 / 74Thinking (No Tools)8213 / 74Thinking (No Tools)-4.20

事实查找与深度检索

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
BrowseComp24.1056 / 58Thinking (With Tools)7.8057 / 58Thinking (With Tools)+16.30

写作与创意表达

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
Creative Writing1,67833 / 110Normal (No Tools)1,42162 / 110Normal (No Tools)+256.40

指令与格式遵循

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
IF Bench57.3024 / 31Thinking (With Tools)4930 / 31Thinking (With Tools)+8.30

文档与图表理解

Gemini 2.5-Pro 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
GDP.pdf5.2099 / 122Thinking (No Tools)10.2085 / 122Thinking (No Tools)-5

科学知识与推理

Gemini 2.5-Pro 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
CritPt1.10151 / 204Thinking (No Tools)2.60125 / 204Thinking (No Tools)-1.50

科学计算与科研编程

Gemini 2.5-Pro 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
SciCode45.7090 / 134Thinking (No Tools)46.3087 / 134Thinking (No Tools)-0.60

算法与竞赛编程

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
CodeClash1,3891 / 8Normal (With Tools)1,1256 / 8Normal (With Tools)+264

维护、优化与工程管理

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
GSO14.7012 / 21Normal (With Tools)3.9218 / 21Normal (With Tools)+10.78

自主开发与终端任务

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
Terminal Bench 2.042.8043 / 48Thinking (With Tools)32.6048 / 48Thinking (With Tools)+10.20

跨行业工作评估

Claude Sonnet 4.5 领先 1/1
评测项Claude Sonnet 4.5Gemini 2.5-Pro分差
GDPval-AA3910 / 15Thinking (No Tools)2215 / 15Thinking (No Tools)+17

规格对比

字段Claude Sonnet 4.5Gemini 2.5-Pro
发布机构AnthropicGoogle DeepMind
发布时间2025-09-302025-06-05
模型类型聊天大模型推理大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度1000K1000K
最大输出64K64K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Claude Sonnet 4.5Gemini 2.5-Pro
文本输入$3 / 1M tokens$1.25 / 1M tokens
文本输出$15 / 1M tokens$10 / 1M tokens
缓存读取$0.3 / 1M tokens$0.125 / 1M tokens
缓存写入$3.75 / 1M tokens暂无公开价格

小结

  • Claude Sonnet 4.5在以下类目领先:事实查找与深度检索 (1/1)、写作与创意表达 (1/1)、指令与格式遵循 (1/1)、算法与竞赛编程 (1/1)、维护、优化与工程管理 (1/1)、自主开发与终端任务 (1/1)、跨行业工作评估 (1/1)
  • Gemini 2.5-Pro在以下类目领先:数学 (3/4)、图像感知与视觉推理 (2/2)、文档与图表理解 (1/1)、科学知识与推理 (1/1)、科学计算与科研编程 (1/1)

16 个共同 benchmark 上,Claude Sonnet 4.5 平均高出 32.29 分。

单项差距最大的 benchmark:CodeClash — Claude Sonnet 4.5 1,389,Gemini 2.5-Pro 1,125(分差 +264)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。