DataLearner 标志

Claude Sonnet 3.7 评测详情

Claude Sonnet 3.7 当前已收录的代表性评测结果包括 Aider-Polyglot(18 / 59,得分 64.90)、MMMU(33 / 74,得分 75)、SWE-bench Verified(61 / 116,得分 70.30)。并附有 1 个数据来源链接供参考。

评测结果

Claude Sonnet 3.7

评测结果

思考模式
工具使用

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
开启思考
10.30
195 / 235

科学知识与推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
68
191 / 253
GPQA Diamond
开启思考
77
150 / 253
CritPt
开启思考
0.90
162 / 204

仓库修复与多文件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式工具
62.30
80 / 116
SWE-bench Verified
开启思考工具
70.30
61 / 116

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
常规模式
82.20
43 / 46
AIME2025
常规模式
54.80
93 / 110
AIME 2024
常规模式
23.30
58 / 61
FrontierMath
常规模式
3.10
46 / 60
FrontierMath
开启思考
4.10
41 / 60

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1411.70
67 / 110

图像感知与视觉推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMMU
unknown
75
33 / 74
GeoBench ACW
常规模式
68
14 / 20
MMMU-Pro
常规模式
60.10
177 / 229
VPCT
常规模式
39
18 / 24
VPCT
64K
35
22 / 24

常识推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
44.90
64 / 96
SimpleBench
开启思考
46.40
59 / 96

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
60.40
21 / 59
64.90
18 / 59
Terminal Bench Hard
常规模式工具
21.20
145 / 244
Terminal Bench Hard
开启思考工具
21
148 / 244

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
开启思考工具
61.80
31 / 44
τ²-Bench - Telecom
开启思考工具
55
27 / 30

跨行业工作评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA
开启思考
28
14 / 15

跨长文理解与整合

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
开启思考
61
5 / 6
Fiction.liveBench
常规模式
50
16 / 16

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
开启思考工具
28
28 / 28

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GSO
常规模式工具
3.80
19 / 21

能力边界度量

共 2 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
常规模式工具
60.39
16 / 22
56.09
17 / 22

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
141.16
92 / 167

数据来源