DataLearner 标志

Claude Sonnet 4 评测详情

Claude Sonnet 4 当前已收录的代表性评测结果包括 SWE-bench Verified(14 / 112,得分 80.20)、Terminal-Bench(10 / 35,得分 41.30)、MMLU Pro(38 / 132,得分 84)。并附有 1 个数据来源链接供参考。

评测结果

Claude Sonnet 4

评测结果

思考模式
工具使用

综合评估

共 12 项评测
评测名称 / 模式
得分
排名/总数
84
38 / 132
83.80
62 / 187
75.40
97 / 187
68
128 / 187
LiveBench
常规模式
50.98
89 / 115
61.27
65 / 115
40
49 / 68
23.80
56 / 68
9.60
149 / 172
5.52
163 / 172
5.90
46 / 62
1.30
55 / 62

编程与软件工程

共 6 项评测
评测名称 / 模式
得分
排名/总数
CodeClash
常规模式工具
1223
4 / 8
80.20
14 / 112
72.70
51 / 112
66
59 / 123
48.50
96 / 123

数学推理

共 12 项评测
评测名称 / 模式
得分
排名/总数
85
51 / 107
70.50
72 / 107
38
96 / 107
43.40
50 / 62
27.10
8 / 16
9.70
5 / 10
5.20
8 / 10
4.10
41 / 60
4
5 / 9
3.30
6 / 9
0
72 / 80

写作和创作

共 1 项评测
评测名称 / 模式
得分
排名/总数
83.05
14 / 23

AI Agent - 工具使用

共 4 项评测
评测名称 / 模式
得分
排名/总数
42.20
22 / 24
41.30
10 / 35
35.50
18 / 35

多模态理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
76.50
17 / 29

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Simple Bench
开启思考
45.50
34 / 63

Agent能力评测

共 4 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
常规模式
56.40
26 / 59
61.30
20 / 59
52
34 / 43

指令跟随

共 1 项评测
评测名称 / 模式
得分
排名/总数
55
23 / 30

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
33
19 / 21

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
65
12 / 15

OpenClaw智能体能力综合测评

共 2 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
开启思考工具
80.50
22 / 37
Claw Bench
开启思考工具
77.80
23 / 29

数据来源