DataLearner 标志

Opus 4.5 评测详情

Opus 4.5 当前已收录的代表性评测结果包括 MMLU-Pro(2 / 175,得分 90)、SWE-bench Verified(9 / 116,得分 80.90)、SAGE(6 / 64,得分 52.09)。并附有 3 个数据来源链接供参考。

评测结果

Opus 4.5

评测结果

思考模式
工具使用

综合知识考试

共 5 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
扩展
90
2 / 175
HLE
常规模式
14.16
183 / 235
HLE
开启思考
25.20
136 / 235
HLE
扩展
30.80
112 / 235
HLE
扩展工具
43.20
70 / 235

抽象归纳与泛化

共 4 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
常规模式
40
153 / 193
ARC-AGI-1
扩展
80
99 / 193
ARC-AGI-2
常规模式
7.78
129 / 181
ARC-AGI-2
扩展
37.64
101 / 181

科学知识与推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
87
70 / 253
CritPt
常规模式
0.30
186 / 204
CritPt
开启思考
4.60
106 / 204

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
扩展工具
80.90
9 / 116

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
扩展工具
87
16 / 125

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1686.70
32 / 110

图像感知与视觉推理

共 7 项评测
评测名称 / 模式
得分
排名/总数
MMMU
unknown
80.70
15 / 74
MMMU
扩展
80.70
15 / 74
GeoBench ACW
常规模式
75
10 / 20
MMMU-Pro
常规模式
71.20
122 / 229
MMMU-Pro
开启思考
74
99 / 229
MMMU-Pro
unknown
73.90
102 / 229
VPCT
32K
40
15 / 24

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
62
29 / 96

客服与业务流程

共 6 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
思考水平·高工具
92.32
13 / 30
90.70
17 / 30
τ²-Bench
扩展工具
81.99
13 / 44
SAGE
常规模式工具
45
31 / 64
SAGE
思考水平·高工具
52.09
6 / 64
τ³-Banking
思考水平·高工具
24.74
80 / 167

数学

共 9 项评测
评测名称 / 模式
得分
排名/总数
AIME 2026
扩展
93.30
17 / 30
34.39
39 / 58
23.80
9 / 24
20.70
17 / 60
4.20
40 / 80
2.10
56 / 80
4.20
40 / 80
4.20
40 / 80

指令与格式遵循

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
扩展工具
58
23 / 31

跨能力综合测试

共 4 项评测
评测名称 / 模式
得分
排名/总数
72.58
25 / 117
LiveBench
思考水平·低
55.77
82 / 117
LiveBench
思考水平·中
59.10
74 / 117
LiveBench
思考水平·高
58.59
76 / 117

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench 2.0
扩展工具
59.30
20 / 48
Terminal Bench Hard
常规模式工具
40.90
50 / 244
Terminal Bench Hard
开启思考工具
47
26 / 244
44
36 / 244

跨应用与工具编排

共 3 项评测
评测名称 / 模式
得分
排名/总数
Claw Bench
扩展工具
91.50
7 / 29
Pinch Bench
扩展工具
87.20
9 / 38
MCP-Atlas
思考水平·高工具
69.80
31 / 44

跨长文理解与整合

共 1 项评测
评测名称 / 模式
得分
排名/总数
LongBench v2
常规模式
64.40
2 / 14

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GSO
常规模式工具
26.50
8 / 21

机器学习工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
16K工具
63.70
24 / 52
WeirdML v3
思考水平·高工具
0.07
11 / 13

综合偏好评测

共 2 项评测
评测名称 / 模式
得分
排名/总数
1479
20 / 35
1512
17 / 35

逻辑与规划

共 2 项评测
评测名称 / 模式
得分
排名/总数
BALROG
常规模式工具
43.50
5 / 12
BALROG
64K工具
43
7 / 12

能力边界度量

共 2 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
常规模式工具
293
6 / 22
288.90
7 / 22

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
Vibe Code Bench v1.1
思考水平·高工具
20.63
48 / 61

临床工作与医疗决策

共 4 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
常规模式工具
83.25
32 / 66
MedScribe
思考水平·高工具
85.32
19 / 66
MedCode
常规模式工具
45.17
28 / 64
MedCode
思考水平·高工具
49.16
16 / 64

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
150.10
45 / 167

多轮记忆与持续上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
EBR-bench
128K工具
14.29
14 / 23

数据来源