DataLearner 标志

Opus 4.1 评测详情

Opus 4.1 当前已收录的代表性评测结果包括 MMLU-Pro(8 / 175,得分 88)、Terminal-Bench(5 / 35,得分 46.50)、IOI 2024 (Vals v1)(3 / 10,得分 18.70)。并附有 1 个数据来源链接供参考。

评测结果

Opus 4.1

评测结果

思考模式
工具使用

综合知识考试

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
扩展
88
8 / 175
HLE
常规模式
7.92
210 / 235
HLE
开启思考
11.52
188 / 235

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
81
122 / 253

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
扩展工具
74.50
41 / 116

数学

共 7 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
扩展
78
69 / 110
12.63
56 / 58
FrontierMath
常规模式
5.90
35 / 60
7.20
33 / 60
4.20
40 / 80
4.20
40 / 80

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
46.50
5 / 35
Terminal-Bench
扩展工具
43.30
9 / 35
Terminal Bench Hard
开启思考工具
34.30
81 / 244
32
98 / 244

图像感知与视觉推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMMU
unknown
77.10
27 / 74
MMMU-Pro
开启思考
67.90
145 / 229

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
60
38 / 96

算法与竞赛编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
IOI 2024 (Vals v1)
常规模式工具
18.70
3 / 10
IOI 2025 (Vals v1)
常规模式工具
6.40
4 / 9

指令与格式遵循

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
扩展工具
55
25 / 31

跨能力综合测试

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
54.45
84 / 117
61.81
62 / 117

临床工作与医疗决策

共 4 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
常规模式工具
71.75
59 / 66
MedScribe
开启思考工具
73.90
55 / 66
MedCode
常规模式工具
41.37
40 / 64
MedCode
开启思考工具
47.23
26 / 64

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SAGE
常规模式工具
31.38
54 / 64
SAGE
开启思考工具
30.39
58 / 64

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
144.11
81 / 167

多轮记忆与持续上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
EBR-bench
常规模式工具
7.94
20 / 23

数据来源