DataLearner 标志

Grok 4 评测详情

Grok 4 当前已收录的代表性评测结果包括 MMLU-Pro(15 / 175,得分 87)、IOI 2024 (Vals v1)(1 / 10,得分 23.20)、IOI 2025 (Vals v1)(1 / 9,得分 29.20)。

评测结果

Grok 4

评测结果

思考模式
工具使用
联网能力

综合知识考试

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
开启思考
87
15 / 175
HLE
开启思考
25.40
133 / 235
HLE
开启思考工具
38.60
86 / 235
HLE
开启思考工具联网
38.60
86 / 235

抽象归纳与泛化

共 2 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
开启思考
66.70
117 / 193
ARC-AGI-2
开启思考
15.90
120 / 181

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
开启思考
87
70 / 253
CritPt
开启思考
2
131 / 204

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
开启思考
58.60
85 / 116

数学

共 7 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
开启思考
91.70
38 / 110
AIME2025
开启思考工具
98.80
14 / 110
IMO-ProofBench
开启思考
46.70
4 / 16
23.30
10 / 16
18.60
12 / 24
FrontierMath
常规模式
12.10
22 / 60
2.10
56 / 80

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Aider-Polyglot
思考水平·高
79.60
7 / 59
Terminal-Bench
开启思考工具
38
13 / 35
Terminal Bench Hard
开启思考工具
37.90
59 / 244

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
开启思考
60.50
36 / 96

算法与竞赛编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
IOI 2025 (Vals v1)
开启思考工具
29.20
1 / 9
IOI 2024 (Vals v1)
开启思考工具
23.20
1 / 10

跨能力综合测试

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
62.02
61 / 117

图像感知与视觉推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
开启思考
68.80
141 / 229
GeoBench ACW
常规模式
45
20 / 20

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
常规模式工具
45.73
41 / 52

跨长文理解与整合

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
常规模式
94.40
3 / 16

逻辑与规划

共 1 项评测
评测名称 / 模式
得分
排名/总数
BALROG
常规模式工具
43.60
4 / 12

能力边界度量

共 1 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
常规模式工具
110.07
13 / 22

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
146.46
66 / 167