DataLearner 标志

Grok 4.5 评测详情

Grok 4.5 当前已收录的代表性评测结果包括 τ³-Banking(8 / 167,得分 47.94)、GPQA Diamond(15 / 253,得分 93.43)、SWE-Bench Pro - Public(8 / 62,得分 64.70)。本页还提供与 6 个竞品模型及 3 个前代或同系列模型的对比,在有数据时会展示性能和价格视图。

评测结果

Grok 4.5

评测结果

思考模式
工具使用
联网能力

抽象归纳与泛化

共 9 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
低工具
79.17
100 / 193
ARC-AGI-1
中工具
87.17
81 / 193
ARC-AGI-1
高工具
85.67
93 / 193
ARC-AGI-2
低工具
33.06
105 / 181
ARC-AGI-2
中工具
52.64
90 / 181
ARC-AGI-2
高工具
52.64
90 / 181
0.26
35 / 51
0.32
32 / 51
0.30
33 / 51

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
93.43
15 / 253
15.40
55 / 204

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1578.80
45 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
70
19 / 96

仓库修复与多文件工程

共 4 项评测
评测名称 / 模式
得分
排名/总数
64.70
8 / 62
DeepSWE
高工具
53.76
60 / 92
APEX-SWE
高工具
53.60
3 / 3
SWE-Marathon
高工具
29
6 / 7

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
79.33
30 / 57
66.70
5 / 5
15.70
9 / 11
12.42
55 / 98

跨能力聚合指数

共 5 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
154.02
33 / 167
Vals Index
高工具
51.53
30 / 42
44.72
32 / 36
38.81
21 / 29

跨应用与工具编排

共 2 项评测
评测名称 / 模式
得分
排名/总数
75.21
19 / 45
APEX-Agents
高工具
47.10
4 / 7

图像感知与视觉推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
80.40
39 / 229

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
55
39 / 134

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
高工具
47.94
8 / 167
SAGE
高工具
34.97
50 / 64

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
高工具
92.42
9 / 44
37.98
24 / 42
12.92
6 / 43

金融

共 2 项评测
评测名称 / 模式
得分
排名/总数
52.91
32 / 42
48.35
34 / 43

数学

共 3 项评测
评测名称 / 模式
得分
排名/总数
57.19
24 / 58
31
22 / 28
24.39
25 / 42

程序生成与编辑

共 2 项评测
评测名称 / 模式
得分
排名/总数
69
28 / 61
56.60
6 / 7

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
18.80
44 / 122

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
高工具联网
35
15 / 29

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
36.60
23 / 43

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
高工具
40.56
22 / 26

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
高工具
86.88
12 / 66
MedCode
高工具
43.29
35 / 64

竞品对比

Grok 4.5 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项Grok 4.5当前GPT-5.6 SolClaude Fable 5GLM-5.2Claude Sonnet 5GPT-5.6 TerraKimi K3
ARC-AGI-1
Score (%)
抽象归纳与泛化
87.17思考水平·中 | 工具
97.50思考水平·极高
98.50思考水平·极高 | 工具
--
--
96.50思考水平·高
94.50思考水平·高 | 工具
ARC-AGI-2
Score (% solved); cost per task (USD)
抽象归纳与泛化
52.64思考水平·高 | 工具
92.50思考水平·高
89.17思考水平·高
--
--
83.90思考水平·高
60.42思考水平·高 | 工具
ARC-AGI-3 (Standard)
Action efficiency score(按相同评测环境比较,越高越好)
抽象归纳与泛化
0.32思考水平·中
7.78思考水平·高
--
--
--
0.80思考水平·高
--
CritPt
Score
科学知识与推理
15.40思考水平·高
32.30思考水平·高
28.60思考水平·高
20.90思考水平·高
16.90思考水平·高
30.00思考水平·高
23.40思考水平·高
GPQA Diamond
Accuracy
科学知识与推理
93.43思考水平·高
94.60思考水平·高
85.86思考水平·高
91.86思考水平·高
90.53思考水平·极高
93.31思考水平·高
91.92思考水平·高
Creative Writing
Elo、大模型评判两两对战
写作与创意表达
1578.80常规模式
1971.60常规模式
1943.10常规模式
1756.50常规模式
1794.00常规模式
1854.90常规模式
2082.30常规模式
SimpleBench
Score (AVG@5)
常识推理
70.00思考水平·高
64.80思考水平·极高
81.90常规模式
58.80常规模式
60.60常规模式
48.90思考水平·极高
60.70思考水平·高
APEX-SWE
Pass@1
仓库修复与多文件工程
53.60思考水平·高 | 工具
--
58.80思考水平·高 | 工具
--
--
--
--
DeepSWE
Pass@1 (DeepSWE v1.1)
仓库修复与多文件工程
53.76思考水平·高 | 工具
72.70思考水平·极高 | 工具
69.91深度思考模式 | 工具
44.00深度思考模式 | 工具
54.00深度思考模式 | 工具
69.62思考水平·高 | 工具
68.51思考水平·高 | 工具
SWE-Bench Pro - Public
Accuracy
仓库修复与多文件工程
64.70思考水平·高 | 工具
64.60思考水平·极高 | 工具
80.30深度思考模式 | 工具
62.10开启思考 | 工具
--
--
--
SWE-Marathon
Resolution rate (Pass@1)
仓库修复与多文件工程
29.00思考水平·高 | 工具
--
--
13.00思考水平·高 | 工具
--
--
42.00思考水平·高 | 工具
CursorBench 3.2
Score
自主开发与终端任务
66.70思考水平·高 | 工具
67.20思考水平·高 | 工具
70.50思考水平·高 | 工具
--
--
--
--
其余 29 个 benchmark 仍可在上方图表中查看。

Grok 4.5 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。

这些模型的价格币种或计费单位不一致,暂不直接绘制统一柱状图,以下展示原始价格。

Grok 4.5
供应商: xAI
标准输入: $2 / 1M tokens
标准输出: $6 / 1M tokens
GPT-5.6 Sol
供应商: OpenAI
标准输入: $4 / 1M tokens
标准输出: $20 / 1M tokens
Claude Fable 5
供应商: Anthropic
标准输入: $10 / 1M tokens
标准输出: $50 / 1M tokens
GLM-5.2
供应商: 智谱AI
标准输入: $1.4 / 1M tokens
标准输出: $4.4 / 1M tokens
Claude Sonnet 5
供应商: Anthropic
标准输入: $2 / 1M tokens
标准输出: $10 / 1M tokens
GPT-5.6 Terra
供应商: OpenAI
标准输入: $2 / 1M tokens
标准输出: $12 / 1M tokens
Kimi K3
供应商: Moonshot AI
标准输入: ¥20 / 1M tokens
标准输出: ¥100 / 1M tokens
模型供应商标准输入标准输出标准价适用于
Grok 4.5
xAI$2 / 1M tokens$6 / 1M tokens—
GPT-5.6 Sol
OpenAI$4 / 1M tokens$20 / 1M tokens—
Claude Fable 5
Anthropic$10 / 1M tokens$50 / 1M tokens—
GLM-5.2
智谱AI$1.4 / 1M tokens$4.4 / 1M tokens—
Claude Sonnet 5
Anthropic$2 / 1M tokens$10 / 1M tokens—
GPT-5.6 Terra
OpenAI$2 / 1M tokens$12 / 1M tokens—
Kimi K3
Moonshot AI¥20 / 1M tokens¥100 / 1M tokens—

历代版本对比

Grok 4.5 系列各版本的评测成绩纵向对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项Grok 4.5当前Grok 4.20Grok 4.3 Beta
CritPt
Score
科学知识与推理
15.40思考水平·高
--
8.00思考水平·高
GPQA Diamond
Accuracy
科学知识与推理
93.43思考水平·高
--
88.83思考水平·高
Creative Writing
Elo、大模型评判两两对战
写作与创意表达
1578.80常规模式
1573.60常规模式
--
ECI
ECI score (capability index, higher is better)
跨能力聚合指数
154.02思考水平·高
152.01思考水平·高
149.13思考水平·高
Vals Index
跨行业任务准确率综合指数
跨能力聚合指数
51.53思考水平·高 | 工具
17.55开启思考 | 工具
--
PinchBench v2
Average score (%)
跨应用与工具编排
75.21思考水平·高
80.33思考水平·高
73.73思考水平·高
MMMU-Pro
Accuracy
图像感知与视觉推理
80.40思考水平·高
--
78.10思考水平·高
SciCode
Score
科学计算与科研编程
55.00思考水平·高
--
48.30思考水平·高
SAGE
Accuracy (%)
客服与业务流程
34.97思考水平·高 | 工具
38.24开启思考 | 工具
--
τ³-Banking
Score
客服与业务流程
47.94思考水平·高 | 工具
18.00思考水平·高 | 工具
12.40思考水平·高 | 工具
Harvey Lab-AA
Criterion pass rate (some entries report all-pass rate)
法律
92.42思考水平·高 | 工具
--
68.39思考水平·高 | 工具
37.98思考水平·高 | 工具
13.94开启思考 | 工具
--
其余 10 个 benchmark 仍可在上方图表中查看。

单评测历史趋势图

当前查看:CritPt · 科学知识与推理

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

Grok 4.5 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

若存在上下文阈值,图中标准价仅适用于以下范围:

Grok 4.20: 标准价适用于 <= 200000
Grok 4.3 Beta: 标准价适用于 <= 200000
模型供应商标准输入标准输出标准价适用于
Grok 4.5
xAI$2 / 1M tokens$6 / 1M tokens—
Grok 4.20
xAI$1.25 / 1M tokens$2.5 / 1M tokens<= 200000
Grok 4.3 Beta
xAI$1.25 / 1M tokens$2.5 / 1M tokens<= 200000