DataLearner 标志

Gemini 2.5-Pro 评测深度分析

Gemini 2.5-Pro 当前已收录的代表性评测结果包括 MATH-500(1 / 46,得分 98.80)、Aider-Polyglot(4 / 59,得分 83.10)、MMLU-Pro(23 / 175,得分 86)。并附有 2 个数据来源链接供参考。

Gemini 2.5 Pro是谷歌发布的Gemini 2.5系列模型中最强的一个。

评测结果

Gemini 2.5-Pro

评测结果

思考模式
工具使用

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
常规模式
86
23 / 175
HLE
开启思考
21.60
149 / 235

抽象归纳与泛化

共 2 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
开启思考
37
158 / 193
ARC-AGI-2
开启思考
4.86
140 / 181

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
开启思考
86.40
73 / 253
CritPt
开启思考
2.60
125 / 204

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
54
11 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
开启思考
67.20
74 / 116

数学

共 7 项评测
评测名称 / 模式
得分
排名/总数
MATH-500
常规模式
98.80
1 / 46
AIME 2024
常规模式
92
9 / 61
AIME2025
开启思考
88
48 / 110
IMO-ProofBench
开启思考
55.20
3 / 16
17.60
14 / 24
FrontierMath
常规模式
11
23 / 60
2.10
56 / 80

算法与竞赛编程

共 4 项评测
评测名称 / 模式
得分
排名/总数
CodeClash
常规模式工具
1125
6 / 8
LiveCodeBench
常规模式
77.10
37 / 125
IOI 2024 (Vals v1)
开启思考工具
19
2 / 10
IOI 2025 (Vals v1)
开启思考工具
15.20
3 / 9

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1421.20
62 / 110

自主开发与终端任务

共 5 项评测
评测名称 / 模式
得分
排名/总数
83.10
4 / 59
Aider-Polyglot
开启思考
79.10
8 / 59
Terminal Bench 2.0
开启思考工具
32.60
48 / 48
Terminal-Bench
开启思考
25.30
28 / 35
Terminal Bench Hard
开启思考工具
25
128 / 244

图像感知与视觉推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMMU
开启思考
82
13 / 74
MMMU-Pro
开启思考
74.90
92 / 229
VPCT
常规模式
46.40
12 / 24

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
开启思考
62.40
28 / 96

指令与格式遵循

共 1 项评测
评测名称 / 模式
得分
排名/总数
IF Bench
开启思考工具
49
30 / 31

事实查找与深度检索

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
开启思考工具
7.80
57 / 58

跨能力综合测试

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
思考水平·高
58.33
78 / 117

跨行业工作评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA
开启思考
22
15 / 15

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
开启思考
46.30
87 / 134

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
开启思考工具
9.70
134 / 167
τ³-Banking
思考水平·高工具
13.66
117 / 167

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
GSO
常规模式工具
3.92
18 / 21

跨长文理解与整合

共 1 项评测
评测名称 / 模式
得分
排名/总数
Fiction.liveBench
常规模式
91.70
5 / 16

能力边界度量

共 1 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
常规模式工具
38.73
19 / 22

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
开启思考
10.20
85 / 122

数据来源