DataLearner 标志

Gemini 3.0 Pro (Preview 11-2025) 评测深度分析

Gemini 3.0 Pro (Preview 11-2025) 当前已收录的代表性评测结果包括 MMLU Pro(2 / 132,得分 90)、LiveCodeBench(2 / 123,得分 92)、GPQA Diamond(5 / 187,得分 93.80)。并附有 1 个数据来源链接供参考。

谷歌发布的Gemini 3.0系列中最强的模型

评测结果

Gemini 3.0 Pro (Preview 11-2025)

评测结果

思考模式
工具使用

综合评估

共 14 项评测
评测名称 / 模式
得分
排名/总数
93.80
5 / 187
91.90
14 / 187
91
17 / 187
90
2 / 132
87.50
20 / 68
75
27 / 68
LiveBench
思考水平·低
63.90
54 / 115
LiveBench
思考水平·高
73.39
24 / 115
45.80
40 / 172
41
60 / 172
37.50
69 / 172
37.20
70 / 172
45.10
26 / 62
31.10
32 / 62

常识问答

共 1 项评测
评测名称 / 模式
得分
排名/总数
72.10
6 / 47

编程与软件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
92
2 / 123
76.20
36 / 112

数学推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
95
25 / 107
90.60
14 / 18
38
10 / 60
18.80
16 / 80

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Simple Bench
思考模式
76.40
5 / 63

Agent能力评测

共 4 项评测
评测名称 / 模式
得分
排名/总数

指令跟随

共 2 项评测
评测名称 / 模式
得分
排名/总数
70
13 / 30
70
13 / 30

AI Agent - 信息收集

共 1 项评测
评测名称 / 模式
得分
排名/总数
59.20
38 / 53

AI Agent - 工具使用

共 3 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
常规模式工具
70.30
15 / 27
56.90
25 / 47
54.20
29 / 47

生产力知识

共 1 项评测
评测名称 / 模式
得分
排名/总数
35
18 / 21

长上下文能力

共 1 项评测
评测名称 / 模式
得分
排名/总数
71
3 / 15

OpenClaw智能体能力综合测评

共 1 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
思考模式工具
70.70
31 / 37

数据来源