DataLearner 标志

Gemini 3.5 Flash 评测深度分析

Gemini 3.5 Flash 首次在编程和 Agent 基准上压过自家 Pro 模型。本文分析其 Agent 能力跃升、速度优势与定价陷阱,并给出明确的选用建议。

Gemini 3.5 Flash 是 Google 第一次让 Flash 系列在编程和 Agent 基准上正面碾压自家 Pro 模型。它的意义不在于"便宜的凑合选择",而在于重新定义了什么叫"旗舰速度级模型"。代价是:价格是上代 Flash 的三倍,学术推理能力在同价位竞品中垫底。


"Flash 压倒 Pro"的含义

Gemini 系列历来的分工逻辑是:Pro 负责能力天花板,Flash 负责速度与成本。3.5 Flash 打破了这个分工。

在 Terminal Bench 2.1 上,3.5 Flash 得分 76.2%,而 Gemini 3.1 Pro 仅为 70.3%——一个轻量版本在代码基准上领先自家旗舰整整 6 个百分点。这在 Gemini 系列历史上是第一次。MCP Atlas(模型调用工具的能力评测)结果类似,3.5 Flash 以 83.6% 超过 3.1 Pro 的 78.2%。

这意味着:如果你的工作负载是编程辅助或 Agent 任务,等待下个月 3.5 Pro 上线再做决策,不一定比现在直接用 3.5 Flash 更明智。


Agent 能力:从相对弱项到行业前列

Gemini 系列长期在 Agent 能力上落后于 Claude 和 GPT。3.5 Flash 是一次实质性扭转。

第三方独立测评机构 Artificial Analysis 的 GDPval-AA(真实世界多步骤 Agent 任务)显示,3.5 Flash 达到 1656 Elo,而 Gemini 3.0 Flash 仅 1204、Gemini 3.1 Pro 仅 1314。单次迭代的 Elo 跃升幅度超过了 3 Flash 到 3.1 Pro 的整个代际提升。从 DataLearner 收录的 OSWorld-Verified 数据看,78.4% 的得分已与 Anthropic Opus 4.7(78.0%)持平,仅小幅落后于 GPT-5.5(78.7%)。

幻觉率是 Agent 能力的重要支撑指标。Artificial Analysis 的 AA-Omniscience 评测显示,3.5 Flash 的幻觉率从 Gemini 3 Flash 的 92% 大幅下降至 61%,降幅达 31 个百分点。幻觉率的下降直接提高了多轮工具调用的可靠性——这是 Agent 场景的核心诉求。


速度优势是真实的,但定价逻辑已改变

3.5 Flash 的输出速度超过每秒 280 个 token,是 GPT-5.5 和 Opus 4.7(约 60–70 token/秒)的四倍。这个速度差距在实时交互场景和高并发 Agent 调度中具有实际价值,不只是纸面数据。

但速度优势需要对照定价重新理解。Gemini 3.5 Flash 的标准定价为输入 $1.5、输出 $9(每百万 token),是 Gemini 3 Flash($0.5/$3)的三倍。Artificial Analysis 的测算显示,跑完同一套完整评测集,3.5 Flash 的综合成本是 Gemini 3 Flash 的 5.5 倍——差值不全来自定价,一半来自 Agent 任务中更长的多轮上下文导致 token 用量激增。

这意味着从 3 Flash 迁移到 3.5 Flash 时,预算估算不能简单按"价格涨三倍"来算,实际账单增幅可能更高。Google 提供 90% 的缓存折扣,这对大量复用系统提示的 Agent 架构是实质性补偿,但对每次调用上下文都不同的场景帮助有限。

相对于跨厂商竞品,价格优势是真实的:$1.5/$9 对比 GPT-5.5 的 $5/$30 和 Opus 4.7 的 $5/$25,综合到位成本确实接近三分之一。


多模态:Google 仍然是唯一的全能选手

在 DataLearner 收录的竞品对比框架中,Claude Opus 4.7、Grok 4.3 和 GPT-5.5 均只支持图像输入。Gemini 3.5 Flash 原生支持图像、视频和语音输入,这不是边缘特性,而是对需要处理非结构化多模态数据的企业场景的结构性优势。

在 Artificial Analysis 的 MMMU-Pro 多模态理解评测中,3.5 Flash 得分 84%,是当前全榜最高分,第二名是同系列的 Gemini 3.1 Pro(82%)。CharXiv Reasoning(图表理解与推理)84.2% 同样领先全场。


弱项不应被掩盖

HLE(Humanity's Last Exam,极高难度的学术推理综合题)是 3.5 Flash 的明显短板。DataLearner 收录的 40.2% 不仅是本页竞品中的最低分(Sonnet 4.6 为 49.0%,Opus 4.7 为 54.7%,GPT-5.5 为 52.2%),也低于上代 Gemini 3.0 Flash 的 43.5%——这是一个罕见的代际下滑。

Artificial Analysis 的综合智力指数(Intelligence Index)给 3.5 Flash 打了 55 分,高于 Grok 4.3(53 分)和 Claude Sonnet 4.6(52 分),但低于 Opus 4.7(57 分)和 GPT-5.5(60 分)。在分项结构上,学术推理和长文档精确召回是相对薄弱环节。

这不是挑剔。如果你的业务场景是复杂文档分析、法律条文解读、需要精确长文本推理的工作流,3.5 Flash 目前不是最优选择,应等待 3.5 Pro 或继续使用 Gemini 3.1 Pro。


谁适合用,谁应该等

适合现在切换到 3.5 Flash 的场景:
多步骤 Agent 工作流、编程辅助与代码生成、需要高吞吐量的实时交互场景、涉及图像/视频/语音输入的多模态任务、对成本敏感但不愿接受明显能力妥协的应用。

建议等待或保持现有方案的场景:
依赖高难度学术推理的研究工具(等 3.5 Pro)、对长文档精确召回要求极高的法律/合规场景(等 3.5 Pro)、仍在使用 Gemini 3.0 Flash 且 Agent 需求不强的轻量级用例(直接升级的成本回报比需要重新评估)。


代际跨度真正有多大

Gemini 3.5 Flash 的版本号从 3.0 到 3.5,时间间隔约五个月。ARC-AGI-2 数据是最直观的跨代指标:3.5 Flash 72.1%,Gemini 3.0 Flash 33.6%,提升超过 38 个百分点,几乎翻倍。Terminal Bench 2.0 的提升同样显著:76.2% vs. 3.0 Flash 的 47.6%。

这不是正常的迭代幅度。从外部信息推测,3.5 Flash 的 Agent 能力提升幅度来自训练策略的方向性调整,而非单纯的参数扩大——这与 Google 将其定位为"frontier intelligence with action"的产品叙事一致。


DataLearner 编辑判断

Gemini 3.5 Flash 是 2026 年 5 月前后性价比最优的 Agent 和编程模型,没有之一。它在旗舰对比中没有全面领先,但在速度-智力-价格三维帕累托前沿上占据了此前从未有过的位置。

Google 把这个版本定义为"一系列将前沿智力与行动力结合的模型中的第一个"——如果下个月的 3.5 Pro 延续这个方向,2026 年下半年的大模型格局可能会比现在有趣很多。

评测结果

Gemini 3.5 Flash

评测结果

思考模式
工具使用
联网能力

抽象归纳与泛化

共 2 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
高工具
92.50
52 / 193
ARC-AGI-2
高工具
72.08
51 / 181

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
高工具
40.20
85 / 235

科学知识与推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
88.89
51 / 253
92.80
20 / 253
CritPt
常规模式
1.40
139 / 204
CritPt
思考水平·中
10.90
72 / 204
13.10
64 / 204

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
76.70
11 / 96

仓库修复与多文件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
55.10
33 / 62
DeepSWE
思考水平·中工具
37
80 / 92
DeepSWE
高工具
36.06
82 / 92

跨能力综合测试

共 1 项评测
评测名称 / 模式
得分
排名/总数
74.64
15 / 117

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench Hard
常规模式工具
46.20
29 / 244
Terminal Bench Hard
思考水平·中工具
39.40
53 / 244
40.90
50 / 244
6.60
64 / 98

多轮记忆与持续上下文

共 5 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
33.49
109 / 126
50.74
89 / 126
Context Arena
思考水平·中
73.35
55 / 126
77.19
47 / 126
EBR-bench
高工具
4.76
21 / 23

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
78.40
12 / 28

跨应用与工具编排

共 2 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
高工具
83.60
7 / 44
74.17
21 / 45

跨能力聚合指数

共 3 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
154.55
30 / 167
Vals Index
高工具
53.08
28 / 42
44.79
31 / 36

图像感知与视觉推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
80.10
43 / 229
MMMU-Pro
思考水平·中
83.90
15 / 229
84.30
12 / 229

文档与图表理解

共 3 项评测
评测名称 / 模式
得分
排名/总数
CharXiv RQ
开启思考
84.20
15 / 19
CharXiv RQ
开启思考工具
84.90
11 / 19
19.80
42 / 122

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
MLE-Bench
开启思考工具
49.70
2 / 3

长文定位与检索

共 2 项评测
评测名称 / 模式
得分
排名/总数
77.30
4 / 8
26.60
2 / 3

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
53.90
50 / 134

客服与业务流程

共 3 项评测
评测名称 / 模式
得分
排名/总数
59.47
20 / 26
SAGE
高工具
49.88
11 / 64
τ³-Banking
高工具
32.20
54 / 167

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
高工具
82.08
28 / 44
30.77
30 / 42
2.50
29 / 43

金融

共 2 项评测
评测名称 / 模式
得分
排名/总数
63.55
21 / 42
57.86
10 / 43

数学

共 3 项评测
评测名称 / 模式
得分
排名/总数
62.81
21 / 58
31
22 / 28
26.83
23 / 42

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
高工具联网
45
9 / 29

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
26.75
31 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
48.68
37 / 61

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
高工具
76.57
50 / 66
MedCode
高工具
55.83
4 / 64

竞品对比

Gemini 3.5 Flash 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项Gemini 3.5 Flash当前Claude Sonnet 4.6Opus 4.7GPT-5.5
ARC-AGI-1
Score (%)
抽象归纳与泛化
92.50思考水平·高 | 工具
86.50思考水平·高 | 工具
93.50思考水平·高
95.00思考水平·极高
ARC-AGI-2
Score (% solved); cost per task (USD)
抽象归纳与泛化
72.08思考水平·高 | 工具
60.42思考水平·高 | 工具
75.80思考水平·高
85.00思考水平·极高
HLE
Accuracy
综合知识考试
40.20思考水平·高 | 工具
49.00开启思考 | 工具
54.70扩展思考 | 工具
52.20思考水平·高 | 工具
CritPt
Score
科学知识与推理
13.10思考水平·高
3.10思考水平·高
12.00思考水平·高
27.10思考水平·极高
GPQA Diamond
Accuracy
科学知识与推理
92.80思考水平·高
89.90开启思考
94.20扩展思考
94.00思考水平·极高
SimpleBench
Score (AVG@5)
常识推理
76.70常规模式
--
61.70常规模式
69.00常规模式
DeepSWE
Pass@1 (DeepSWE v1.1)
仓库修复与多文件工程
37.00思考水平·中 | 工具
29.93思考水平·高 | 工具
--
67.04思考水平·极高 | 工具
SWE-Bench Pro - Public
Accuracy
仓库修复与多文件工程
55.10思考水平·高 | 工具
--
64.30扩展思考 | 工具
58.60思考水平·高 | 工具
LiveBench
Accuracy
跨能力综合测试
74.64思考水平·高
75.32思考水平·高
76.53深度思考模式
79.91深度思考模式
Terminal Bench Hard
Accuracy
自主开发与终端任务
46.20常规模式 | 工具
53.00思考水平·高 | 工具
54.50常规模式 | 工具
60.60思考水平·极高 | 工具
Terminal-Bench 4.0
Resolution rate (%)
自主开发与终端任务
6.60思考水平·高 | 工具
3.00思考水平·高 | 工具
--
14.60思考水平·极高 | 工具
Context Arena
Accuracy (8 needles, 4K-128K context)
多轮记忆与持续上下文
77.19思考水平·高
82.82思考水平·高
46.70思考水平·低
94.18思考水平·极高
其余 24 个 benchmark 仍可在上方图表中查看。

Gemini 3.5 Flash 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

模型供应商标准输入标准输出标准价适用于
Gemini 3.5 Flash
Google DeepMind$1.5 / 1M tokens$9 / 1M tokens—
Claude Sonnet 4.6
Anthropic$3 / 1M tokens$15 / 1M tokens—
Opus 4.7
Anthropic$5 / 1M tokens$25 / 1M tokens—
GPT-5.5
OpenAI$5 / 1M tokens$30 / 1M tokens—

历代版本对比

Gemini 3.5 Flash 系列各版本的评测成绩纵向对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项Gemini 3.5 Flash当前Gemini 3.0 FlashGemini 2.5 Flash
ARC-AGI-1
Score (%)
抽象归纳与泛化
92.50思考水平·高 | 工具
--
32.30常规模式
ARC-AGI-2
Score (% solved); cost per task (USD)
抽象归纳与泛化
72.08思考水平·高 | 工具
33.60开启思考
--
HLE
Accuracy
综合知识考试
40.20思考水平·高 | 工具
43.50开启思考 | 工具
12.08思考水平·高
CritPt
Score
科学知识与推理
13.10思考水平·高
8.60开启思考
1.40常规模式
GPQA Diamond
Accuracy
科学知识与推理
92.80思考水平·高
90.40开启思考
82.80开启思考
SimpleBench
Score (AVG@5)
常识推理
76.70常规模式
61.10常规模式
41.20常规模式
SWE-Bench Pro - Public
Accuracy
仓库修复与多文件工程
55.10思考水平·高 | 工具
49.60思考水平·高 | 工具
--
LiveBench
Accuracy
跨能力综合测试
74.64思考水平·高
72.40思考水平·高
47.74思考水平·高
Terminal Bench Hard
Accuracy
自主开发与终端任务
46.20常规模式 | 工具
38.60开启思考 | 工具
13.60开启思考 | 工具
MCP-Atlas
Pass rate / claim coverage
跨应用与工具编排
83.60思考水平·高 | 工具
62.00常规模式 | 工具
--
PinchBench v2
Average score (%)
跨应用与工具编排
74.17思考水平·高
72.06思考水平·高
--
ECI
ECI score (capability index, higher is better)
跨能力聚合指数
154.55思考水平·高
151.83思考水平·高
--
其余 5 个 benchmark 仍可在上方图表中查看。

单评测历史趋势图

当前查看:ARC-AGI-1 · 抽象归纳与泛化

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

Gemini 3.5 Flash 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

模型供应商标准输入标准输出标准价适用于
Gemini 3.5 Flash
Google DeepMind$1.5 / 1M tokens$9 / 1M tokens—
Gemini 3.0 Flash
Google DeepMind$0.5 / 1M tokens$3 / 1M tokens—
Gemini 2.5 Flash
Google DeepMind$0.3 / 1M tokens$2.5 / 1M tokens—

数据来源