DataLearner 标志
GE

Gemini 3.5 Flash

多模态大模型工具使用Gemini FlashGemini 3.5

Gemini 3.5 Flash

发布时间: 2026-06-20更新于: 2026-08-23知识截止: 2025-01浏览量: 1,916
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1M
多语言支持
支持
推理能力
4/5

Gemini 3.5 Flash 是 Google 于 2026 年 5 月 19 日 I/O 大会发布并当天全球开放的多模态模型,API 标识 gemini-3.5-flash。由于同场宣布的 Gemini 3.5 Pro 持续跳票,它在相当长时间里实际承担了 Gemini 旗舰的角色。规格为 1,048,576 tokens 输入上下文、65,536 tokens 最大输出,知识截止 2025 年 1 月,支持文本、图像、视频、音频和 PDF 输入并输出文本,但不支持音频生成、图像生成和 Live API。官方称其每秒输出 token 数比其他前沿模型快约 4 倍。成绩方面 Terminal-Bench 2.1 76.2%、MCP Atlas 83.6%、CharXiv Reasoning 84.2%,横向榜单上强于常识推理与工具编排(SimpleBench 排 67 个模型第 4)、弱于仓库级编程(DeepSWE 37 分排 27 个第 23)。标准价每百万 tokens 输入 1.50 美元、输出 9.00 美元;但后续的 3.6 Flash 与 3.7 Flash 在更便宜的同时成绩全面更高,新项目建议直接选后两者。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Gemini 3.5 Flash

模型基本信息

推理过程
支持
思考模式
思考水平 · 高 (High) (默认)常规模式思考水平 · 低 (Low)
上下文长度
1M tokens
最大输出长度
64K tokens
模型类型
多模态大模型
输入/输出模态
文本、图像、音频、视频 → 文本
发布时间
2026-06-20
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2025-01
Gemini 3.5 Flash

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
Gemini 3.5 Flash

官方介绍与博客

DataLearnerAI博客
暂无
Gemini 3.5 Flash

API接口信息

接口速度
4/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$1.50/ 1M tokens$9.00/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—$0.150/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Gemini 3.5 Flash

评测结果

Gemini 3.5 Flash 当前已收录的代表性评测结果包括 MMMU-Pro(12 / 229,得分 84.30)、MedCode(4 / 64,得分 55.83)、GPQA Diamond(20 / 253,得分 92.80)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

抽象归纳与泛化

共 2 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
高工具
92.50
52 / 193
ARC-AGI-2
高工具
72.08
51 / 181

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
高工具
40.20
85 / 235

科学知识与推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
88.89
51 / 253
92.80
20 / 253
CritPt
常规模式
1.40
139 / 204
10.90
72 / 204
13.10
64 / 204

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
76.70
11 / 96

仓库修复与多文件工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
55.10
33 / 62
DeepSWE
中工具
37
80 / 92
DeepSWE
高工具
36.06
82 / 92

跨能力综合测试

共 1 项评测
评测名称 / 模式
得分
排名/总数
74.64
15 / 117

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench Hard
常规模式工具
46.20
29 / 244
39.40
53 / 244
40.90
50 / 244
6.60
64 / 98

多轮记忆与持续上下文

共 5 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
33.49
109 / 126
50.74
89 / 126
73.35
55 / 126
77.19
47 / 126
EBR-bench
高工具
4.76
21 / 23

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
78.40
12 / 28

跨应用与工具编排

共 2 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
高工具
83.60
7 / 44
74.17
21 / 45

跨能力聚合指数

共 3 项评测
评测名称 / 模式
得分
排名/总数

图像感知与视觉推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
80.10
43 / 229
83.90
15 / 229
84.30
12 / 229

文档与图表理解

共 3 项评测
评测名称 / 模式
得分
排名/总数
CharXiv RQ
思考模式
84.20
15 / 19
CharXiv RQ
思考模式工具
84.90
11 / 19
19.80
42 / 122

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
MLE-Bench
思考模式工具
49.70
2 / 3

长文定位与检索

共 2 项评测
评测名称 / 模式
得分
排名/总数
77.30
4 / 8
26.60
2 / 3

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
53.90
50 / 134

客服与业务流程

共 3 项评测
评测名称 / 模式
得分
排名/总数
59.47
20 / 26
SAGE
高工具
49.88
11 / 64
τ³-Banking
高工具
32.20
54 / 167

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
高工具
82.08
28 / 44
30.77
30 / 42
2.50
29 / 43

金融

共 2 项评测
评测名称 / 模式
得分
排名/总数
63.55
21 / 42
57.86
10 / 43

数学

共 3 项评测
评测名称 / 模式
得分
排名/总数
62.81
21 / 58
31
22 / 28
26.83
23 / 42

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
高工具联网
45
9 / 29

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
26.75
31 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
48.68
37 / 61

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
高工具
76.57
50 / 66
MedCode
高工具
55.83
4 / 64

和其他模型对比

Gemini 3.5 Flash

发布机构

Gemini 3.5 Flash

模型解读

被 Pro 的缺席推上主力位置的一代 Flash

Gemini 3.5 Flash(API 标识 gemini-3.5-flash)是 Google 在 2026 年 5 月 19 日 I/O 大会上随 Gemini 3.5 系列一同发布的模型,并且当天就面向全球开放——同场宣布的 Gemini 3.5 Pro 说是「下个月推出」,结果至今未见。这个背景很重要:在相当长一段时间里,3.5 Flash 实际上承担了 Gemini 系列旗舰的角色,而不只是一个「快而便宜的小号」。

Google 当时主推的卖点是打破速度与质量的取舍:官方称它在每秒输出 token 数上比其他前沿模型快约 4 倍,同时保持与更大旗舰模型可比的表现。发布即上线的渠道包括 Gemini App、Google 搜索的 AI Mode、Google Antigravity、Google AI Studio 与 Android Studio 中的 Gemini API,以及 Gemini Enterprise 系列产品。

能做什么,不能做什么

规格上,它提供 1,048,576 tokens 输入上下文与 65,536 tokens 最大输出,知识截止时间为 2025 年 1 月。输入模态相当全:文本、图像、视频、音频和 PDF;输出只有文本。

支持的能力包括思考(Thinking)、函数调用、代码执行、结构化输出、Google 搜索与 Maps grounding、上下文缓存、File Search、URL Context,以及处于预览阶段的 Computer Use。需要明确的三个「不支持」是:不能生成音频、不能生成图像、不接入 Live API——这几件事要交给 Gemini 系列里的专用模型。

评测:擅长「想清楚」和「用工具」,不擅长啃仓库

官方发布时给出的成绩是 Terminal-Bench 2.1 76.2%、MCP Atlas 83.6%、CharXiv Reasoning(多模态)84.2%、GDPval-AA 1656 Elo。后来 Gemini 3.6 Flash 的模型卡里又把它作为对照基线,补出了几个数字:SWE-Bench Pro (Public) 55.1%、DeepSWE v1.1 37%、MLE-Bench 49.7%、OSWorld-Verified 78.4%、GDPval-AA v2 1349。

把它放进 DataLearner 的横向榜单看,能力分布相当分化:常识推理与工具编排是强项——SimpleBench 76.70 在 67 个模型中排第 4,MCP-Atlas 83.60 在 38 个模型中排第 4,GPQA Diamond 92.80 在 226 个模型中排第 19;而仓库级编程和真实生产力任务是短板——DeepSWE 37 分在 27 个模型中排第 23,GDPval-AA v2 1349 在 13 个模型中排第 11。

这个反差对选型很有指导意义:让它做多步工具调用、检索问答、文档与多模态理解是合适的;指望它独立完成跨文件的仓库级重构,则会明显吃力。

价格,以及一个现实的迁移建议

Gemini Developer API 的标准价为每百万 tokens 输入 1.50 美元、输出 9.00 美元(输出含 thinking tokens),上下文缓存读取 0.15 美元。

但如果你是在今天做选型,需要知道后面发生了什么:Google 于 2026 年 7 月 21 日发布 Gemini 3.6 Flash,输出价降到 7.50 美元,且官方称在 Artificial Analysis Index 上平均少用 17% 的输出 tokens,各项对照成绩全面高于 3.5 Flash;8 月 13 日又发布 Gemini 3.7 Flash,2026 年底前推广价低至输入 0.75 美元、输出 3.75 美元。也就是说,3.5 Flash 目前在这三代 Flash 里既不是最便宜的,也不是最强的。新项目建议直接用 3.6 或 3.7 Flash,本条目更适合作为版本追溯和历史对照来看。

模型权重未公开,使用需遵守 Google Gemini API 服务条款。

官方来源

Gemini 3.5 Flash

常见问题

Gemini 3.5 Flash 是什么模型?

Gemini 3.5 Flash 是Google Deep Mind于 2026-06-20 发布的多模态大模型。支持文本、图像、视频、音频输入和文本输出,上下文窗口为 1M,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

Gemini 3.5 Flash 支持哪些输入和输出模态?

当前官方资料记录其支持文本、图像、视频、音频输入,并生成文本输出。

Gemini 3.5 Flash 的上下文窗口和最大输出是多少?

上下文窗口为 1M,最大输出为 64K。未公开或无法确认的规格不做推测。

Gemini 3.5 Flash 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、多语言相关任务;实际效果应结合具体工作流验证。

Gemini 3.5 Flash 是否提供 API,价格如何查看?

页面已收录 DeepMind 的 3 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。

Gemini 3.5 Flash 是否开源?

代码与模型权重按 不开源 记录;使用前仍应核对官方许可原文。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码