DataLearner 标志
GE

Gemini 3.8 Flash

多模态大模型编程大模型Gemini FlashGemini 3.8

Gemini 3.8 Flash

别名:gemini-3.8-flash / Gemini 3.8 / Skimaki / Gemini 3.8 Flash Preview / gemini-3.8-flash-preview

发布时间: 2026-09-02更新于: 2026-09-02浏览量: 1,107
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1M
多语言支持
暂无数据
推理能力
4/5

Google 于 2026 年 9 月 2 日正式 GA 的多模态 Flash 模型,稳定 API ID 为 gemini-3.8-flash,提供 1M 上下文、64K 最大输出和 low/medium/high 思考档位,面向长周期软件工程、自主 Agent 与复杂企业工作流。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Gemini 3.8 Flash

模型基本信息

推理过程
支持
思考模式
思考水平 · 中 (Medium) (默认)思考水平 · 低 (Low)思考水平 · 高 (High)
上下文长度
1M tokens
最大输出长度
64K tokens
模型类型
多模态大模型
输入/输出模态
文本、图像、音频、视频 → 文本
发布时间
2026-09-02
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
Gemini 3.8 Flash

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
Gemini 3.8 Flash

官方介绍与博客

DataLearnerAI博客
暂无
Gemini 3.8 Flash

API接口信息

接口速度
4/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.750/ 1M tokens$3.75/ 1M tokens
批量模式
类型适用条件输入输出
文本-$0.375/ 1M tokens$1.88/ 1M tokens
flex
类型适用条件输入输出
文本-$0.375/ 1M tokens$1.88/ 1M tokens
priority
类型适用条件输入输出
文本-$1.35/ 1M tokens$6.75/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—$0.037/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Gemini 3.8 Flash

评测结果

Gemini 3.8 Flash 当前已收录的代表性评测结果包括 ARC-AGI-1(1 / 193,得分 98.50)、MMMU-Pro(4 / 229,得分 85.60)、Finance Agent v2(2 / 43,得分 61.40)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

抽象归纳与泛化

共 12 项评测
评测名称 / 模式
得分
排名/总数
90.50
69 / 193
97.50
11 / 193
98.50
1 / 193
77.50
43 / 181
82.92
39 / 181
89.17
18 / 181
5.99
15 / 51
10.37
12 / 51

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
54.90
1 / 6
HLE
unknown
44.52
62 / 235

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1747.90
26 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
82.40
5 / 96

自主开发与终端任务

共 7 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
思考模式工具
89.40
4 / 57
37.30
19 / 43
39.60
16 / 43
10.10
58 / 98
19.70
39 / 98
19.09
41 / 98
19.70
39 / 98

仓库修复与多文件工程

共 5 项评测
评测名称 / 模式
得分
排名/总数
94.86
7 / 10
DeepSWE
中工具
71.02
16 / 92
DeepSWE
思考模式工具
73.70
7 / 92
DeepSWE
高工具
73.83
6 / 92
58.80
9 / 11

跨能力聚合指数

共 4 项评测
评测名称 / 模式
得分
排名/总数

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld 2.0
思考模式工具
59
10 / 14

图像感知与视觉推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
84.50
11 / 229
84.20
13 / 229
85.60
4 / 229

文档与图表理解

共 4 项评测
评测名称 / 模式
得分
排名/总数
86.20
8 / 19
18.60
45 / 122
22.80
26 / 122
21
33 / 122

科学知识与推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
36.49
5 / 13
4
110 / 204
12.30
67 / 204
18.30
45 / 204

科学计算与科研编程

共 4 项评测
评测名称 / 模式
得分
排名/总数
55
39 / 134
55.10
38 / 134
56.60
24 / 134
12.40
10 / 18

客服与业务流程

共 5 项评测
评测名称 / 模式
得分
排名/总数
65.29
13 / 26
τ³-Banking
低工具
33.20
51 / 167
τ³-Banking
中工具
45.80
14 / 167
τ³-Banking
高工具
44.90
17 / 167
SAGE
高工具
35.06
48 / 64

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
72.20
6 / 42
66.77
9 / 20
Finance Agent v2
思考模式工具
61.40
2 / 43

法律

共 2 项评测
评测名称 / 模式
得分
排名/总数
38.94
21 / 42

视频理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
87.10
3 / 5
LVBench
中工具
87.80
2 / 5

生物与基因

共 3 项评测
评测名称 / 模式
得分
排名/总数
88.80
1 / 2
LABBench2
中工具联网
86.20
2 / 3
56.50
1 / 2

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数

编码综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
41.90
11 / 11

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
36.55
24 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
78.65
19 / 61

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
高工具
56.94
12 / 26

数学

共 1 项评测
评测名称 / 模式
得分
排名/总数
48
20 / 28

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
高工具
84.50
23 / 66
MedCode
高工具
48.13
22 / 64

和其他模型对比

Gemini 3.8 Flash

发布机构

Gemini 3.8 Flash

模型解读

正式发布

Gemini 3.8 Flash 已于 2026 年 9 月 2 日正式 GA,稳定 API ID 为 gemini-3.8-flash。Google 称它是目前最智能的 Flash 模型,针对长周期软件工程、自主 Agent 和复杂企业工作流优化。发布前的媒体报道曾披露内部代号 Skimaki;这个代号不是公开 API ID。

规格与输入输出

官方开发文档给出的输入上下文窗口为 1,048,576 tokens,最大输出为 65,536 tokens。输入支持文本、图像、视频、音频和 PDF,输出为文本。模型支持上下文缓存、代码执行、Computer Use(Preview)、File Search、函数调用、Google Search 与 Maps grounding、结构化输出和 URL Context;Batch、Flex 与 Priority 推理也已支持。

思考模式与 Agent

Gemini 3.8 Flash 支持 low、medium、high 三档 thinking level,默认值为 medium;minimal 不受支持并会返回错误。Google 表示该模型会在长时间、复杂任务上用更细的推理步骤迭代调用工具并验证结果,因此复杂任务可能消耗更多 tokens。Gemini Managed Agents 的 Antigravity agent 与 SDK 已默认使用 3.8 Flash。

官方发布评测

Google 发布资料列出:DeepSWE v1.1 73.7%、GDPval-AA v2 1545 Elo、Vals Finance Agent v2 61.4%、Harvey's Legal Agent Benchmark 10.0%、Terminal-Bench 2.1 89.4%、Terminal-Bench 4.0 19.1%、GDP.pdf 35.0%、CharXiv Reasoning(无工具)86.2%、LVBench agentic/static 87.8% / 87.1%、HLE-Verified 54.9%、OSWorld 2.0 partial 59.0%、BioMysteryBench human-solvable / human-difficult 88.8% / 56.5%,以及 LABBench2 86.2%。

官方方法说明指出,Gemini 成绩除特别标注外均为 pass@1,并使用 gemini-3.8-flash 的默认采样设置;较小评测会通过多次试验取平均。DeepSWE 采用 mini-swe Agent harness 与 high thinking;Terminal-Bench 2.1 使用 Terminus 2;LVBench 不使用工具,Gemini 使用 1,024 帧;OSWorld 2.0 为三次运行取最高值的 partial score。不同项目的工具、脚手架、运行次数与评分尺度不同,只适合在相同基准和条件下比较。

价格

Gemini Developer API 在 2026 年 12 月 31 日前使用推广价格:Standard 档每百万 tokens 输入 $0.75、输出 $3.75(包含 thinking tokens)、缓存读取 $0.075;Batch 与 Flex 档分别为 $0.375 / $1.875 / $0.0375;Priority 档分别为 $1.35 / $6.75 / $0.135。2027 年 1 月 1 日起以上价格翻倍。缓存存储和 Grounding 请求另行计费。

已知边界

Google 尚未公开模型参数量、训练算力、权重或知识截止时间。DataLearner 不从 Gemini 3.7 Flash 复制这些字段,也不把发布前媒体报道中的内部偏好测试当作独立 benchmark。

官方来源

Gemini 3.8 Flash

常见问题

Gemini 3.8 Flash 已经正式发布了吗?

是。Google Gemini API 发布日志记录它于 2026 年 9 月 2 日正式 GA,稳定 API ID 为 gemini-3.8-flash。

Gemini 3.8 Flash 的上下文和思考档位是什么?

官方规格为 1,048,576 tokens 输入上下文和 65,536 tokens 最大输出,支持 low、medium、high 三档 thinking level,默认 medium;不支持 minimal。

Gemini 3.8 Flash 的 API 价格是多少?

截至 2026 年 12 月 31 日,Standard 推广价为每百万 tokens 输入 0.75 美元、输出 3.75 美元,缓存读取 0.075 美元;2027 年 1 月 1 日起分别调整为 1.50、7.50 和 0.15 美元。

Gemini 3.8 Flash 的参数量和知识截止时间是多少?

Google 尚未公开参数量、权重架构、训练算力或知识截止时间,本站不从 Gemini 3.7 Flash 推断这些字段。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码