Gemini 3.6 FlashvsGrok 4.5
在 22 个共同 benchmark 中,Grok 4.5 整体领先:Gemini 3.6 Flash 领先 9 项,Grok 4.5 领先 13 项,持平 0 项,平均分差 -0.41。
Gemini 3.6 Flash
Google DeepMind · 2026-07-21 · 多模态大模型
Grok 4.5
xAI · 2026-07-08 · 编程大模型
Gemini 3.6 Flash9 项(41%)(59%)13 项Grok 4.5
评测分数
按能力类目分组,每组内按分差大小排列;共 22 项。
法律
Grok 4.5 领先 3/3| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| Legal Research Bench | 2533 / 42Thinking High (With Tools) | 37.9824 / 42Thinking High (With Tools) | -12.98 |
| Harvey's Legal Agent Benchmark | 3.3327 / 43Thinking High (With Tools) | 12.926 / 43Thinking High (With Tools) | -9.59 |
| Harvey Lab-AA | 85.1521 / 44Thinking High (With Tools) | 92.429 / 44Thinking High (With Tools) | -7.27 |
临床工作与医疗决策
胶着 2/2| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| MedCode | 53.159 / 64Thinking High (With Tools) | 43.2935 / 64Thinking High (With Tools) | +9.86 |
| MedScribe | 79.6642 / 66Thinking High (With Tools) | 86.8812 / 66Thinking High (With Tools) | -7.22 |
客服与业务流程
胶着 2/2| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| τ³-Banking | 29.9061 / 167Thinking High (With Tools) | 47.948 / 167Thinking High (With Tools) | -18.04 |
| SAGE | 48.6918 / 64Thinking High (With Tools) | 34.9750 / 64Thinking High (With Tools) | +13.72 |
数学
胶着 2/2| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| FrontierMath Tier 4 v2 | 21.9526 / 42Thinking High (No Tools) | 24.3925 / 42Thinking High (No Tools) | -2.44 |
| FrontierMath v2 | 58.9523 / 58Thinking High (No Tools) | 57.1924 / 58Thinking High (No Tools) | +1.75 |
科学知识与推理
胶着 2/2| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| CritPt | 10.6073 / 204Thinking High (No Tools) | 15.4055 / 204Thinking High (No Tools) | -4.80 |
| GPQA Diamond | 94.138 / 253Thinking High (No Tools) | 93.4315 / 253Thinking High (No Tools) | +0.69 |
金融
Gemini 3.6 Flash 领先 2/2| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| EMB (Excel Modeling) | 65.4118 / 42Thinking High (With Tools) | 52.9132 / 42Thinking High (With Tools) | +12.50 |
| Finance Agent v2 | 56.3014 / 43Thinking High (With Tools) | 48.3534 / 43Thinking High (With Tools) | +7.95 |
写作与创意表达
Gemini 3.6 Flash 领先 1/1| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| Creative Writing | 1,60441 / 110Normal (No Tools) | 1,57945 / 110Normal (No Tools) | +24.70 |
图像感知与视觉推理
Gemini 3.6 Flash 领先 1/1| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| MMMU-Pro | 83.2018 / 229Thinking High (No Tools) | 80.4039 / 229Thinking High (No Tools) | +2.80 |
文档与图表理解
Grok 4.5 领先 1/1| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| GDP.pdf | 17.4050 / 122Thinking High (No Tools) | 18.8044 / 122Thinking High (No Tools) | -1.40 |
科学计算与科研编程
Grok 4.5 领先 1/1| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| SciCode | 53.4053 / 134Thinking High (No Tools) | 5539 / 134Thinking High (No Tools) | -1.60 |
程序生成与编辑
Grok 4.5 领先 1/1| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| Vibe Code Bench v1.1 | 6430 / 61Thinking High (With Tools) | 6928 / 61Thinking High (With Tools) | -5 |
算法与竞赛编程
Grok 4.5 领先 1/1| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| IOI (Vals v2) | 35.0625 / 26Thinking High (With Tools) | 40.5622 / 26Thinking High (With Tools) | -5.50 |
维护、优化与工程管理
Grok 4.5 领先 1/1| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| Code Migration | 30.9328 / 43Thinking High (With Tools) | 36.6023 / 43Thinking High (With Tools) | -5.67 |
自主开发与终端任务
Grok 4.5 领先 1/1| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| Terminal-Bench 4.0 | 7.1061 / 98Thinking High (With Tools) | 12.4255 / 98Thinking High (With Tools) | -5.32 |
跨能力聚合指数
Gemini 3.6 Flash 领先 1/1| 评测项 | Gemini 3.6 Flash | Grok 4.5 | 分差 |
|---|---|---|---|
| Vals Index | 55.3525 / 42Thinking High (With Tools) | 51.5330 / 42Thinking High (With Tools) | +3.82 |
规格对比
| 字段 | Gemini 3.6 Flash | Grok 4.5 |
|---|---|---|
| 发布机构 | Google DeepMind | xAI |
| 发布时间 | 2026-07-21 | 2026-07-08 |
| 模型类型 | 多模态大模型 | 编程大模型 |
| 架构 | 稠密模型 | 稠密模型 |
| 参数规模 | 暂无数据 | 暂无数据 |
| 上下文长度 | 1M | 500K |
| 最大输出 | 64K | 暂无数据 |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | Gemini 3.6 Flash | Grok 4.5 |
|---|---|---|
| 文本输入 | $1.5 / 1M tokens | $2 / 1M tokens |
| 文本输出 | $7.5 / 1M tokens | $6 / 1M tokens |
| 缓存读取 | $0.15 / 1M tokens | $0.5 / 1M tokens |
小结
- Gemini 3.6 Flash在以下类目领先:金融 (2/2)、写作与创意表达 (1/1)、图像感知与视觉推理 (1/1)、跨能力聚合指数 (1/1)
- Grok 4.5在以下类目领先:法律 (3/3)、文档与图表理解 (1/1)、科学计算与科研编程 (1/1)、程序生成与编辑 (1/1)、算法与竞赛编程 (1/1)、维护、优化与工程管理 (1/1)、自主开发与终端任务 (1/1)
- 胶着类目:临床工作与医疗决策、客服与业务流程、数学、科学知识与推理
22 个共同 benchmark 上,Grok 4.5 平均高出 0.41 分。
单项差距最大的 benchmark:Creative Writing — Gemini 3.6 Flash 1,604,Grok 4.5 1,579(分差 +24.70)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。