DataLearner 标志

Gemini 3.0 FlashvsHaiku 4.5

在 7 个共同 benchmark 中,Gemini 3.0 Flash 整体领先:Gemini 3.0 Flash 领先 6 项,Haiku 4.5 领先 1 项,持平 0 项,平均分差 +9.24。

Google DeepMind
Gemini 3.0 Flash

Google DeepMind · 2025-12-17 · 聊天大模型

Anthropic
Haiku 4.5

Anthropic · 2025-10-15 · 多模态大模型

Gemini 3.0 Flash6 项(86%)(14%)1 项Haiku 4.5

评测分数

按能力类目分组,每组内按分差大小排列;共 7 项。

跨应用与工具编排

Gemini 3.0 Flash 领先 3/4
评测项Gemini 3.0 FlashHaiku 4.5分差
MCP-Atlas6236 / 44Normal (With Tools)40.2044 / 44Normal (With Tools)+21.80
PinchBench v272.0624 / 45Reported best (effort unspecified)67.7028 / 45Reported best (effort unspecified)+4.36
Claw Bench85.7015 / 29Thinking (With Tools)89.4011 / 29Thinking (With Tools)-3.70
Pinch Bench85.2017 / 38Thinking (With Tools)8222 / 38Thinking (With Tools)+3.20

图像感知与视觉推理

Gemini 3.0 Flash 领先 1/1
评测项Gemini 3.0 FlashHaiku 4.5分差
MMMU-Pro78.6055 / 229Normal (No Tools)55.10190 / 229Normal (No Tools)+23.50

自主开发与终端任务

Gemini 3.0 Flash 领先 1/1
评测项Gemini 3.0 FlashHaiku 4.5分差
Terminal Bench Hard31.80100 / 244Normal (With Tools)27.30120 / 244Normal (With Tools)+4.50

跨能力综合测试

Gemini 3.0 Flash 领先 1/1
评测项Gemini 3.0 FlashHaiku 4.5分差
LiveBench56.3581 / 117Normal (No Tools)45.33105 / 117Normal (No Tools)+11.02

规格对比

字段Gemini 3.0 FlashHaiku 4.5
发布机构Google DeepMindAnthropic
发布时间2025-12-172025-10-15
模型类型聊天大模型多模态大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度2000K200K
最大输出64K64K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Gemini 3.0 FlashHaiku 4.5
文本输入$0.5 / 1M tokens$1 / 1M tokens
文本输出$3 / 1M tokens$5 / 1M tokens
缓存读取$0.05 / 1M tokens$0.1 / 1M tokens
缓存写入暂无公开价格$1.25 / 1M tokens

小结

  • Gemini 3.0 Flash在以下类目领先:跨应用与工具编排 (3/4)、图像感知与视觉推理 (1/1)、自主开发与终端任务 (1/1)、跨能力综合测试 (1/1)

7 个共同 benchmark 上,Gemini 3.0 Flash 平均高出 9.24 分。

单项差距最大的 benchmark:MMMU-Pro — Gemini 3.0 Flash 78.60,Haiku 4.5 55.10(分差 +23.50)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。