DataLearner 标志

Claude Opus 4.8vsGemini 3.1 Pro Preview

在 7 个共同 benchmark 中,Claude Opus 4.8 整体领先:Claude Opus 4.8 领先 4 项,Gemini 3.1 Pro Preview 领先 3 项,持平 0 项,平均分差 +62.37。

Anthropic
Claude Opus 4.8

Anthropic · 2026-05-28 · 推理大模型

Google DeepMind
Gemini 3.1 Pro Preview

Google DeepMind · 2026-02-20 · 多模态大模型

Claude Opus 4.84 项(57%)(43%)3 项Gemini 3.1 Pro Preview

评测分数

按能力类目分组,每组内按分差大小排列;共 7 项。

事实查找与深度检索

Gemini 3.1 Pro Preview 领先 1/1
评测项Claude Opus 4.8Gemini 3.1 Pro Preview分差
BrowseComp84.3012 / 58Thinking High (With Tools + Internet)85.908 / 58Thinking High (With Tools + Internet)-1.60

写作与创意表达

Claude Opus 4.8 领先 1/1
评测项Claude Opus 4.8Gemini 3.1 Pro Preview分差
Creative Writing1,84018 / 110Normal (No Tools)1,49156 / 110Normal (No Tools)+348.50

常识推理

Gemini 3.1 Pro Preview 领先 1/1
评测项Claude Opus 4.8Gemini 3.1 Pro Preview分差
SimpleBench64.8024 / 96Normal (No Tools)79.609 / 96Normal (No Tools)-14.80

机器学习工程

Gemini 3.1 Pro Preview 领先 1/1
评测项Claude Opus 4.8Gemini 3.1 Pro Preview分差
WeirdML v270.4518 / 52Normal (With Tools)72.1017 / 52Normal (With Tools)-1.65

综合偏好评测

Claude Opus 4.8 领先 1/1
评测项Claude Opus 4.8Gemini 3.1 Pro Preview分差
Text Arena (Coding)1,5459 / 35Normal (No Tools)1,46123 / 35Normal (No Tools)+83.56

自主开发与终端任务

Claude Opus 4.8 领先 1/1
评测项Claude Opus 4.8Gemini 3.1 Pro Preview分差
Terminal-Bench 2.178.8831 / 57Thinking High (With Tools)65.8446 / 57Thinking High (With Tools)+13.04

跨应用与工具编排

Claude Opus 4.8 领先 1/1
评测项Claude Opus 4.8Gemini 3.1 Pro Preview分差
PinchBench v290.542 / 45Reported best (effort unspecified)81.019 / 45Reported best (effort unspecified)+9.53

规格对比

字段Claude Opus 4.8Gemini 3.1 Pro Preview
发布机构AnthropicGoogle DeepMind
发布时间2026-05-282026-02-20
模型类型推理大模型多模态大模型
架构稠密模型稠密模型
参数规模暂无数据暂无数据
上下文长度1M1M
最大输出125K64K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Claude Opus 4.8Gemini 3.1 Pro Preview
文本输入$5 / 1M tokens$2 / 1M tokens
文本输出$25 / 1M tokens$12 / 1M tokens
缓存读取$0.5 / 1M tokens$0.2 / 1M tokens
缓存写入$6.25 / 1M tokens暂无公开价格

小结

  • Claude Opus 4.8在以下类目领先:写作与创意表达 (1/1)、综合偏好评测 (1/1)、自主开发与终端任务 (1/1)、跨应用与工具编排 (1/1)
  • Gemini 3.1 Pro Preview在以下类目领先:事实查找与深度检索 (1/1)、常识推理 (1/1)、机器学习工程 (1/1)

7 个共同 benchmark 上,Claude Opus 4.8 平均高出 62.37 分。

单项差距最大的 benchmark:Creative Writing — Claude Opus 4.8 1,840,Gemini 3.1 Pro Preview 1,491(分差 +348.50)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。