DataLearner 标志

Kimi K3vsClaude Opus 4.8

在 23 个共同 benchmark 中,Kimi K3 整体领先:Kimi K3 领先 12 项,Claude Opus 4.8 领先 11 项,持平 0 项,平均分差 +8.04。

Moonshot AI
Kimi K3

Moonshot AI · 2026-07-16 · 推理大模型

Anthropic
Claude Opus 4.8

Anthropic · 2026-05-28 · 推理大模型

Kimi K312 项(52%)(48%)11 项Claude Opus 4.8

评测分数

按能力类目分组,每组内按分差大小排列;共 23 项。

法律

Kimi K3 领先 3/3
评测项Kimi K3Claude Opus 4.8分差
Harvey Lab-AA94.642 / 44Max (With Tools)91.0811 / 44Max (With Tools)+3.56
Harvey's Legal Agent Benchmark10.8310 / 43Max (With Tools)9.5812 / 43Max (With Tools)+1.25
Legal Research Bench44.2011 / 42Max (With Tools)43.7512 / 42Max (With Tools)+0.45

临床工作与医疗决策

胶着 2/2
评测项Kimi K3Claude Opus 4.8分差
MedCode48.8819 / 64Max (With Tools)53.228 / 64Max (With Tools)-4.34
MedScribe87.9610 / 66Max (With Tools)85.7517 / 66Max (With Tools)+2.21

客服与业务流程

胶着 2/2
评测项Kimi K3Claude Opus 4.8分差
SAGE54.263 / 64Max (With Tools)54.792 / 64Max (With Tools)-0.53
Public Benefits Bench v1.168.277 / 26Max (With Tools)68.138 / 26Max (With Tools)+0.14

数学

Claude Opus 4.8 领先 2/2
评测项Kimi K3Claude Opus 4.8分差
FrontierMath Tier 4 v239.0215 / 42Max (No Tools)56.1011 / 42Max (No Tools)-17.07
FrontierMath v272.1813 / 58Max (No Tools)809 / 58Max (No Tools)-7.82

科学计算与科研编程

胶着 2/2
评测项Kimi K3Claude Opus 4.8分差
SciCode59.508 / 134Max (No Tools)54.4044 / 134Max (No Tools)+5.10
Terminal-Bench-Science 0.17.1014 / 18Max (With Tools)10.5011 / 18Max (With Tools)-3.40

金融

胶着 2/2
评测项Kimi K3Claude Opus 4.8分差
EMB (Excel Modeling)66.4015 / 42Max (With Tools)69.3710 / 42Max (With Tools)-2.97
Finance Agent v254.4018 / 43Max (With Tools)53.9219 / 43Max (With Tools)+0.48

专业数据分析

Claude Opus 4.8 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
AA-AnalystAgent38.7514 / 29Max (With Tools + Internet)459 / 29Max (With Tools + Internet)-6.25

写作与创意表达

Kimi K3 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
Creative Writing2,0825 / 110Normal (No Tools)1,84018 / 110Normal (No Tools)+242.50

多轮记忆与持续上下文

Claude Opus 4.8 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
Context Arena71.7559 / 126Max (No Tools)90.0415 / 126Max (No Tools)-18.29

抽象归纳与泛化

Kimi K3 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
ARC-AGI-194.5038 / 193Max (With Tools)92.5052 / 193Max (With Tools)+2

文档与图表理解

Claude Opus 4.8 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
GDP.pdf2230 / 122Max (No Tools)22.8026 / 122Max (No Tools)-0.80

科学知识与推理

Kimi K3 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
CritPt23.4030 / 204Max (No Tools)20.9035 / 204Max (No Tools)+2.50

程序生成与编辑

Kimi K3 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
Vibe Code Bench v1.184.9610 / 61Max (With Tools)82.7213 / 61Max (With Tools)+2.24

维护、优化与工程管理

Claude Opus 4.8 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
Code Migration16.1034 / 43Max (With Tools)47.2510 / 43Max (With Tools)-31.15

跨应用与工具编排

Kimi K3 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
MCPMark-Verified94.501 / 8Max (With Tools)76.386 / 8Max (With Tools)+18.12

跨能力聚合指数

Claude Opus 4.8 领先 1/1
评测项Kimi K3Claude Opus 4.8分差
Vals Index57.8120 / 42Max (With Tools)60.9111 / 42Max (With Tools)-3.10

规格对比

字段Kimi K3Claude Opus 4.8
发布机构Moonshot AIAnthropic
发布时间2026-07-162026-05-28
模型类型推理大模型推理大模型
架构MoE 架构稠密模型
参数规模2.8万亿暂无数据
上下文长度1M1M
最大输出1M125K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Kimi K3Claude Opus 4.8
文本输入¥20 / 1M tokens$5 / 1M tokens
文本输出¥100 / 1M tokens$25 / 1M tokens
缓存读取¥2 / 1M tokens$0.5 / 1M tokens
缓存写入暂无公开价格$6.25 / 1M tokens

小结

  • Kimi K3在以下类目领先:法律 (3/3)、写作与创意表达 (1/1)、抽象归纳与泛化 (1/1)、科学知识与推理 (1/1)、程序生成与编辑 (1/1)、跨应用与工具编排 (1/1)
  • Claude Opus 4.8在以下类目领先:数学 (2/2)、专业数据分析 (1/1)、多轮记忆与持续上下文 (1/1)、文档与图表理解 (1/1)、维护、优化与工程管理 (1/1)、跨能力聚合指数 (1/1)
  • 胶着类目:临床工作与医疗决策、客服与业务流程、科学计算与科研编程、金融

23 个共同 benchmark 上,Kimi K3 平均高出 8.04 分。

单项差距最大的 benchmark:Creative Writing — Kimi K3 2,082,Claude Opus 4.8 1,840(分差 +242.50)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。