DataLearner 标志

Kimi K3vsGPT-5.6 Sol

Kimi K3 与 GPT-5.6 Sol 在 30 个共同 benchmark 中整体接近:Kimi K3 领先 15 项,GPT-5.6 Sol 领先 15 项,持平 0 项,平均分差 -2.45。

Moonshot AI
Kimi K3

Moonshot AI · 2026-07-16 · 推理大模型

OpenAI
GPT-5.6 Sol

OpenAI · 2026-06-26 · 推理大模型

Kimi K315 项(50%)(50%)15 项GPT-5.6 Sol

评测分数

按能力类目分组,每组内按分差大小排列;共 30 项。

法律

Kimi K3 领先 2/3
评测项Kimi K3GPT-5.6 Sol分差
Harvey's Legal Agent Benchmark10.8310 / 43Max (With Tools)2.5029 / 43Max (With Tools)+8.33
Harvey Lab-AA94.642 / 44Max (With Tools)87.1817 / 44Max (With Tools)+7.46
Legal Research Bench44.2011 / 42Max (With Tools)48.087 / 42Max (With Tools)-3.88

跨应用与工具编排

Kimi K3 领先 2/3
评测项Kimi K3GPT-5.6 Sol分差
APEX-Agents415 / 7Max (With Tools)56.703 / 7Max (With Tools)-15.70
MCPMark-Verified94.501 / 8Max (With Tools)92.912 / 8Max (With Tools)+1.59
MCP-Atlas82.309 / 44Max (With Tools)81.8013 / 44Max (With Tools)+0.50

金融

Kimi K3 领先 2/3
评测项Kimi K3GPT-5.6 Sol分差
EMB (Excel Modeling)66.4015 / 42Max (With Tools)72.345 / 42Max (With Tools)-5.94
Tax Agent Bench68.677 / 20Max (With Tools)67.958 / 20Max (With Tools)+0.72
Finance Agent v254.4018 / 43Max (With Tools)53.7621 / 43Max (With Tools)+0.64

临床工作与医疗决策

Kimi K3 领先 2/2
评测项Kimi K3GPT-5.6 Sol分差
MedCode48.8819 / 64Max (With Tools)43.9732 / 64Max (With Tools)+4.91
MedScribe87.9610 / 66Max (With Tools)85.2320 / 66Max (With Tools)+2.73

图像感知与视觉推理

GPT-5.6 Sol 领先 2/2
评测项Kimi K3GPT-5.6 Sol分差
ZeroBench Main414 / 6Max (With Tools)531 / 6Max (With Tools)-12
BabyVision85.705 / 9Max (With Tools)88.904 / 9Max (With Tools)-3.20

客服与业务流程

Kimi K3 领先 2/2
评测项Kimi K3GPT-5.6 Sol分差
Public Benefits Bench v1.168.277 / 26Max (With Tools)66.5110 / 26Max (With Tools)+1.76
SAGE54.263 / 64Max (With Tools)52.564 / 64Max (With Tools)+1.70

数学

胶着 2/2
评测项Kimi K3GPT-5.6 Sol分差
FrontierMath v272.1813 / 58Max (No Tools)89.121 / 58Max (No Tools)-16.94
ProofBench v1.1 (Lean 4)876 / 28Max (With Tools)837 / 28Max (With Tools)+4

程序生成与编辑

胶着 2/2
评测项Kimi K3GPT-5.6 Sol分差
Program Bench17.5012 / 15Max (With Tools)238 / 15Max (With Tools)-5.50
Vibe Code Bench v1.184.9610 / 61Max (With Tools)80.5017 / 61Max (With Tools)+4.46

专业数据分析

GPT-5.6 Sol 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
AA-AnalystAgent38.7514 / 29Max (With Tools + Internet)47.507 / 29Max (With Tools + Internet)-8.75

仓库修复与多文件工程

Kimi K3 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
NL2Repo-Bench586 / 16Max (With Tools)56.809 / 16Max (With Tools)+1.20

写作与创意表达

Kimi K3 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
Creative Writing2,0825 / 110Normal (No Tools)1,9729 / 110Normal (No Tools)+110.70

办公与文档流程

Kimi K3 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
AutomationBench46.7010 / 25Max (With Tools)45.8011 / 25Max (With Tools)+0.90

多轮记忆与持续上下文

GPT-5.6 Sol 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
Context Arena71.7559 / 126Max (No Tools)97.632 / 126Max (No Tools)-25.88

文档与图表理解

GPT-5.6 Sol 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
Chartography68.108 / 11Max (With Tools)79.904 / 11Max (With Tools)-11.80

漏洞发现与分析

GPT-5.6 Sol 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
CyberGym808 / 11Max (With Tools)84.505 / 11Max (With Tools)-4.50

科学计算与科研编程

GPT-5.6 Sol 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
Terminal-Bench-Science 0.17.1014 / 18Max (With Tools)22.406 / 18Max (With Tools)-15.30

算法与竞赛编程

GPT-5.6 Sol 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
IOI (Vals v2)48.9418 / 26Max (With Tools)91.173 / 26Max (With Tools)-42.23

维护、优化与工程管理

GPT-5.6 Sol 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
Code Migration16.1034 / 43Max (With Tools)52.927 / 43Max (With Tools)-36.82

自主开发与终端任务

GPT-5.6 Sol 领先 1/1
评测项Kimi K3GPT-5.6 Sol分差
Terminal-Bench 3.017.708 / 11Max (With Tools)34.402 / 11Max (With Tools)-16.70

规格对比

字段Kimi K3GPT-5.6 Sol
发布机构Moonshot AIOpenAI
发布时间2026-07-162026-06-26
模型类型推理大模型推理大模型
架构MoE 架构稠密模型
参数规模2.8万亿暂无数据
上下文长度1M1.05M
最大输出1M128K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项Kimi K3GPT-5.6 Sol
文本输入¥20 / 1M tokens$4 / 1M tokens
文本输出¥100 / 1M tokens$20 / 1M tokens
缓存读取¥2 / 1M tokens$0.4 / 1M tokens
缓存写入暂无公开价格$5 / 1M tokens

小结

  • Kimi K3在以下类目领先:法律 (2/3)、跨应用与工具编排 (2/3)、金融 (2/3)、临床工作与医疗决策 (2/2)、客服与业务流程 (2/2)、仓库修复与多文件工程 (1/1)、写作与创意表达 (1/1)、办公与文档流程 (1/1)
  • GPT-5.6 Sol在以下类目领先:图像感知与视觉推理 (2/2)、专业数据分析 (1/1)、多轮记忆与持续上下文 (1/1)、文档与图表理解 (1/1)、漏洞发现与分析 (1/1)、科学计算与科研编程 (1/1)、算法与竞赛编程 (1/1)、维护、优化与工程管理 (1/1)、自主开发与终端任务 (1/1)
  • 胶着类目:数学、程序生成与编辑

30 个共同 benchmark 上,GPT-5.6 Sol 平均高出 2.45 分。

单项差距最大的 benchmark:Creative Writing — Kimi K3 2,082,GPT-5.6 Sol 1,972(分差 +110.70)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。