DataLearner 标志
KI

Kimi K3

推理大模型编程大模型KimiKimi K3

Kimi K3

发布时间: 2026-07-16更新于: 2026-08-31浏览量: 13,005
模型参数
2.8万亿
上下文长度
1M
多语言支持
支持
推理能力
5/5

Moonshot AI 于 2026 年 7 月 16 日发布的旗舰模型,2.8 万亿总参数 / 1040 亿激活的 MoE 架构,1M 上下文与 1M 最大输出,权重按 Kimi K3 License 在 Hugging Face 开放(MXFP4 精度约 1.42 TiB、96 个分片)。支持文本、图像、视频输入。它的定位非常清晰:智能体与专业生产力任务。在 DataLearner 已收录的 55 条成绩中拿下 14 个第一,包括 BrowseComp 91.20(54 个模型)、Toolathlon-Verified 76.50、MCPMark-Verified 94.50、FrontierSWE 81.20、Program Bench 77.80、Harvey Lab-AA 94.60、MathVision 97.80,以及 CorpFin v2、Office QA Pro、Finance Agent v2、Legal Research Bench、SpreadsheetBench 2 等一批垂直办公评测。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Kimi K3

模型基本信息

推理过程
支持
思考模式
思考水平 · 最高 (Max) (默认)思考水平 · 低 (Low)思考水平 · 高 (High)
上下文长度
1M tokens
最大输出长度
1M tokens
模型类型
推理大模型
输入/输出模态
文本、图像、视频 → 文本
发布时间
2026-07-16
模型文件大小
约 1.42 TiB(MXFP4,96 个 Safetensors 分片)
MoE架构
是
总参数 / 激活参数
2.8万亿 / 1040亿
知识截止
暂无数据
Kimi K3

开源和体验地址

代码开源状态
预训练权重开源
Kimi K3 License- 有条件免费商用授权
在线体验
Kimi K3

官方介绍与博客

DataLearnerAI博客
暂无
Kimi K3

API接口信息

接口速度
2/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-¥20.00/ 1M tokens¥100.00/ 1M tokens
international
类型适用条件输入输出
文本-$3.00/ 1M tokens$15.00/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—$0.300/ 1M tokens
文本-—¥2.00/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Kimi K3

评测结果

Kimi K3 当前已收录的代表性评测结果包括 BrowseComp(2 / 58,得分 91.20)、HLE(10 / 235,得分 59.80)、Harvey Lab-AA(2 / 44,得分 94.64)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

抽象归纳与泛化

共 6 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
低工具
65.67
118 / 193
ARC-AGI-1
高工具
86.67
85 / 193
ARC-AGI-1
最高工具
94.50
38 / 193
ARC-AGI-2
低工具
12.36
123 / 181
ARC-AGI-2
高工具
55
84 / 181
ARC-AGI-2
最高工具
60.42
74 / 181

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
HLE
最高
43.50
67 / 235
HLE
最高工具
59.80
10 / 235

科学知识与推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
84.85
89 / 253
91.92
24 / 253
3.10
114 / 204
CritPt
最高
23.40
30 / 204

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
2082.30
5 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
60.70
34 / 96

事实查找与深度检索

共 2 项评测
评测名称 / 模式
得分
排名/总数
DeepSearchQA
最高工具联网
95
1 / 3
BrowseComp
最高工具联网
91.20
2 / 58

多轮记忆与持续上下文

共 3 项评测
评测名称 / 模式
得分
排名/总数
58.20
78 / 126
65.97
71 / 126
71.75
59 / 126

桌面工作流

共 2 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
最高工具
84.80
2 / 28
OSWorld 2.0
最高工具
58.30
11 / 14

跨应用与工具编排

共 6 项评测
评测名称 / 模式
得分
排名/总数
MCPMark-Verified
最高工具
94.50
1 / 8
MCP-Atlas
最高工具
82.30
9 / 44
76.50
4 / 14
Job Bench
最高工具
54.30
8 / 8
APEX-Agents
最高工具
41
5 / 7
Agents' Last Exam
最高工具
27.60
13 / 24

仓库修复与多文件工程

共 6 项评测
评测名称 / 模式
得分
排名/总数
SWE-Bench Pro V2
最高工具
97.70
3 / 10
88.20
4 / 11
FrontierSWE
最高工具
81.20
1 / 4
DeepSWE
最高工具
68.51
28 / 92
NL2Repo-Bench
最高工具
58
6 / 16
SWE-Marathon
最高工具
42
4 / 7

跨能力聚合指数

共 4 项评测
评测名称 / 模式
得分
排名/总数

程序生成与编辑

共 3 项评测
评测名称 / 模式
得分
排名/总数
84.96
10 / 61
72.90
1 / 3
Program Bench
最高工具
17.50
12 / 15

机器学习工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
MLS Bench
最高工具
48.30
2 / 6
PostTrain Bench
最高工具
36.60
3 / 5

办公与文档流程

共 3 项评测
评测名称 / 模式
得分
排名/总数
Office QA Pro
最高工具
63.30
3 / 5
SaaS-Bench
最高工具
60.10
1 / 1
AutomationBench
最高工具
46.70
10 / 25

专业数据分析

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
最高工具联网
38.75
14 / 29
SpreadsheetBench 2
最高工具
34.80
1 / 2

图像感知与视觉推理

共 10 项评测
评测名称 / 模式
得分
排名/总数
94.30
5 / 12
MathVision
最高工具
97.80
1 / 12
BabyVision
最高工具
85.70
5 / 9
78.50
59 / 229
MMMU-Pro
最高
80.50
37 / 229
MMMU-Pro
最高工具
83.40
16 / 229
58.50
1 / 1
23
6 / 6
ZeroBench Main
最高工具
41
4 / 6

文档与图表理解

共 6 项评测
评测名称 / 模式
得分
排名/总数
84.80
12 / 19
CharXiv RQ
最高工具
91.30
1 / 19
91.10
1 / 3
Chartography
最高工具
68.10
8 / 11
18.60
45 / 122
GDP.pdf
最高
22
30 / 122

科学计算与科研编程

共 4 项评测
评测名称 / 模式
得分
排名/总数
52.70
56 / 134
SciCode
最高
59.50
8 / 134
SciCode
最高工具
58.70
13 / 134
7.10
14 / 18

研究报告与综述

共 1 项评测
评测名称 / 模式
得分
排名/总数
ResearchRubrics
最高工具联网
76.20
1 / 1

客服与业务流程

共 4 项评测
评测名称 / 模式
得分
排名/总数
68.27
7 / 26
SAGE
最高工具
54.26
3 / 64
τ³-Banking
低工具
41.60
27 / 167
τ³-Banking
最高工具
37.11
41 / 167

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
最高工具
94.64
2 / 44
44.20
11 / 42
10.83
10 / 43

金融

共 4 项评测
评测名称 / 模式
得分
排名/总数
CorpFin v2
最高工具
71.60
1 / 1
Tax Agent Bench
最高工具
68.67
7 / 20
66.40
15 / 42
Finance Agent v2
最高工具
54.40
18 / 43

视频理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
90
1 / 1
MMVU
最高
82.10
1 / 2

漏洞发现与分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
CyberGym
最高工具
80
8 / 11

数学

共 4 项评测
评测名称 / 模式
得分
排名/总数
87
6 / 28
72.18
13 / 58
65.60
4 / 17
39.02
15 / 42

综合偏好评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
1681.75
2 / 35

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 3.0
最高工具
17.70
8 / 11
12.60
52 / 98
Terminal-Bench 4.0
最高工具
12.60
52 / 98

编码综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
51.90
7 / 11

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
最高工具
16.10
34 / 43

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
最高工具
48.94
18 / 26

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
最高工具
87.96
10 / 66
MedCode
最高工具
48.88
19 / 64

跨能力综合测试

共 1 项评测
评测名称 / 模式
得分
排名/总数
SuperCLUE
unknown
70.68
5 / 13

和其他模型对比

Kimi K3

发布机构

Kimi K3

模型解读

Kimi K3 与开放权重

Kimi K3 是 Moonshot AI 于 2026 年 7 月 16 日发布的原生多模态智能体旗舰模型。官方称其为首个开放的 3T 级模型:总参数量 2.8T、每 token 激活约 104B 参数,支持 1,048,576 tokens 上下文。完整模型权重、推理代码与技术报告已于北京时间 2026 年 7 月 28 日开放,可从 Hugging Face 和 GitHub 获取。

架构与技术规格

K3 采用 Stable LatentMoE:共 93 层,其中 1 个稠密层;注意力层由 69 层 Kimi Delta Attention(KDA)和 24 层 Gated MLA 组成。模型拥有 896 个路由专家,每个 token 选择 16 个专家,另有 2 个共享专家;隐藏维度为 7168,96 个注意力头,词表规模约 160K。视觉编码器为 401M 参数的 MoonViT-V2。

模型从 SFT 阶段开始采用量化感知训练,发布权重为 MXFP4,激活为 MXFP8。Hugging Face 仓库包含 96 个 Safetensors 分片,权重及相关大文件约 1.42 TiB。官方推荐 vLLM、SGLang 与 TokenSpeed 作为推理引擎。

能力与 API

K3 面向长周期软件工程、知识工作、深度推理和视觉任务,支持文本、图像和视频输入以及文本输出。API 支持函数与工具调用、严格 JSON Schema 结构化输出、Partial Mode、动态工具加载、自动上下文缓存,以及 OpenAI/Anthropic 兼容调用方式。

K3 始终启用思考,reasoning_effort 支持 low、high、max 三档,默认 max。多轮对话和工具调用必须原样回传上一轮完整 assistant message,包括 reasoning_content 与 tool_calls。

官方评测

官方开放权重模型卡给出的评测表相当完整:共 45 个基准、50 条成绩,其中 5 组同时提供无工具与工具增强两个结果。所有 K3 成绩均使用 max reasoning effort 与 temperature=1.0;单步推理和无工具视觉任务采用 top_p=0.95,智能体任务采用 top_p=1.0。代表性结果包括 GPQA Diamond 93.5、DeepSWE 67.5、Terminal-Bench 2.1 88.3、BrowseComp 91.2、MCPMark-Verified 94.5、OSWorld-Verified 84.8、OmniDocBench 91.1。

价格与访问条件

官方 API 按每百万 tokens 计费:中国区缓存命中输入 ¥2、缓存未命中输入 ¥20、输出 ¥100;国际区分别为 $0.30、$3、$15。K3 API 需账户成功充值至少 1 美元后解锁,账户等级决定并发和速率限制。

Kimi K3 License

代码、权重、配置与相关文档均采用 Kimi K3 License。该许可允许使用、复制、修改、分发、再许可、销售、部署和微调,但须保留版权与许可声明并遵守适用法律。若许可方或关联方经营 MaaS 且任意连续 12 个月总收入超过 2,000 万美元,商业使用前须与 Moonshot AI 另签协议;若商业产品月活超过 1 亿或月收入超过 2,000 万美元,界面须显著展示“Kimi K3”。内部使用、官方产品和认证推理合作伙伴适用例外条款。

使用限制

  • API 的 temperature=1.0、top_p=0.95、n=1、presence_penalty=0 和 frequency_penalty=0 为固定值。
  • 视觉输入不支持直接使用公网图片 URL,应使用 base64 或已上传文件的 ms:// 地址。
  • 官方 Web Search 正在更新,当前不建议用于生产工作流。
  • 自部署需要极高的存储、显存、互联和推理引擎适配成本,开放权重不等于普通工作站可运行。

官方资料

Hugging Face 权重与模型卡 · GitHub 代码与技术报告 · 官方技术博客 · API 快速开始 · 官方价格

Kimi K3

常见问题

Kimi K3 的权重开源了吗?用什么许可?

权重已在 Hugging Face 开放,采用 Kimi K3 License——这是自定义许可而非 Apache 2.0、MIT 这类标准开源协议,商用前需要核对条款。官方同时开放了 GitHub 仓库和技术报告 PDF。发布的权重为 MXFP4 精度,约 1.42 TiB、拆成 96 个 Safetensors 分片,属于多机集群部署级别。

Kimi K3 最擅长什么?

智能体和专业办公,而且优势很明显。在库内已收录成绩里它拿了 14 个第一:信息收集方面 BrowseComp 91.20(54 个模型中第 1)、DeepSearchQA 95;工具使用方面 MCPMark-Verified 94.50、Toolathlon-Verified 76.50、SaaS-Bench 60.10 均第 1,Terminal-Bench 2.1 88.30 和 OSWorld-Verified 84.80 均第 2;编程方面 FrontierSWE 81.20、Program Bench 77.80、Kimi Code Bench 2.0 72.90、MLS Bench 48.30 第 1;垂直办公方面 Harvey Lab-AA 94.60、CorpFin v2 71.60、Office QA Pro 63.30、Finance Agent v2 54.40、Legal Research Bench 44.20、SpreadsheetBench 2 34.80、ResearchRubrics 76.20 全部第 1。多模态的 MathVision 97.80 也是 10 个模型中第 1。

Kimi K3 有什么短板?

综合难题和纯 Agent 长程评测上不是最强。HLE 带工具 56 分在 181 个模型中排第 14,不带工具 43.50 掉到第 50;APEX-Agents 41 分在 5 个模型中垫底;GDPval-AA v2 1686 排 13 个第 6,AA-Briefcase 1548 排 6 个第 4,PostTrain Bench 36.60 排 4 个第 3。它的强项集中在有明确工具和流程的任务上,纯靠内部推理的硬核难题不占优。

Kimi K3 的上下文和输出有多长?

上下文 1M tokens,最大输出也是 1M tokens——输出上限做到和上下文等长在同期模型中很少见(多数是 128K 或 256K)。长上下文实测 AA-LCR 74.70 在 18 个模型中排第 2。

Kimi K3 的 API 价格是多少?

美元计价为每百万 tokens 输入 $3.00、缓存命中输入 $0.30、输出 $15.00;人民币计价为输入 20 元、缓存命中 2 元、输出 100 元。官方定价文档在 platform.kimi.com 的 chat-k3 页面。

Kimi K3 相比 K2.6、K2.7 Code 有什么不同?

K3 是新一代基座,参数规模来到 2.8 万亿总参 / 1040 亿激活,并把上下文和输出都拉到 1M,同时首次加入图像和视频输入。K2.7 Code 是上一代面向编程的专门版本,K2.6 是上一代通用版本。从库内成绩看,K3 的提升主要体现在智能体工具链和垂直办公场景,而不只是编程分数。

What does self-hosting Kimi K3 require?

Moonshot recommends vLLM, SGLang, or TokenSpeed. The MXFP4 release is roughly 1.42 TiB, so deployment still requires large accelerator memory, high-speed interconnects, storage, and compatible serving software.

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码