DataLearner 标志

GLM-5vsKimi K2.5

在 15 个共同 benchmark 中,GLM-5 整体领先:GLM-5 领先 10 项,Kimi K2.5 领先 5 项,持平 0 项,平均分差 +3.22。

智谱AI
GLM-5

智谱AI · 2026-02-11 · 聊天大模型

Moonshot AI
Kimi K2.5

Moonshot AI · 2026-01-27 · 多模态大模型

GLM-510 项(67%)(33%)5 项Kimi K2.5

评测分数

按能力类目分组,每组内按分差大小排列;共 15 项。

数学

GLM-5 领先 2/3
评测项GLM-5Kimi K2.5分差
FrontierMath - Tier 42.1056 / 80Normal (No Tools)4.2040 / 80Normal (No Tools)-2.10
IMO-AnswerBench82.5017 / 24Thinking (No Tools)81.8018 / 24Thinking (No Tools)+0.70
AIME 202692.7019 / 30Thinking (No Tools)92.5022 / 30Thinking (No Tools)+0.20

自主开发与终端任务

GLM-5 领先 2/2
评测项GLM-5Kimi K2.5分差
Terminal Bench Hard39.4053 / 244Normal (With Tools)18.90150 / 244Normal (With Tools)+20.50
Terminal Bench 2.061.1018 / 48Thinking (With Tools)50.8035 / 48Thinking (With Tools)+10.30

跨应用与工具编排

GLM-5 领先 2/2
评测项GLM-5Kimi K2.5分差
Claw Bench91.705 / 29Thinking (With Tools)81.7018 / 29Thinking (With Tools)+10
Pinch Bench86.4013 / 38Thinking (With Tools)84.8018 / 38Thinking (With Tools)+1.60

写作与创意表达

GLM-5 领先 1/1
评测项GLM-5Kimi K2.5分差
Creative Writing1,60142 / 110Normal (No Tools)1,57946 / 110Normal (No Tools)+22

客服与业务流程

Kimi K2.5 领先 1/1
评测项GLM-5Kimi K2.5分差
τ³-Banking9.79133 / 167Thinking (With Tools)14.20115 / 167Thinking (With Tools)-4.41

抽象归纳与泛化

Kimi K2.5 领先 1/1
评测项GLM-5Kimi K2.5分差
ARC-AGI-144.67147 / 193Thinking (No Tools)65.33120 / 193Thinking (No Tools)-20.66

科学知识与推理

Kimi K2.5 领先 1/1
评测项GLM-5Kimi K2.5分差
GPQA Diamond8680 / 253Thinking (No Tools)87.6065 / 253Thinking (No Tools)-1.60

程序生成与编辑

GLM-5 领先 1/1
评测项GLM-5Kimi K2.5分差
Vibe Code Bench v1.123.3645 / 61Thinking (With Tools)17.5450 / 61Thinking (With Tools)+5.82

综合知识考试

GLM-5 领先 1/1
评测项GLM-5Kimi K2.5分差
HLE50.4039 / 235Thinking (With Tools)50.2041 / 235Thinking (With Tools)+0.20

跨行业工作评估

GLM-5 领先 1/1
评测项GLM-5Kimi K2.5分差
GDPval-AA468 / 15Thinking (No Tools)409 / 15Thinking (No Tools)+6

跨长文理解与整合

Kimi K2.5 领先 1/1
评测项GLM-5Kimi K2.5分差
LongBench v260.807 / 14Normal (No Tools)616 / 14Normal (No Tools)-0.20

规格对比

字段GLM-5Kimi K2.5
发布机构智谱AIMoonshot AI
发布时间2026-02-112026-01-27
模型类型聊天大模型多模态大模型
架构MoE 架构MoE 架构
参数规模7440亿1万亿
上下文长度200K256K
最大输出128K16K

API 调用价格

价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。

价格项GLM-5Kimi K2.5
文本输入$1 / 1M tokens$0.6 / 1M tokens
文本输出$3.2 / 1M tokens$3 / 1M tokens
缓存读取$0.2 / 1M tokens$0.1 / 1M tokens

小结

  • GLM-5在以下类目领先:数学 (2/3)、自主开发与终端任务 (2/2)、跨应用与工具编排 (2/2)、写作与创意表达 (1/1)、程序生成与编辑 (1/1)、综合知识考试 (1/1)、跨行业工作评估 (1/1)
  • Kimi K2.5在以下类目领先:客服与业务流程 (1/1)、抽象归纳与泛化 (1/1)、科学知识与推理 (1/1)、跨长文理解与整合 (1/1)

15 个共同 benchmark 上,GLM-5 平均高出 3.22 分。

单项差距最大的 benchmark:Creative Writing — GLM-5 1,601,Kimi K2.5 1,579(分差 +22)。

本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。