DataLearner 标志
GL

GLM-5.2

推理大模型编程大模型GLMGLM-5.2

GLM-5.2

发布时间: 2026-06-13更新于: 2026-08-22浏览量: 19,386
模型参数
7533.3亿
上下文长度
1M
多语言支持
支持
推理能力
5/5

智谱 AI / Z.ai 于 2026 年 6 月 13 日发布的 GLM-5 系列旗舰,定位长程任务与 Agentic Coding,核心变化是把 GLM-5.1 的约 200K 上下文提升到真正可用的 1M tokens,保持 128K 最大输出。约 753.33B 参数的 MoE / DSA 架构,以 MIT License 在 Hugging Face 开源(BF16 约 1.5 TB),是同级别里少见的标准开源许可。价格为每百万 tokens 输入 $1.40、缓存命中 $0.26、输出 $4.40。库内实测里数学是它最强的一项——AIME 2026 99.20 在 19 个模型中排第 1,IMO-AnswerBench 91 在 23 个中排第 2;但长程仓库任务明显吃力,SWE-Marathon 13 分和 PostTrain Bench 34.30 均在 4 个模型中垫底,DeepSWE 44 分排 27 个第 21。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

GLM-5.2

模型基本信息

推理过程
支持
思考模式
思考水平 · 高 (High) (默认)常规模式思考水平 · 最高 (Max)
上下文长度
1M tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本 → 文本
发布时间
2026-06-13
模型文件大小
约 1.5 TB(BF16 safetensors)
MoE架构
是
总参数 / 激活参数
7533.3亿 / 400亿
知识截止
暂无数据
GLM-5.2

开源和体验地址

代码开源状态
预训练权重开源
MIT License- 免费商用授权
在线体验
GLM-5.2

官方介绍与博客

DataLearnerAI博客
暂无
GLM-5.2

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$1.40/ 1M tokens$4.40/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—$0.260/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

GLM-5.2

评测结果

GLM-5.2 当前已收录的代表性评测结果包括 IMO-AnswerBench(2 / 24,得分 91)、Terminal Bench Hard(22 / 244,得分 50.80)、AIME 2026(3 / 30,得分 99.20)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
HLE
思考模式
40.50
83 / 235
HLE
思考模式工具
54.70
26 / 235

科学知识与推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
71.21
173 / 253
87.88
61 / 253
GPQA Diamond
思考模式
91.20
30 / 253
91.86
26 / 253
CritPt
常规模式
3.10
114 / 204
CritPt
最高
20.90
35 / 204

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1756.50
25 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
58.80
39 / 96

仓库修复与多文件工程

共 7 项评测
评测名称 / 模式
得分
排名/总数
FrontierSWE
最高工具
74.40
3 / 4
SWE-Bench Pro - Public
思考模式工具
62.10
12 / 62
NL2Repo-Bench
思考模式工具
48.90
13 / 16
DeepSWE
高工具
36.28
81 / 92
DeepSWE
最高工具
43.78
75 / 92
DeepSWE
深度工具
44
74 / 92
SWE-Marathon
最高工具
13
7 / 7

跨能力综合测试

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
常规模式
73.18
21 / 117
SuperCLUE
unknown
63.27
10 / 13

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
81
26 / 57
50.80
22 / 244
Terminal-Bench 4.0
最高工具
1
86 / 98

跨应用与工具编排

共 3 项评测
评测名称 / 模式
得分
排名/总数
86.98
5 / 45
MCP-Atlas
思考模式工具
77.80
18 / 44
Tool Decathlon
思考模式工具
48.20
4 / 10

多轮记忆与持续上下文

共 2 项评测
评测名称 / 模式
得分
排名/总数
72.34
58 / 126
EBR-bench
最高工具
9.52
18 / 23

数学

共 6 项评测
评测名称 / 模式
得分
排名/总数
AIME 2026
思考模式
99.20
3 / 30
IMO-AnswerBench
思考模式
91
2 / 24
FrontierMath v2
常规模式
42.46
34 / 58
54.74
28 / 58
59.21
22 / 58
29.27
20 / 42

跨能力聚合指数

共 3 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
151.76
42 / 167
Vals Index
最高工具
53.12
27 / 42

程序生成与编辑

共 2 项评测
评测名称 / 模式
得分
排名/总数
63.96
31 / 61
Program Bench
思考模式工具
63.70
3 / 15

机器学习工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
高工具
67.31
21 / 52
PostTrain Bench
最高工具
34.30
5 / 5

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
最高
51.20
67 / 134

客服与业务流程

共 3 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
常规模式工具
16.70
102 / 167
τ³-Banking
最高工具
34.60
49 / 167
τ³-Banking
极高工具
37.11
41 / 167

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
最高工具
90.97
12 / 44
31.25
29 / 42
7.08
16 / 43

金融

共 2 项评测
评测名称 / 模式
得分
排名/总数
61.53
24 / 42
Finance Agent v2
最高工具
49.70
31 / 43

综合偏好评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
1593.25
5 / 35

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
最高
10.40
82 / 122

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
最高工具
37.87
22 / 43

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
最高工具
83.53
31 / 66
MedCode
最高工具
40.77
44 / 64

和其他模型对比

GLM-5.2

发布机构

GLM-5.2

模型解读

GLM-5.2 是智谱 AI / Z.ai 在 2026 年 6 月 13 日推出的 GLM-5 系列旗舰模型,定位于长程任务(long-horizon tasks)和 Agentic Coding / Agentic Engineering 场景。官方文档将其描述为面向项目级工程上下文的旗舰基础模型,核心变化是把 GLM-5.1 的约 200K 上下文提升到真正可用的 1M tokens,并保持 128K tokens 最大输出能力。

模型已经在 Z.ai Chat、GLM Coding Plan 和 Z.ai API 文档中上线,官方开源入口为 Hugging Face 的 zai-org/GLM-5.2,代码与部署说明集中在 zai-org/GLM-5 仓库。Hugging Face 模型元数据标注为 MIT License、文本生成模型,并列出英文与中文语言标签。


架构与技术规格

GLM-5.2 延续 GLM-5 系列的 MoE / DSA 技术路线。Hugging Face safetensors 元数据显示模型总参数约 753.33B;官方模型卡标签包含 glm_moe_dsa,但未在公开文档中给出 GLM-5.2 的激活参数数量,因此激活参数一项暂时留空。官方模型卡还介绍了 IndexShare 稀疏注意力优化:在 1M 上下文长度下复用索引器以降低每 token FLOPs;同时改进 MTP speculative decoding,使接受长度提升。

  • 输入模态:文本
  • 输出模态:文本
  • 上下文窗口:1M tokens
  • 最大输出:128K tokens
  • 能力:思考模式、流式输出、函数调用、上下文缓存、结构化输出、MCP 工具集成
  • 部署:官方模型卡列出 SGLang、vLLM、xLLM、Transformers、KTransformers 等本地推理框架支持

思考模式与使用方式

Z.ai 文档说明 GLM-5.2 默认启用 thinking;如需关闭,可在请求中显式设置禁用思考。面向 Coding Plan / Claude Code 等场景,官方建议通过 effort 控制推理强度,其中常规 low / medium / high 会映射到 GLM-5.2 的 high effort,xhigh / max / ultracode 会映射到 max effort。对应到本页即支持关闭、高强度和最高强度三类思考模式。


官方评测结果

GLM-5.2 发布后,官方模型卡补充了覆盖推理、编程与 Agentic 能力的 benchmark 表。能与本站基准精确对应的代表性结果包括:HLE 40.5、HLE with Tools 54.7、AIME 2026 99.2、IMO-AnswerBench 91.0、GPQA Diamond 91.2、SWE-Bench Pro 62.1、Terminal Bench 2.1(Terminus-2)81.0。官方同时列出 HMMT、CritPt、NL2Repo、DeepSWE、ProgramBench、FrontierSWE、PostTrainBench、SWE-Marathon、MCP-Atlas 等结果;尚未纳入基准目录的项目只在正文说明,不强行写进成绩表。

与 GLM-5.1 相比,官方表中 GLM-5.2 在 SWE-Bench Pro 从 58.4 提升到 62.1,在 Terminal Bench 2.1(Terminus-2)从 63.5 提升到 81.0;在 AIME 2026 从 95.3 提升到 99.2。整体定位仍然是开源模型中的长程工程与代码任务旗舰,而非单纯对话模型。


价格与访问

Z.ai Developer Docs 的 API 定价页显示,GLM-5.2 文本模型按每 1M tokens 计费:输入 1.4 美元、缓存输入 0.26 美元、缓存输入存储限时免费、输出 4.4 美元。国内智谱开放平台页面也展示了人民币价格口径;本页价格以 Z.ai 官方美元 API 文档为准。


限制与注意事项

GLM-5.2 的核心优势集中在长上下文、代码和多步工程任务。1M 上下文能显著减少大型项目分析中的上下文断裂,但并不等价于无限可靠记忆;超长任务仍需要明确的工程约束、阶段性校验和工具调用记录。官方未公开 GLM-5.2 的知识截止时间与激活参数规模,这两项保留为空,待后续技术报告或模型卡更新后补充。

GLM-5.2

常见问题

GLM-5.2 是什么模型?

智谱 AI / Z.ai 于 2026 年 6 月发布的 GLM-5 系列旗舰模型,面向长程工程任务和 Agentic Coding,支持 1M 上下文、128K 输出和可调思考强度,并以 MIT License 开源。

GLM-5.2 支持哪些输入和输出模态?

当前官方资料记录其支持文本输入,并生成文本输出。

GLM-5.2 的上下文窗口和最大输出是多少?

上下文窗口为 1M,最大输出为 128K。未公开或无法确认的规格不做推测。

GLM-5.2 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、多语言、编程大模型相关任务;实际效果应结合具体工作流验证。

GLM-5.2 是否提供 API,价格如何查看?

页面已收录 智谱AI 的 3 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。

GLM-5.2 是否开源?

代码与模型权重按 MIT License 记录;使用前仍应核对官方许可原文。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码