GLM-5.3-FlashvsDeepSeek-V4-Flash-Vision-Exp
在 7 个共同 benchmark 中,GLM-5.3-Flash 整体领先:GLM-5.3-Flash 领先 5 项,DeepSeek-V4-Flash-Vision-Exp 领先 2 项,持平 0 项,平均分差 +5.91。
GLM-5.3-Flash
智谱AI · 2026-08-26 · 多模态大模型
DeepSeek-V4-Flash-Vision-Exp
DeepSeek-AI · 2026-08-21 · 多模态大模型
GLM-5.3-Flash5 项(71%)(29%)2 项DeepSeek-V4-Flash-Vision-Exp
评测分数
按能力类目分组,每组内按分差大小排列;共 7 项。
仓库修复与多文件工程
胶着 2/2| 评测项 | GLM-5.3-Flash | DeepSeek-V4-Flash-Vision-Exp | 分差 |
|---|---|---|---|
| DeepSWE | 63.3945 / 92Max (With Tools) | 59.3050 / 92Max (With Tools) | +4.09 |
| NL2Repo-Bench | 56.3010 / 16Max (With Tools) | 57.708 / 16Max (With Tools) | -1.40 |
跨应用与工具编排
胶着 2/2| 评测项 | GLM-5.3-Flash | DeepSeek-V4-Flash-Vision-Exp | 分差 |
|---|---|---|---|
| Toolathlon-Verified | 78.401 / 14Max (With Tools) | 75.905 / 14Max (With Tools) | +2.50 |
| Agents' Last Exam | 26.3018 / 24Max (With Tools) | 27.3015 / 24Max (With Tools) | -1 |
办公与文档流程
GLM-5.3-Flash 领先 1/1| 评测项 | GLM-5.3-Flash | DeepSeek-V4-Flash-Vision-Exp | 分差 |
|---|---|---|---|
| AutomationBench | 48.808 / 25Max (With Tools) | 25.7023 / 25Max (With Tools) | +23.10 |
文档与图表理解
GLM-5.3-Flash 领先 1/1| 评测项 | GLM-5.3-Flash | DeepSeek-V4-Flash-Vision-Exp | 分差 |
|---|---|---|---|
| Chartography | 786 / 11Max (With Tools) | 64.309 / 11Max (With Tools) | +13.70 |
自主开发与终端任务
GLM-5.3-Flash 领先 1/1| 评测项 | GLM-5.3-Flash | DeepSeek-V4-Flash-Vision-Exp | 分差 |
|---|---|---|---|
| Terminal-Bench 2.1 | 84.3021 / 57Max (With Tools) | 83.9022 / 57Max (With Tools) | +0.40 |
规格对比
| 字段 | GLM-5.3-Flash | DeepSeek-V4-Flash-Vision-Exp |
|---|---|---|
| 发布机构 | 智谱AI | DeepSeek-AI |
| 发布时间 | 2026-08-26 | 2026-08-21 |
| 模型类型 | 多模态大模型 | 多模态大模型 |
| 架构 | MoE 架构 | MoE 架构 |
| 参数规模 | 3200亿 | 3050亿 |
| 上下文长度 | 1M | 1M |
| 最大输出 | 128K | 384K |
API 调用价格
价格优先使用 DataLearner 配置的 API 记录;缺失项不做推测。
| 价格项 | GLM-5.3-Flash | DeepSeek-V4-Flash-Vision-Exp |
|---|---|---|
| 文本输入 | $0.15 / 1M tokens | $0.22 / 1M tokens |
| 文本输出 | $0.5 / 1M tokens | $0.66 / 1M tokens |
| 缓存读取 | $0.03 / 1M tokens | $0.007 / 1M tokens |
小结
- GLM-5.3-Flash在以下类目领先:办公与文档流程 (1/1)、文档与图表理解 (1/1)、自主开发与终端任务 (1/1)
- 胶着类目:仓库修复与多文件工程、跨应用与工具编排
7 个共同 benchmark 上,GLM-5.3-Flash 平均高出 5.91 分。
单项差距最大的 benchmark:AutomationBench — GLM-5.3-Flash 48.80,DeepSeek-V4-Flash-Vision-Exp 25.70(分差 +23.10)。
本页正文由结构化模型、价格与 benchmark 数据生成,不使用实时 LLM 撰写。