DataLearner 标志
GR

Grok 4.5

编程大模型GrokGrok 4.5

Grok 4.5

发布时间: 2026-07-08更新于: 2026-07-13知识截止: 2026-02-01浏览量: 3,590
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
500K
多语言支持
暂无数据
推理能力
4/5

Grok 4.5 是 SpaceXAI(原 xAI,2026 年 7 月 6 日完成更名,Grok 品牌不变)于 2026 年 7 月 8 日发布的旗舰模型(API 名 grok-4.5),面向编程、智能体任务和知识工作,可在官方 API、Grok Build、Cursor 及多家模型网关调用。支持文本与图像输入,上下文 500,000 tokens,知识截止 2026 年 2 月 1 日,reasoning_effort 支持 low/medium/high 三档并默认 high。工具方面除函数调用和代码执行外还内置 Web 搜索与 X 搜索,后者可直接检索 X 平台内容,是其它模型拿不到的数据源(服务端工具按调用另计费)。模型在数万张 NVIDIA GB300 上训练,强化学习聚焦多步骤软件工程。官方成绩为 Terminal Bench 2.1 83.3%、SWE-Bench Pro 64.7%、DeepSWE 1.0 62.0%、DeepSWE 1.1 53.0%、SWE-Marathon 29.0%。一个容易被忽略的优势是输出很省:SWE-Bench Pro 任务上平均输出 15,954 tokens,约为 Claude Opus 4.8(max)的四分之一。价格为每百万 tokens 输入 2.00 美元、缓存输入 0.50 美元、输出 6.00 美元。后续版本 Grok 4.6 已于 8 月 12 日发布。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Grok 4.5

模型基本信息

推理过程
支持
思考模式
思考水平 · 高 (High) (默认)思考水平 · 低 (Low)思考水平 · 中 (Medium)
上下文长度
500K tokens
最大输出长度
暂无数据
模型类型
编程大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-07-08
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2026-02-01
Grok 4.5

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
Grok 4.5

官方介绍与博客

DataLearnerAI博客
暂无
Grok 4.5

API接口信息

接口速度
4/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$2.00/ 1M tokens$6.00/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本-—$0.500/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Grok 4.5

评测结果

Grok 4.5 当前已收录的代表性评测结果包括 τ³-Banking(8 / 167,得分 47.94)、GPQA Diamond(15 / 253,得分 93.43)、SWE-Bench Pro - Public(8 / 62,得分 64.70)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

抽象归纳与泛化

共 9 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
低工具
79.17
100 / 193
ARC-AGI-1
中工具
87.17
81 / 193
ARC-AGI-1
高工具
85.67
93 / 193
ARC-AGI-2
低工具
33.06
105 / 181
ARC-AGI-2
中工具
52.64
90 / 181
ARC-AGI-2
高工具
52.64
90 / 181
0.26
35 / 51
0.32
32 / 51
0.30
33 / 51

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
93.43
15 / 253
15.40
55 / 204

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1578.80
45 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
70
19 / 96

仓库修复与多文件工程

共 4 项评测
评测名称 / 模式
得分
排名/总数
64.70
8 / 62
DeepSWE
高工具
53.76
60 / 92
APEX-SWE
高工具
53.60
3 / 3
SWE-Marathon
高工具
29
6 / 7

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
79.33
30 / 57
66.70
5 / 5
15.70
9 / 11

跨能力聚合指数

共 5 项评测
评测名称 / 模式
得分
排名/总数

跨应用与工具编排

共 2 项评测
评测名称 / 模式
得分
排名/总数
75.21
19 / 45
APEX-Agents
高工具
47.10
4 / 7

图像感知与视觉推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
80.40
39 / 229

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
55
39 / 134

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
高工具
47.94
8 / 167
SAGE
高工具
34.97
50 / 64

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
高工具
92.42
9 / 44
37.98
24 / 42
12.92
6 / 43

金融

共 2 项评测
评测名称 / 模式
得分
排名/总数
52.91
32 / 42
48.35
34 / 43

数学

共 3 项评测
评测名称 / 模式
得分
排名/总数
57.19
24 / 58
31
22 / 28
24.39
25 / 42

程序生成与编辑

共 2 项评测
评测名称 / 模式
得分
排名/总数
69
28 / 61
56.60
6 / 7

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
18.80
44 / 122

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
高工具联网
35
15 / 29

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
36.60
23 / 43

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
高工具
40.56
22 / 26

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
高工具
86.88
12 / 66
MedCode
高工具
43.29
35 / 64

和其他模型对比

Grok 4.5

发布机构

Grok 4.5

模型解读

更名后交出的第一款旗舰

Grok 4.5 是 SpaceXAI 于 2026 年 7 月 8 日发布的旗舰模型,API 模型名为 grok-4.5,定位覆盖编程、智能体任务和知识工作,可在官方 API、Grok Build、Cursor 以及多家模型网关上调用。

先解释一个容易让人困惑的地方:SpaceXAI 就是原来的 xAI。SpaceX 对 xAI 的收购已于 2026 年 2 月 2 日完成交割,2026 年 7 月 6 日公司正式完成品牌更名,启用新标识。Grok 这个产品品牌本身没有改,聊天机器人、移动应用、SuperGrok 和开发者 API 都沿用原名,更名也未带来价格或接口变化。Grok 4.5 发布于更名两天之后,是新品牌下的第一款旗舰模型。

规格:500K 上下文,四种内置工具

模型接受文本与图像输入、输出文本,上下文窗口为 500,000 tokens,知识截止日期为 2026 年 2 月 1 日。推理强度通过 reasoning_effort 配置,支持 low / medium / high 三档并默认 high;同时支持 Responses API 与 Chat Completions 两套接口,以及结构化输出。

工具能力是它比较有辨识度的一块:除函数调用与代码执行外,还内置 Web 搜索和 X 搜索。后者是 xAI 独有的能力——直接检索 X(原 Twitter)平台内容,对时效性话题和舆情类任务是别家模型拿不到的数据源。需要注意这些服务端工具按调用另行计费。

训练取向很明确:奔着软件工程去的

SpaceXAI 表示模型在数万张 NVIDIA GB300 GPU 上训练,数据覆盖编程、科学、工程和数学,强化学习阶段专门聚焦多步骤软件工程与技术任务。

官方发布的评测成绩为:Terminal Bench 2.1 83.3%、SWE-Bench Pro 64.7%、DeepSWE 1.0 62.0%、DeepSWE 1.1 53.0%、SWE-Marathon 29.0%。这几项使用的基准版本与工具环境各不相同,不宜脱离各自测试条件直接横向比较——尤其 SWE-Marathon 的 29.0% 提醒我们,超长周期任务对这一代模型仍然是硬骨头。

一个被低估的优势:输出很省

官方发布页称服务速度约为 80 tokens/s。更值得注意的是另一个数字:在 SWE-Bench Pro 任务上,Grok 4.5 的平均输出为 15,954 tokens,约为对比模型 Claude Opus 4.8(max 档)的四分之一。在按 token 计费的现实里,「用更少的话把事办完」直接等于更低的账单和更短的等待,这一点在只看跑分排名时很容易被忽略。

价格与后续版本

官方价格表列出的 500K 上下文标准价格为每百万 tokens:输入 2.00 美元、缓存输入 0.50 美元、输出 6.00 美元。模型未开源权重,参数规模与最大输出长度尚未公开。

选型时需要知道:SpaceXAI 已在 2026 年 8 月 12 日发布 Grok 4.6,在长周期智能体、编程和交互式视觉项目上进一步增强,并新增 xhigh 推理档。Grok 4.6 在 200K tokens 以内的价格与 4.5 相同,超过 200K 后翻倍计费。如果任务不涉及超长提示,直接用 4.6 通常没有额外成本负担。

官方来源

Grok 4.5

常见问题

Grok 4.5 适合哪些场景?

官方将其定位于编程、Agentic 任务和知识工作,典型场景包括多步骤软件工程、使用工具完成研究任务、代码生成与调试,以及文档、表格和演示文稿等办公任务。

Grok 4.5 支持多长的上下文?

官方价格表列出的上下文窗口为 500K tokens。模型支持文本与图像输入、文本输出,知识截止日期为 2026 年 2 月 1 日。

Grok 4.5 支持哪些推理档位和工具?

reasoning_effort 支持 low、medium、high 三档,默认 high。官方 API 文档列出的工具包括函数调用、Web 搜索、X 搜索和代码执行,并支持结构化输出。

Grok 4.5 的 API 价格是多少?

标准价格为每 100 万 tokens 输入 2 美元、缓存输入 0.5 美元、输出 6 美元。Web 搜索、X 搜索、代码执行等服务端工具还会按调用次数单独计费。

Grok 4.5 的官方工程评测成绩如何?

官方发布页报告 DeepSWE 1.0 为 62.0%、DeepSWE 1.1 为 53.0%、SWE-Marathon 为 29.0%、Terminal Bench 2.1 为 83.3%、SWE-Bench Pro 为 64.7%。不同基准采用不同任务集与工具环境,分数不应脱离测试条件直接比较。

Grok 4.5 是否开源?

目前未公开模型权重,也未公布参数规模和最大输出长度;可通过 SpaceXAI API、Grok Build、Cursor 及官方列出的模型网关使用。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码