DataLearner 标志

GPT-6 Astra 评测详情

GPT-6 Astra 当前已收录的代表性评测结果包括 MMMU-Pro(1 / 229,得分 86.90)、ARC-AGI-1(1 / 193,得分 98.50)、ARC-AGI-2(1 / 181,得分 95)。本页还提供与 3 个前代或同系列模型的迭代对比。

评测结果

GPT-6 Astra

评测结果

思考模式
工具使用
联网能力

抽象归纳与泛化

共 26 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-3
常规模式
96.72
6 / 26
ARC-AGI-3
常规模式
35.18
7 / 51
98.03
5 / 26
17.45
10 / 51
98.44
3 / 26
38.59
6 / 51
99.95
1 / 26
54.82
3 / 51
ARC-AGI-3
最高
98.55
2 / 26
ARC-AGI-3
最高
62.71
1 / 51
ARC-AGI-3
极高
98.44
3 / 26
ARC-AGI-3
极高
59.34
2 / 51
ARC-AGI-1
常规模式
86
90 / 193
ARC-AGI-1
低工具
96.50
24 / 193
ARC-AGI-1
中工具
97.50
11 / 193
ARC-AGI-1
高工具
98.50
1 / 193
ARC-AGI-1
最高
97.50
11 / 193
ARC-AGI-1
最高工具
97.50
11 / 193
ARC-AGI-1
极高
98.50
1 / 193
ARC-AGI-1
极高工具
98.50
1 / 193
ARC-AGI-2
常规模式
59.58
77 / 181
ARC-AGI-2
低工具
85.42
27 / 181
ARC-AGI-2
中工具
92.08
7 / 181
ARC-AGI-2
高工具
92.08
7 / 181
ARC-AGI-2
最高
95
1 / 181
ARC-AGI-2
极高工具
93.33
3 / 181

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
HLE
unknown
54.80
25 / 235
HLE
最高工具
57.20
17 / 235

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
2173.30
1 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
83.60
4 / 96

事实查找与深度检索

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
最高工具
91.50
1 / 58

自主开发与终端任务

共 10 项评测
评测名称 / 模式
得分
排名/总数
86.74
13 / 57
86.97
12 / 57
87.42
10 / 57
Terminal-Bench 2.1
最高工具
86.74
13 / 57
Terminal-Bench 2.1
极高工具
85.84
16 / 57
50.61
15 / 98
54.24
11 / 98
57.88
5 / 98
Terminal-Bench 4.0
最高工具
58.18
4 / 98
Terminal-Bench 4.0
极高工具
57.88
5 / 98

仓库修复与多文件工程

共 7 项评测
评测名称 / 模式
得分
排名/总数
96.90
4 / 10
90.20
3 / 11
DeepSWE
低工具
67.04
35 / 92
DeepSWE
中工具
72.79
12 / 92
DeepSWE
高工具
73.23
9 / 92
DeepSWE
最高工具
74.10
5 / 92
DeepSWE
极高工具
74.12
4 / 92

跨能力聚合指数

共 6 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
166.60
1 / 167
Vals Index
最高工具
66.61
5 / 42
Vals Index v2.1
最高工具
63.13
6 / 36
55
1 / 2
52.67
3 / 29

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld 2.0
最高工具
72.60
3 / 14

跨应用与工具编排

共 1 项评测
评测名称 / 模式
得分
排名/总数
Agents' Last Exam
最高工具
59.30
1 / 24

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
最高工具
41.40
14 / 25

图像感知与视觉推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
84.60
10 / 229
85.10
6 / 229
86.40
2 / 229
MMMU-Pro
最高
86.90
1 / 229
MMMU-Pro
极高
86.20
3 / 229

科学知识与推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
MysteryMechanism
最高工具
53.15
1 / 13
26.30
24 / 204
29.10
12 / 204
28.90
15 / 204
CritPt
最高
31.70
3 / 204
CritPt
极高
31.40
4 / 204

科学计算与科研编程

共 6 项评测
评测名称 / 模式
得分
排名/总数
68.10
1 / 18
54.10
48 / 134
54.20
47 / 134
55.40
36 / 134
SciCode
最高
56.50
25 / 134
SciCode
极高
55.70
33 / 134

客服与业务流程

共 6 项评测
评测名称 / 模式
得分
排名/总数
SAGE
最高工具
46.37
28 / 64
τ³-Banking
低工具
32
56 / 167
τ³-Banking
中工具
35.50
46 / 167
τ³-Banking
高工具
40
33 / 167
τ³-Banking
最高工具
41.40
28 / 167
τ³-Banking
极高工具
43.10
24 / 167

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
71.70
7 / 42
Tax Agent Bench
最高工具
63.34
12 / 20
Finance Agent v2
最高工具
53.54
23 / 43

法律

共 2 项评测
评测名称 / 模式
得分
排名/总数
39.42
20 / 42
5.42
22 / 43

数学

共 3 项评测
评测名称 / 模式
得分
排名/总数
99
3 / 28
97.60
1 / 42
2.94
1 / 5

程序生成与编辑

共 3 项评测
评测名称 / 模式
得分
排名/总数
89.59
5 / 61
64.50
2 / 7
53.30
4 / 11

漏洞利用

共 3 项评测
评测名称 / 模式
得分
排名/总数
ExploitBench
最高工具
100
1 / 3
42.40
1 / 2

文档与图表理解

共 5 项评测
评测名称 / 模式
得分
排名/总数
30.40
5 / 122
30.40
5 / 122
31
3 / 122
GDP.pdf
最高
31
3 / 122
GDP.pdf
极高
32.20
2 / 122

专业数据分析

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
最高工具联网
51.25
4 / 29
40.90
1 / 2

界面定位

共 1 项评测
评测名称 / 模式
得分
排名/总数

设计与工程制图

共 2 项评测
评测名称 / 模式
得分
排名/总数
BenchCAD
最高工具
95.90
1 / 2
50
1 / 2

音乐创作

共 1 项评测
评测名称 / 模式
得分
排名/总数

维护、优化与工程管理

共 4 项评测
评测名称 / 模式
得分
排名/总数
SRE-Bench
最高工具
99.20
1 / 2
SRE-Bench
最高工具
88
1 / 2
Code Migration
最高工具
67.74
1 / 43
63.90
1 / 2

生物与基因

共 2 项评测
评测名称 / 模式
得分
排名/总数
60.30
1 / 2
37.10
1 / 2

化学与药物研发

共 1 项评测
评测名称 / 模式
得分
排名/总数
49.30
1 / 2

医学知识与健康咨询

共 1 项评测
评测名称 / 模式
得分
排名/总数

漏洞发现与分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
SEC-Bench Pro
最高工具
85.40
1 / 6

智能体操作安全

共 2 项评测
评测名称 / 模式
得分
排名/总数
2.40
1 / 2

安全边界与拒绝

共 2 项评测
评测名称 / 模式
得分
排名/总数
Circumvention
最高工具
0
1 / 2
0
1 / 2

事实可靠性与幻觉

共 2 项评测
评测名称 / 模式
得分
排名/总数
100
1 / 1
4.20
1 / 2

长文定位与检索

共 2 项评测
评测名称 / 模式
得分
排名/总数

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v3
极高工具
0.42
1 / 13

编码综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
61.60
2 / 11

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
最高工具
100
1 / 26

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
最高工具
87.91
11 / 66
MedCode
最高工具
48.49
20 / 64

多轮记忆与持续上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
EBR-bench
最高工具
76.19
1 / 23

历代版本对比

GPT-6 Astra 系列各版本的评测成绩纵向对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项GPT-6 Astra当前GPT-5.6 SolGPT-5.5GPT-5.4
ARC-AGI-1
Score (%)
抽象归纳与泛化
98.50思考水平·极高 | 工具
97.50思考水平·极高
95.00思考水平·极高
93.67思考水平·极高
ARC-AGI-2
Score (% solved); cost per task (USD)
抽象归纳与泛化
95.00思考水平·高
92.50思考水平·高
85.00思考水平·极高
77.10常规模式
ARC-AGI-3 (Standard)
Action efficiency score(按相同评测环境比较,越高越好)
抽象归纳与泛化
62.71思考水平·高
7.78思考水平·高
0.43思考水平·高
0.21思考水平·高
HLE
Accuracy
综合知识考试
57.20思考水平·高 | 工具
44.50思考水平·高
52.20思考水平·高 | 工具
52.10思考水平·极高 | 工具
Creative Writing
Elo、大模型评判两两对战
写作与创意表达
2173.30常规模式
1971.60常规模式
1843.90常规模式
1839.70常规模式
SimpleBench
Score (AVG@5)
常识推理
83.60思考水平·高
64.80思考水平·极高
69.00常规模式
--
BrowseComp
Accuracy
事实查找与深度检索
91.50思考水平·高 | 工具
90.40思考水平·高
84.40思考水平·高 | 工具
82.70思考水平·极高 | 工具
Terminal-Bench 2.1
Accuracy
自主开发与终端任务
87.42思考水平·高 | 工具
88.80思考水平·高
83.10思考水平·极高 | 工具
--
Terminal-Bench 4.0
Resolution rate (%)
自主开发与终端任务
58.18思考水平·高 | 工具
37.27思考水平·高 | 工具
14.60思考水平·极高 | 工具
--
DeepSWE
Pass@1 (DeepSWE v1.1)
仓库修复与多文件工程
74.12思考水平·极高 | 工具
72.70思考水平·极高 | 工具
67.04思考水平·极高 | 工具
51.77思考水平·极高 | 工具
SWE-Bench Pro V2
Resolve Rate (%, pass@1)
仓库修复与多文件工程
96.90思考水平·高 | 工具
95.50思考水平·极高 | 工具
--
--
SWE-Bench Pro V2 Hard
Resolve Rate (%, pass@1)
仓库修复与多文件工程
90.20思考水平·高 | 工具
82.40思考水平·极高 | 工具
--
--
其余 53 个 benchmark 仍可在上方图表中查看。

单评测历史趋势图

当前查看:ARC-AGI-1 · 抽象归纳与泛化

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

GPT-6 Astra 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

若存在上下文阈值,图中标准价仅适用于以下范围:

GPT-6 Astra: 标准价适用于 <= 272000
模型供应商标准输入标准输出标准价适用于
GPT-6 Astra
OpenAI$10 / 1M tokens$50 / 1M tokens<= 272000
GPT-5.6 Sol
OpenAI$4 / 1M tokens$20 / 1M tokens—
GPT-5.5
OpenAI$5 / 1M tokens$30 / 1M tokens—
GPT-5.4
OpenAI$2.5 / 1M tokens$15 / 1M tokens—