DataLearner 标志

GPT-6.1 Sol 评测详情

GPT-6.1 Sol 当前已收录的代表性评测结果包括 ARC-AGI-1(1 / 193,得分 98.50)、ARC-AGI-2(2 / 181,得分 94.17)、ARC-AGI-3(4 / 51,得分 52.73)。

评测结果

GPT-6.1 Sol

评测结果

思考模式
工具使用

抽象归纳与泛化

共 20 项评测
评测名称 / 模式
得分
排名/总数
93.50
47 / 193
95.50
32 / 193
98.50
1 / 193
ARC-AGI-1
最高
96.50
24 / 193
ARC-AGI-1
极高
98.50
1 / 193
82.79
11 / 26
3.92
18 / 51
91.02
10 / 26
10.57
11 / 51
94.99
9 / 26
26.72
9 / 51
ARC-AGI-3
最高
96.18
8 / 26
ARC-AGI-3
最高
52.73
4 / 51
ARC-AGI-3
极高
96.37
7 / 26
ARC-AGI-3
极高
39.93
5 / 51
76.67
47 / 181
86.67
25 / 181
91.67
9 / 181
ARC-AGI-2
最高
94.17
2 / 181
ARC-AGI-2
极高
91.67
9 / 181

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
最高
52.92
—

跨长文理解与整合

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-LCR
最高
83
—

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
DeepSWE
高工具
75.20
—

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld 2.0
最高工具
71.40
—

办公与文档流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
AA-Briefcase
最高工具
1564.21
—
31.70
—

图像感知与视觉推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
最高
85.95
—

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
CritPt
最高
31.71
—

科学计算与科研编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
58.10
—
SciCode
最高
54.17
—

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
最高
31
—

自主开发与终端任务

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 4.0
最高工具
56.06
—

医学知识与健康咨询

共 5 项评测
评测名称 / 模式
得分
排名/总数

漏洞利用

共 2 项评测
评测名称 / 模式
得分
排名/总数

漏洞发现与分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
78.80
—

临床工作与医疗决策

共 1 项评测
评测名称 / 模式
得分
排名/总数

跨能力聚合指数

共 2 项评测
评测名称 / 模式
得分
排名/总数
Vals Index v2.1
最高工具
61.15
8 / 36
51.83
—

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
41.53
—