ARC-AGI-3 是面向智能体的交互式推理基准,要求在没有自然语言指令的环境中探索、推断目标、建立世界模型并规划行动。100% 表示达到人类基线的行动效率。成绩同时受模型、思考档位和评测环境影响。本站分别记录 Standard 与 Provider Adapter;后者支持供应商原生状态和上下文管理,具体实现见运行证据。不同环境的成绩分组展示,环境未核实的历史成绩不参与排名。
查看 ARC-AGI-3 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
排名按评测环境分别计算。Provider Adapter 支持供应商原生状态;具体实现请查看成绩证据。
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
![]() GPT-6 Astra 思考水平·Max | 62.71 | 2026-09-03 | 未知 | 闭源 | |
![]() GPT-6 Astra 思考水平·极高 | 59.34 | 2026-09-03 | 未知 | 闭源 | |
![]() GPT-6 Astra 思考水平·高 | 54.82 | 2026-09-03 | 未知 | 闭源 | |
4 | ![]() GPT-6.1 Sol 思考水平·Max | 52.73 | 2026-09-29 | 未知 | 闭源 |
5 | ![]() GPT-6.1 Sol 思考水平·极高 | 39.93 | 2026-09-29 | 未知 | 闭源 |
6 | ![]() GPT-6 Astra 思考水平·中 | 38.59 | 2026-09-03 | 未知 | 闭源 |
7 | ![]() GPT-6 Astra 常规模式 | 35.18 | 2026-09-03 | 未知 | 闭源 |
8 | ![]() Claude Opus 5 思考水平·高 | 30.16 | 2026-07-24 | 未知 | 闭源 |
9 | ![]() GPT-6.1 Sol 思考水平·高 | 26.72 | 2026-09-29 | 未知 | 闭源 |
10 | ![]() GPT-6 Astra 思考水平·低 | 17.45 | 2026-09-03 | 未知 | 闭源 |
11 | ![]() GPT-6.1 Sol 思考水平·中 | 10.57 | 2026-09-29 | 未知 | 闭源 |
12 | ![]() Gemini 3.8 Flash 思考水平·高 | 10.37 | 2026-09-02 | 未知 | 闭源 |
13 | ![]() GPT-5.6 Sol 思考水平·Max | 7.78 | 2026-06-26 | 未知 | 闭源 |
14 | ![]() GPT-5.6 Sol 思考水平·极高 | 6.99 | 2026-06-26 | 未知 | 闭源 |
15 | ![]() Gemini 3.8 Flash 思考水平·低 | 5.99 | 2026-09-02 | 未知 | 闭源 |
16 | ![]() GPT-6 Sol 思考水平·Max | 4.62 | 2026-09-22 | 未知 | 闭源 |
17 | ![]() Gemini 3.8 Flash 思考水平·中 | 3.99 | 2026-09-02 | 未知 | 闭源 |
18 | ![]() GPT-6.1 Sol 思考水平·低 | 3.92 | 2026-09-29 | 未知 | 闭源 |
19 | ![]() GPT-5.6 Sol 思考水平·高 | 2.15 | 2026-06-26 | 未知 | 闭源 |
20 | Grok 4.6 思考水平·极高 | 2.11 | 2026-08-12 | 未知 | 闭源 |
21 | ![]() GPT-6 Sol 思考水平·极高 | 1.80 | 2026-09-22 | 未知 | 闭源 |
22 | ![]() Claude Opus 4.8 思考水平·高 | 1.52 | 2026-05-28 | 未知 | 闭源 |
23 | ![]() GPT-5.6 Sol 思考水平·中 | 1.07 | 2026-06-26 | 未知 | 闭源 |
24 | ![]() GPT-6 Sol 思考水平·高 | 0.9 | 2026-09-22 | 未知 | 闭源 |
25 | ![]() GPT-5.6 Terra 思考水平·Max | 0.8 | 2026-06-26 | 未知 | 闭源 |
26 | ![]() GPT-5.6 Terra 思考水平·极高 | 0.65 | 2026-06-26 | 未知 | 闭源 |
27 | ![]() Claude Opus 4.6 思考水平·Max | 0.51 | 2026-02-05 | 未知 | 闭源 |
28 | ![]() GPT-5.6 Terra 思考水平·高 | 0.49 | 2026-06-26 | 未知 | 闭源 |
29 | ![]() GPT-5.5 思考水平·高 | 0.43 | 2026-04-23 | 未知 | 闭源 |
30 | ![]() GPT-6 Sol 思考水平·中 | 0.42 | 2026-09-22 | 未知 | 闭源 |
31 | ![]() GPT-5.6 Sol 思考水平·低 | 0.33 | 2026-06-26 | 未知 | 闭源 |
32 | Grok 4.5 思考水平·中 | 0.32 | 2026-07-08 | 未知 | 闭源 |
33 | Grok 4.5 思考水平·高 | 0.3 | 2026-07-08 | 未知 | 闭源 |
34 | ![]() GPT-6 Sol 常规模式 | 0.28 | 2026-09-22 | 未知 | 闭源 |
35 | Grok 4.5 思考水平·低 | 0.26 | 2026-07-08 | 未知 | 闭源 |
36 | ![]() GPT-5.4 思考水平·高 | 0.21 | 2026-03-05 | 未知 | 闭源 |
37 | ![]() GPT-6 Luna 思考水平·中 | 0.19 | 2026-09-22 | 未知 | 闭源 |
38 | ![]() Opus 4.7 思考水平·高 | 0.18 | 2026-04-16 | 未知 | 闭源 |
39 | ![]() GPT-5.6 Luna 思考水平·Max | 0.18 | 2026-06-26 | 未知 | 闭源 |
40 | ![]() GPT-6 Luna 思考水平·高 | 0.18 | 2026-09-22 | 未知 | 闭源 |
41 | ![]() GPT-5.6 Luna 思考水平·中 | 0.17 | 2026-06-26 | 未知 | 闭源 |
42 | ![]() GPT-5.6 Luna 思考水平·低 | 0.17 | 2026-06-26 | 未知 | 闭源 |
43 | ![]() GPT-6 Luna 思考水平·极高 | 0.16 | 2026-09-22 | 未知 | 闭源 |
44 | ![]() GPT-6 Sol 思考水平·低 | 0.13 | 2026-09-22 | 未知 | 闭源 |
45 | ![]() GPT-5.6 Luna 思考水平·高 | 0.1 | 2026-06-26 | 未知 | 闭源 |
46 | ![]() GPT-6 Luna 思考水平·Max | 0.1 | 2026-09-22 | 未知 | 闭源 |
47 | ![]() GPT-5.6 Terra 思考水平·中 | 0.08 | 2026-06-26 | 未知 | 闭源 |
48 | ![]() GPT-6 Luna 常规模式 | 0.03 | 2026-09-22 | 未知 | 闭源 |
49 | ![]() GPT-6 Luna 思考水平·低 | 0.03 | 2026-09-22 | 未知 | 闭源 |
50 | ![]() GPT-5.6 Luna 思考水平·极高 | 0.02 | 2026-06-26 | 未知 | 闭源 |
51 | ![]() GPT-5.6 Terra 思考水平·低 | 0.01 | 2026-06-26 | 未知 | 闭源 |
ARC-AGI-3 的成绩须结合评测环境阅读。Standard 与 Provider Adapter 使用不同的运行条件,不能将跨环境分差直接归因于模型能力。Provider Adapter 的具体实现可能因供应商而异,也不能据此认定使用了 Codex。查看环境、思考档位、成本和来源证据后再比较;最新成绩以对应环境的榜单为准。