该榜单已停用。 发布方已推出新版本,下方成绩来自旧版本,仅供参考,与新版本不可直接比较。最新成绩请看 Terminal-Bench 3.0
版本:Terminal-Bench · Terminal Bench 2.0(已停用) · Terminal-Bench 2.1(已停用) · Terminal-Bench 3.0(已停用) · Terminal-Bench 4.0(当前)
不同版本的分数默认不直接比较。
Terminal-Bench是一个针对AI代理在真实终端环境中的能力评测基准,由Stanford University与Laude Institute合作开发。Terminal-Bench 2.1是2.0的改进版本,基于Z.ai的Terminal-Bench 2.0 Verified进行优化,目前处于活跃状态,但任务尚未完全上传。
Terminal-Bench 2.1 是由 Terminal-Bench 团队维护的终端智能体评测,共 89 个复杂容器任务。2.1 版修复了任务缺陷、资源与超时配置,并由维护者运行和核验官方排行榜提交。
查看 Terminal-Bench 2.1 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
SWE-2 思考水平·高工具 | 92.80 | 2026-09-10 | 未知 | 闭源 | |
![]() Claude Fable 5.1 思考水平·Max工具 | 91.40 | 2026-09-01 | 未知 | 闭源 | |
![]() Claude Fable 5.1 思考水平·极高工具 | 91.00 | 2026-09-01 | 未知 | 闭源 | |
4 | ![]() DeepSeek-V4.1-Flash 思考水平·Max工具 | 90.60 | 2026-09-10 | 5520亿 | 免费商用 |
5 | ![]() Claude Fable 5.1 思考水平·高工具 | 89.90 | 2026-09-01 | 未知 | 闭源 |
6 | MiMo-V2.6-Pro 开启思考工具 | 89.90 | 2026-09-22 | 10200亿 | 免费商用 |
7 | ![]() GPT-5.6 Sol 思考水平·极高工具 | 89.50 | 2026-06-26 | 未知 | 闭源 |
8 | ![]() Gemini 3.8 Flash 开启思考工具 | 89.40 | 2026-09-02 | 未知 | 闭源 |
9 | ![]() Claude Opus 5 思考水平·Max工具 | 89.10 | 2026-07-24 | 未知 | 闭源 |
10 | ![]() GPT-5.6 Sol 思考水平·Max | 88.80 | 2026-06-26 | 未知 | 闭源 |
11 | Grok 4.6 思考水平·高工具 | 88.40 | 2026-08-12 | 未知 | 闭源 |
12 | ![]() Claude Fable 5 深度思考模式工具 | 88.00 | 2026-06-09 | 未知 | 闭源 |
13 | ![]() GPT-5.6 Sol 思考水平·Max工具 | 88.00 | 2026-06-26 | 未知 | 闭源 |
14 | ![]() Claude Opus 5 思考水平·极高工具 | 88.00 | 2026-07-24 | 未知 | 闭源 |
15 | Grok 4.6 思考水平·极高工具 | 88.00 | 2026-08-12 | 未知 | 闭源 |
16 | ![]() Claude Fable 5.1 思考水平·中工具 | 88.00 | 2026-09-01 | 未知 | 闭源 |
17 | ![]() DeepSeek-V4-Pro 思考水平·极高工具 | 87.90 | 2026-08-13 | 16000亿 | 免费商用 |
18 | ![]() Claude Opus 5.5 思考水平·高工具 | 87.64 | 2026-09-22 | 未知 | 闭源 |
19 | MiMo-V2.6-Flash 开启思考工具 | 87.60 | 2026-09-22 | 3090亿 | 免费商用 |
20 | ![]() GPT-6 Astra 思考水平·高工具 | 87.42 | 2026-09-03 | 未知 | 闭源 |
21 | ![]() GPT-5.6 Terra 思考水平·Max | 87.40 | 2026-06-26 | 未知 | 闭源 |
22 | ![]() GPT-6 Astra 思考水平·中工具 | 86.97 | 2026-09-03 | 未知 | 闭源 |
23 | ![]() GPT-6 Astra 思考水平·低工具 | 86.74 | 2026-09-03 | 未知 | 闭源 |
24 | ![]() GPT-6 Astra 思考水平·Max工具 | 86.74 | 2026-09-03 | 未知 | 闭源 |
25 | ![]() Qwen3.8-Max 思考水平·极高工具 | 86.60 | 2026-08-03 | 24000亿 | 有条件商用 |
26 | ![]() GPT-6 Astra 思考水平·极高工具 | 85.84 | 2026-09-03 | 未知 | 闭源 |
27 | ![]() Gemini 3.7 Flash 开启思考工具 | 85.80 | 2026-08-13 | 未知 | 闭源 |
28 | ![]() Hy4 preview 思考水平·高工具 | 85.40 | 2026-08-28 | 7700亿 | 免费商用 |
29 | ![]() Step 5 Preview 思考水平·高工具 | 85.00 | 2026-09-20 | 6000亿 | 闭源 |
30 | ![]() GPT-5.6 Luna 思考水平·Max | 84.70 | 2026-06-26 | 未知 | 闭源 |
官方 Terminal-Bench 2.1 排行榜当前最高已核验成绩为 Claude Fable 5 + Claude Code(xhigh)的 83.8%。