SRE-Bench 衡量模型完成站点可靠性工程(SRE)任务的成功率。单次尝试与四次尝试是两种口径,成绩不能混在一起比较。成绩取自 OpenAI GPT-6 Astra 发布页。
查看 SRE-Bench 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
![]() GPT-6 Astra 思考水平·Max工具 | 99.20 | 2026-09-03 | 未知 | 闭源 | |
![]() GPT-6 Astra 思考水平·Max工具 | 88.00 | 2026-09-03 | 未知 | 闭源 | |
![]() GPT-5.6 Sol unknown | 68.70 | 2026-06-26 | 未知 | 闭源 | |
4 | ![]() GPT-5.6 Sol unknown | 55.90 | 2026-06-26 | 未知 | 闭源 |
5 | ![]() Claude Opus 5.5 思考水平·Max工具 | 33.59 | 2026-09-22 | 未知 | 闭源 |
2026-09-05:已核对 Astra / Sol 原始来源;不同版本、子集与工具配置分别保存。 https://openai.com/index/gpt-6-astra/