SWE-Atlas-QnA 是 Scale AI 的代码库理解智能体评测,包含来自 11 个真实开源仓库的 124 个任务,覆盖 Go、Python、C 和 TypeScript。智能体需要运行和追踪代码、跨文件理解架构并回答技术问题;主指标 Task Resolve Rate 只有在全部 rubric 条件通过时才计为成功。
查看 SWE-Atlas-QnA 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
![]() Step 5 Preview 思考水平·高工具 | 63.60 | 2026-09-20 | 6000亿 | 闭源 | |
![]() Muse Spark 1.3 unknown | 59.40 | 2026-09-02 | 未知 | 闭源 | |
![]() GPT-5.6 Sol unknown | 53.50 | 2026-06-26 | 未知 | 闭源 | |
4 | ![]() Claude Opus 5 unknown | 52.70 | 2026-07-24 | 未知 | 闭源 |
5 | ![]() Muse Spark 1.2 unknown | 46.20 | 2026-08-05 | 未知 | 闭源 |
6 | ![]() MiniMax M3 unknown | 37.90 | 2026-06-01 | 4280亿 | 非商用 |