OSWorld 2.0 由 XLANG Lab 发布,包含 108 个长程真实计算机操作任务,人类完成单个任务的中位耗时约 1.6 小时。官方同时报告两套口径:partial score(按任务内检查点给部分分,平均每个任务 27.25 个检查点)与 strict 二值完成率(必须完全达成最终状态才计分),两者数值差距极大,不可混用。本站本基准统一收录 partial score 口径;strict 口径成绩请以厂商模型卡原文为准。另需注意各家使用的任务集版本不同(如 Anthropic 在 2026-08 任务集上重测),跨厂商比较仅供参考。
查看 OSWorld 2.0 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
![]() Claude Opus 5.5 思考水平·Max工具 | 81.80 | 2026-09-22 | 未知 | 闭源 | |
![]() Claude Fable 5.1 思考水平·Max工具 | 77.90 | 2026-09-01 | 未知 | 闭源 | |
![]() GPT-6 Astra 思考水平·Max工具 | 72.60 | 2026-09-03 | 未知 | 闭源 | |
4 | ![]() Claude Opus 5 思考水平·Max工具 | 70.57 | 2026-07-24 | 未知 | 闭源 |
5 | ![]() Gemini 4 Argon 思考水平·Max工具 | 69.20 | 2026-09-30 | 未知 | 闭源 |
6 | ![]() Muse Spark 1.3 思考水平·Max工具 | 66.90 | 2026-09-02 | 未知 | 闭源 |
7 | ![]() GPT-5.6 Sol unknown | 65.70 | 2026-06-26 | 未知 | 闭源 |
8 | ![]() GPT-6 Sol 思考水平·Max工具 | 64.40 | 2026-09-22 | 未知 | 闭源 |
9 | ![]() GPT-5.6 Sol 思考水平·极高工具 | 62.60 | 2026-06-26 | 未知 | 闭源 |
10 | ![]() Gemini 3.8 Flash 开启思考工具 | 59.00 | 2026-09-02 | 未知 | 闭源 |
11 | ![]() Kimi K3 思考水平·Max工具 | 58.30 | 2026-07-16 | 28000亿 | 有条件商用 |
12 | ![]() GPT-6 Luna 思考水平·Max工具 | 52.70 | 2026-09-22 | 未知 | 闭源 |
13 | ![]() Qwen3.8-Flash-Next 思考水平·极高工具 | 52.30 | 2026-08-26 | 1250亿 | 有条件商用 |
14 | ![]() Gemini 3.7 Flash 思考水平·中工具 | 47.90 | 2026-08-13 | 未知 | 闭源 |