该榜单已停用。 发布方已推出新版本,下方成绩来自旧版本,仅供参考,与新版本不可直接比较。最新成绩请看 IOI (Vals v2)
在衡量大语言模型(LLM)智能水平的众多方法中,除了常见的常识推理、专业领域测评外,还有一个正在兴起且极具挑战性的方向——算法问题求解。在这一领域,几乎没有哪项比赛能比 国际信息学奥林匹克(International Olympiad in Informatics,简称 IOI) 更具权威性与含金量。
Vals AI 的 IOI v1 使用 2024 年国际信息学奥林匹克竞赛的 6 道编程题。模型可在 C++ 环境运行代码,并最多提交 50 次获得评分反馈;成绩按官方子任务分数计算。v1 已归档,与采用不同评测方式的 IOI v2 成绩不可直接比较。
查看 IOI 2024 (Vals v1) 的最新得分、模型模式、发布时间与参数规模,快速了解当前完整榜单表现。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 排名 | 模型 | 开源情况 | |||
|---|---|---|---|---|---|
Grok 4 开启思考工具 | 23.20 | 2025-07-10 | 未知 | 闭源 | |
![]() Gemini 2.5-Pro 开启思考工具 | 19.00 | 2025-06-05 | 未知 | 闭源 | |
![]() Opus 4.1 常规模式工具 | 18.70 | 2025-08-06 | 未知 | 闭源 | |
4 | ![]() GPT-5 开启思考工具 | 11.00 | 2025-08-07 | 未知 | 闭源 |
5 | ![]() Claude Sonnet 4 常规模式工具 | 9.70 | 2025-05-23 | 未知 | 闭源 |
6 | ![]() OpenAI o4 - mini 开启思考工具 | 7.70 | 2025-04-16 | 未知 | 闭源 |
7 | ![]() Gemini 2.5 Flash 常规模式工具 | 5.20 | 2025-04-17 | 未知 | 闭源 |
8 | ![]() Claude Sonnet 4 开启思考工具 | 5.20 | 2025-05-23 | 未知 | 闭源 |
9 | ![]() DeepSeek-V3-0324 常规模式工具 | 1.70 | 2025-03-24 | 6710亿 | 免费商用 |
10 | ![]() Kimi K2 常规模式工具 | 0.5 | 2025-07-11 | 10000亿 | 免费商用 |