DataLearner 标志

AI大模型评测排行榜

聚合 ARC-AGI-2、AIME 2025、SWE-bench Verified 等主流评测的实时排名,按综合、数学、编程、Agent 等维度快速筛选。

查看评测基准详情数据更新于 2026-10-01 10:29:11

综合排名

从三个视角参考大模型表现:AA 智能指数汇总标准化能力评测,LMArena 反映匿名对战中的用户偏好,Vals Index 衡量按行业经济权重加权的实际任务能力。三个榜单各自排名,分数不跨榜比较。

AA Intelligence Index

完整排名

汇总编程、数学、科学、推理、智能体等标准化评测的综合分数。

数据更新于 2026年10月01日

#模型分数
1
Anthropic
Claude Opus 5.5 (max with fallback)
58
2
Anthropic
Claude Opus 5.5 (xhigh with fallback)
56
3
Anthropic
Claude Sonnet 5.5 (max with fallback)
56
4
Anthropic
Claude Opus 5.5 (high with fallback)
54
8
Google
Gemini 4 Argon (high)
53
10
Anthropic
Claude Sonnet 5.5 (xhigh with fallback)
52

LMArena Text Generation

完整排名

基于匿名众包 A/B 对战的 Elo 评分,反映真实用户对回答质量的偏好。

数据更新于 2026年09月30日

#模型Elo
1
Google
gemini-4-argon-high
1525
3
Anthropic
claude-fable-5-high
1505
4
Anthropic
claude-opus-5.5-high
1504
8
Meta
muse-spark-1.3-max
1495
来源:LMArena

Vals Index v2.1

完整排名

按行业经济权重汇总金融、编码、法律和税务任务的准确率。

收录更新于 2026-10-01 09:01:17

来源:Vals AI

按已收录模型排名;官方标注的部分成绩包含 fallback 模型辅助。

© 2026 Vals AI. All rights reserved.

近期排名变化

代码、数学、Agent 榜单近 30 天的排名上升、下降与新上榜模型。

单项评测排名

按数学、编程、Agent 等维度筛选排名。下方可切换评测基准,也可直接进入分类排行榜查看完整排名。 查看全部评测基准。

AI 模型推荐

按 Terminal-Bench 4.0 排序

大模型性能评测结果

数据来源:DataLearnerAI

点击任意行查看模型详情;勾选左侧 可对比最多 4 个模型。表中分数为各评测模式中的最高得分。

Terminal-Bench 4.070.60
HLE64.50
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.066.40
HLE67.70
ARC-AGI-293.33
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.058.18
HLE57.20
ARC-AGI-295.00
FrontierMath Tier 4 v297.60
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.057.88
HLE65.00
ARC-AGI-290.00
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.057.40
HLE—
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.053.94
HLE63.60
ARC-AGI-290.42
FrontierMath Tier 4 v273.17
SWE-bench Verified96.00
τ²-Bench—
闭源
Terminal-Bench 4.044.55
HLE59.00
ARC-AGI-289.17
FrontierMath Tier 4 v287.80
SWE-bench Verified95.00
τ²-Bench—
闭源
Terminal-Bench 4.043.94
HLE—
ARC-AGI-289.58
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.041.82
HLE62.50
ARC-AGI-2—
FrontierMath Tier 4 v229.27
SWE-bench Verified—
τ²-Bench—
有条件商用
Terminal-Bench 4.038.00
HLE—
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.037.27
HLE44.50
ARC-AGI-292.50
FrontierMath Tier 4 v283.00
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.034.85
HLE—
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
免费商用
Terminal-Bench 4.033.30
HLE59.40
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.033.30
HLE—
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.032.80
HLE55.30
ARC-AGI-265.83
FrontierMath Tier 4 v217.07
SWE-bench Verified—
τ²-Bench—
免费商用
Terminal-Bench 4.028.80
HLE—
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
免费商用
Terminal-Bench 4.027.30
HLE—
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.026.80
HLE63.90
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
免费商用
Terminal-Bench 4.025.30
HLE35.90
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
有条件商用
Terminal-Bench 4.023.64
HLE57.90
ARC-AGI-272.08
FrontierMath Tier 4 v256.10
SWE-bench Verified88.60
τ²-Bench—
闭源
Terminal-Bench 4.021.52
HLE—
ARC-AGI-283.90
FrontierMath Tier 4 v270.73
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.020.30
HLE—
ARC-AGI-267.08
FrontierMath Tier 4 v231.71
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.019.70
HLE44.52
ARC-AGI-289.17
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.018.70
HLE56.20
ARC-AGI-2—
FrontierMath Tier 4 v246.34
SWE-bench Verified—
τ²-Bench—
有条件商用
Terminal-Bench 4.017.27
HLE—
ARC-AGI-259.54
FrontierMath Tier 4 v260.98
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.014.60
HLE48.20
ARC-AGI-2—
FrontierMath Tier 4 v22.44
SWE-bench Verified80.60
τ²-Bench—
免费商用
Terminal-Bench 4.014.60
HLE52.20
ARC-AGI-285.00
FrontierMath Tier 4 v272.50
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.013.60
HLE—
ARC-AGI-284.58
FrontierMath Tier 4 v236.59
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.012.63
HLE—
ARC-AGI-259.31
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.012.60
HLE59.80
ARC-AGI-260.42
FrontierMath Tier 4 v239.02
SWE-bench Verified—
τ²-Bench—
有条件商用
Terminal-Bench 4.012.60
HLE—
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.012.42
HLE57.40
ARC-AGI-2—
FrontierMath Tier 4 v229.27
SWE-bench Verified85.20
τ²-Bench—
闭源
Terminal-Bench 4.012.42
HLE—
ARC-AGI-252.64
FrontierMath Tier 4 v224.39
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.07.10
HLE—
ARC-AGI-260.42
FrontierMath Tier 4 v221.95
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.07.10
HLE—
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.06.60
HLE40.20
ARC-AGI-272.08
FrontierMath Tier 4 v226.83
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.06.10
HLE62.10
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.05.60
HLE30.80
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
免费商用
Terminal-Bench 4.04.00
HLE51.40
ARC-AGI-277.10
FrontierMath Tier 4 v2—
SWE-bench Verified80.60
τ²-Bench90.80
闭源
Terminal-Bench 4.03.00
HLE51.50
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified79.00
τ²-Bench—
免费商用
Terminal-Bench 4.03.00
HLE49.00
ARC-AGI-260.42
FrontierMath Tier 4 v2—
SWE-bench Verified79.60
τ²-Bench—
闭源
Terminal-Bench 4.02.00
HLE52.30
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
免费商用
Terminal-Bench 4.02.00
HLE41.50
ARC-AGI-218.90
FrontierMath Tier 4 v29.76
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.02.00
HLE—
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
不可商用
Terminal-Bench 4.01.50
HLE53.50
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified80.40
τ²-Bench—
闭源
Terminal-Bench 4.01.00
HLE54.70
ARC-AGI-2—
FrontierMath Tier 4 v229.27
SWE-bench Verified—
τ²-Bench—
免费商用
Terminal-Bench 4.01.00
HLE46.00
ARC-AGI-2—
FrontierMath Tier 4 v24.88
SWE-bench Verified77.60
τ²-Bench—
免费商用
Terminal-Bench 4.01.00
HLE—
ARC-AGI-210.28
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
Terminal-Bench 4.01.00
HLE—
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
免费商用
Terminal-Bench 4.01.00
HLE—
ARC-AGI-2—
FrontierMath Tier 4 v2—
SWE-bench Verified—
τ²-Bench—
闭源
排序:
已显示 50 / 283 个模型查看 Terminal-Bench 4.0 基准测试完整页面

排行榜常见问题

01

排行榜的数据来源是什么?

所有得分来自一手出处:模型官方 model card、技术报告、论文、厂商博客与可复现的第三方评测。每一行均链回对应的模型详情页,可查看原始引用。

02

为什么同一模型在不同基准上分数差异很大?

每个基准测的能力不一样:推理类(HLE、ARC-AGI-2)、数学类(AIME、FrontierMath)、编程类(SWE-bench Verified)、Agent 工具使用类(τ²-Bench)等。模型在某一能力上专门优化后,往往会牺牲另一些能力,因此排行榜按基准分别展示,而不是合并成一个分数。

03

排行榜多久更新一次?

数据每 5 分钟自动重新校验一次;新模型或新评测结果一旦公开就会同步收录。页面顶部的"数据更新于"指示器反映最近一次数据刷新时间。

04

综合排名应该怎么解读?

综合榜聚合了模型在多个核心基准上的位次,可作为初筛工具。但落地选型时建议进入与你业务最相关的单项基准查看,例如 Coding Agent 看 SWE-bench Verified、工具调用场景看 τ²-Bench。

05

开源大模型和闭源 API 模型怎么对比?

使用顶部的"许可"筛选切换为"全部",开源与闭源模型可在同一基准列直接对比。除分数外,还需考虑总持有成本:闭源模型按 API 用量计费,开源模型则需衡量自部署的硬件与运维成本。

截至 2026年10月,AA 智能指数前列模型包括 Claude Opus 5.5 (max with fallback)、Claude Opus 5.5 (xhigh with fallback)、Claude Sonnet 5.5 (max with fallback),该指数汇总编程、推理、科学等 10 项标准化评测。

LMArena 文本生成榜当前靠前的模型包括 gemini-4-argon-high、Claude Opus 4.6 (high)、claude-fable-5-high,排名基于真人匿名 A/B 投票。

下方可按数学、编程、Agent 等分类查看单项排名。数据口径说明见 数据方法论,延伸阅读见 大模型分析博客。

知名模型开发商

查看全部 106 家机构

点击进入开发商主页,查看其全部模型、系列与产品线。

今日推荐每日轮换 · 发现更多机构

模型对比分析

逐项对比的深度分析:评测分差到底意味着什么,以及什么场景该选哪一个。

全部对比

探索更多

排行榜只覆盖参与评测的模型。你还可以按模型、机构或评测基准浏览完整内容。