SimpleBench
查看详情SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
评测基准库
本页面汇总了当前业界主流的大模型评测基准,包括AIME 2025, SWE Bench Verified, MMLU、GSM8K、HumanEval 等。我们致力于为研究者和开发者提供一个全面的参考平台,帮助大家了解不同大模型在各种评测数据集上的性能表现。
全部基准
205
所有类型
14
所有语言
9
大模型在评测基准的详细评测结果:主流大模型评测基准榜单
由编辑挑选,帮助你发现值得关注的评测基准。
SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
ARC-AGI-3 是面向智能体的交互式推理基准,要求在没有自然语言指令的环境中探索、推断目标、建立世界模型并规划行动。100% 表示达到人类基线的行动效率。成绩同时受模型、思考档位和评测环境影响。本站分别记录 Standard 与 Provider Adapter;后者支持供应商原生状态和上下文管理,具体实现见运行证据。不同环境的成绩分组展示,环境未核实的历史成绩不参与排名。
Terminal-Bench 4.0 是 Terminal-Bench 团队持续维护的终端智能体评测版本,于2026年8月28日正式发布,通过 66 个容器化专业计算机任务测量模型与 Agent 脚手架组成的完整系统。4.0 将每次 Agent 运行的超时上限统一调整为 8 小时,修复 19 个任务,并移除 8 个已饱和、容易触发拒答、存在公开解法或仍有质量与平台问题的任务。每个任务运行 5 次,榜单报告任务解决率及 95% 置信区间;因任务集和资源规则已发生破坏性变更,4.0 成绩不应与 3.0 或 2.x 直接对比。
CursorBench 是 Cursor 基于真实 Cursor 会话中的模糊、多文件任务构建的内部编程 Agent 评测。4.0 版新增长周期任务,覆盖编辑、重构、调查、意图理解、作业管理和设计一致性;官方同时提示小幅分数差异可能不具统计意义。任务、Agent harness 和评分口径由 Cursor 维护,因此结果应视为特定模型、思考档位与 Cursor 工具环境组成的系统成绩。
已匹配 8 个基准,建议先看对应榜单,再进入模型对比。
Artificial Analysis 第三方综合智能评测指数,覆盖推理、知识、编程等多维度任务,按厂商公开 API 独立测试。
Vals AI Index
Vals Index 是 Vals AI 发布的跨行业智能体能力综合指数。本页保留早期采集的历史成绩,其精确指数版本未完整记录,不能与最新 v2.1 直接比较;请通过评测系列版本入口查看 Vals Index v2.1。当前 v2.1 汇总金融、编码、法律和税务任务,按美国 GDP 行业份额加权。数据来源:Vals AI(https://www.vals.ai/benchmarks/vals_index)。© 2026 Vals AI. All rights reserved. 公开成绩由本站整理展示;未发现开放数据再分发许可,不代表 Vals AI 授权、合作或背书。
Artificial Analysis 智能指数 4.2 版,由 Artificial Analysis 自行测试得出的综合分,本条目为 max 档位、按任务配置工具的成绩。4.2 版与 4.1.1 版分数不可比较。
ARC Prize Foundation 于 2026-09-12 宣布的下一代 ARC-AGI 评测,目标是衡量自主、开放式创新能力。官方尚未公布任务集、题量、指标、技术报告、数据集、排行榜或模型成绩;本条目暂不提供分数,且不得与 ARC-AGI-1、2、3 的结果直接比较。
Artificial Analysis Intelligence Index v4.3
Artificial Analysis Intelligence Index v4.3 是跨能力综合指数,由 10 项评测组成,按 Agents 30%、Coding 20%、General 30%、Scientific Reasoning 20% 加权。v4.3 将 Terminal-Bench 升级为 4.0,并以 AutomationBench-AA 替换 τ³-Banking;当前方法学补丁版本为 v4.3.1。
Vals Recursive Self-Improvement Index
Vals RSI Index 衡量模型离「递归自我改进」有多远——即模型能否在固定算力与时间预算内自主完成造出下一代模型所需的研究与实验。由 Compression、LM Training、Parameter Golf、Harness Engineering、Post-Training 五项任务取平均,采用参照锚定的对数刻度:0 为基线,0.5 对应已发表/人类/前沿参照水平,1 为理论上限。
Epoch Capabilities Index
Epoch Capabilities Index(ECI)是 Epoch AI 发布的跨基准综合能力指数:用项目反应理论把 50 多个评测基准的成绩放到同一尺度上,得到每个模型的一个“通用能力”分数,并以 Claude 3.5 Sonnet=130、GPT-5=150 为锚点。它的用处是在单个基准饱和之后仍能跨年份比较模型。分数是相对尺度,不是正确率。
Vals Index v2.1 — GDP-weighted Agentic Evaluation
Vals Index v2.1 是 Vals AI 发布的跨行业智能体能力综合指数,汇总金融、编码、法律和税务八项评测,按美国 GDP 行业份额加权(8.0、5.6、1.2、0.5)。分数为加权准确率百分比,越高越好。v2.1 新增税务并将编码组件切换为 Terminal-Bench 4.0,与旧版本分数不可直接比较。各组件工具与运行配置不同;官方标注的部分模型成绩包含拒答后的 fallback 模型辅助。数据来源:Vals AI 官方榜单(https://www.vals.ai/benchmarks/vals_index),官方更新日期 2026-09-29。© 2026 Vals AI. All rights reserved. 公开成绩由本站整理展示;未发现开放数据再分发许可,不代表 Vals AI 授权、合作或背书。 本站当前展示已确认映射的 36/41 行;本站名次按已收录模型计算,完整榜单见官方来源。