SimpleBench
查看详情SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
评测基准库
本页面汇总了当前业界主流的大模型评测基准,包括AIME 2025, SWE Bench Verified, MMLU、GSM8K、HumanEval 等。我们致力于为研究者和开发者提供一个全面的参考平台,帮助大家了解不同大模型在各种评测数据集上的性能表现。
全部基准
205
所有类型
14
所有语言
9
大模型在评测基准的详细评测结果:主流大模型评测基准榜单
由编辑挑选,帮助你发现值得关注的评测基准。
SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
ARC-AGI-3 是面向智能体的交互式推理基准,要求在没有自然语言指令的环境中探索、推断目标、建立世界模型并规划行动。100% 表示达到人类基线的行动效率。成绩同时受模型、思考档位和评测环境影响。本站分别记录 Standard 与 Provider Adapter;后者支持供应商原生状态和上下文管理,具体实现见运行证据。不同环境的成绩分组展示,环境未核实的历史成绩不参与排名。
Terminal-Bench 4.0 是 Terminal-Bench 团队持续维护的终端智能体评测版本,于2026年8月28日正式发布,通过 66 个容器化专业计算机任务测量模型与 Agent 脚手架组成的完整系统。4.0 将每次 Agent 运行的超时上限统一调整为 8 小时,修复 19 个任务,并移除 8 个已饱和、容易触发拒答、存在公开解法或仍有质量与平台问题的任务。每个任务运行 5 次,榜单报告任务解决率及 95% 置信区间;因任务集和资源规则已发生破坏性变更,4.0 成绩不应与 3.0 或 2.x 直接对比。
CursorBench 是 Cursor 基于真实 Cursor 会话中的模糊、多文件任务构建的内部编程 Agent 评测。4.0 版新增长周期任务,覆盖编辑、重构、调查、意图理解、作业管理和设计一致性;官方同时提示小幅分数差异可能不具统计意义。任务、Agent harness 和评分口径由 Cursor 维护,因此结果应视为特定模型、思考档位与 Cursor 工具环境组成的系统成绩。
已匹配 7 个基准,建议先看对应榜单,再进入模型对比。
τ²-Bench - Overall
用于评估大模型智能体在双控(人机协同)环境下任务执行与沟通能力的开放基准
面向电信领域的用于评估大模型在人机协同场景下的任务执行能力
τ³-Benchmark - Banking
τ³-Banking 是 Kimi K3 模型卡采用的银行业务智能体评测,考察多轮交互和工具驱动任务完成能力。
τ³-Bench - Overall
τ³-Bench 是 Sierra 推出的第三代「工具-智能体-用户」评测,是 τ-Bench / τ²-Bench 的延续。在 τ²-Bench 双控(人机协同)环境的基础上,τ³ 新增了 τ-Knowledge(考察智能体在跨系统、跨格式的企业内部文档集合上的知识检索与运用)与 τ-Voice(全双工语音对话评测),并对既有任务做了大批量质量修正。代码与 τ² 一同维护在 sierra-research/tau2-bench 仓库中。此条目记录官方模型卡常用的 τ³-Bench 综合成绩,细分领域(如银行)另有独立条目。
VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions
VitaBench 2.0 是美团 LongCat 团队 VitaBench 的第二代交互式智能体评测。初代 VitaBench 基于外卖、到店消费与在线旅行等生活服务场景,构建了包含 66 个工具的复杂模拟环境,提供 100 道跨场景任务与 300 道单场景任务。2.0 版进一步面向长期用户交互中的个性化与主动性:任务按单个用户的时间顺序组织成序列,每条序列跨多个领域,每道任务配有专属工具集与可执行环境,要求智能体在交互过程中持续抽取、运用并更新用户偏好。
Public Benefits Bench v1.1 (SNAP benefits navigation)
Public Benefits Bench 考察模型能否可靠地帮助普通人办理美国 SNAP(食品券)福利,涉及资格判定、申请流程以及各州各地不同的政策细节。共 459 道题(已公布成绩用其中 230 道测试集),按数据集中 2931 条评分要点的通过比例计分。部分厂商与榜单沿用其早期名称「SNAP」,本站按同一条目收录。
Student Assessment with Generative Evaluation
SAGE(Student Assessment with Generative Evaluation)考察模型能否按既定评分标准批改学生手写的数学作业,需要识读数学符号、理解评分细则并保持判分一致,题目覆盖自动机、线性代数、偏微分方程等高等数学领域。