SimpleBench
查看详情SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
评测基准库
本页面汇总了当前业界主流的大模型评测基准,包括AIME 2025, SWE Bench Verified, MMLU、GSM8K、HumanEval 等。我们致力于为研究者和开发者提供一个全面的参考平台,帮助大家了解不同大模型在各种评测数据集上的性能表现。
全部基准
205
所有类型
14
所有语言
9
大模型在评测基准的详细评测结果:主流大模型评测基准榜单
由编辑挑选,帮助你发现值得关注的评测基准。
SimpleBench 是一个包含 213 道英文六选一题目的常识推理基准,覆盖时空推理、社会智能和语言对抗性问题。每道题运行 5 次并报告平均正确率;通常使用 temperature=0.7、top-p=0.95,o 系列模型除外。官方由 9 名参与者的小样本测得非专业人类基线 83.7%。
ARC-AGI-3 是面向智能体的交互式推理基准,要求在没有自然语言指令的环境中探索、推断目标、建立世界模型并规划行动。100% 表示达到人类基线的行动效率。成绩同时受模型、思考档位和评测环境影响。本站分别记录 Standard 与 Provider Adapter;后者支持供应商原生状态和上下文管理,具体实现见运行证据。不同环境的成绩分组展示,环境未核实的历史成绩不参与排名。
Terminal-Bench 4.0 是 Terminal-Bench 团队持续维护的终端智能体评测版本,于2026年8月28日正式发布,通过 66 个容器化专业计算机任务测量模型与 Agent 脚手架组成的完整系统。4.0 将每次 Agent 运行的超时上限统一调整为 8 小时,修复 19 个任务,并移除 8 个已饱和、容易触发拒答、存在公开解法或仍有质量与平台问题的任务。每个任务运行 5 次,榜单报告任务解决率及 95% 置信区间;因任务集和资源规则已发生破坏性变更,4.0 成绩不应与 3.0 或 2.x 直接对比。
CursorBench 是 Cursor 基于真实 Cursor 会话中的模糊、多文件任务构建的内部编程 Agent 评测。4.0 版新增长周期任务,覆盖编辑、重构、调查、意图理解、作业管理和设计一致性;官方同时提示小幅分数差异可能不具统计意义。任务、Agent harness 和评分口径由 Cursor 维护,因此结果应视为特定模型、思考档位与 Cursor 工具环境组成的系统成绩。
已匹配 6 个基准,建议先看对应榜单,再进入模型对比。
AutomationBench 是 Zapier 发布的跨应用业务工作流智能体基准。公开成绩覆盖销售、营销、运营、客服、财务和人力资源六个领域共 600 个任务,智能体在 47 个模拟 SaaS 工具中操作,并按最终环境状态的确定性断言计分。Zapier 官方验证排行榜另用未公开的保留任务集,因此公开集与私有榜成绩需要区分。
Artificial Analysis Briefcase
AA-Briefcase 是 Artificial Analysis 的真实知识工作智能体评测,完整版包含 91 个任务、4 个正式场景,任务要求处理大量源文件并生成 Excel、PowerPoint、PDF、Word 等可交付成果。官方同时报告综合 Elo、Rubric Pass Rate、Analytical Quality Elo 和 Presentation Elo。
OfficeQA Pro
Office QA Pro 是 Kimi K3 官方技术博客完整评测表采用的基准。本条目用于承载官方发布成绩;Kimi K3 的全局测试设置为 reasoning_effort=max、temperature=1.0、top_p=1.0,具体 harness、工具使用和重复运行口径以官方脚注为准。
SaaS-Bench 用于评估智能体操作软件即服务应用并完成跨步骤任务的能力;Kimi K3 成绩来自官方开放权重模型卡。
Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies
Workspace-Bench 用于评估智能体在真实「工作区」中处理大规模文件依赖的能力,即所谓 Workspace Learning:能否识别、推理、利用并更新异构文件之间显式与隐式的依赖关系。基准构建了 5 类职业画像(运营经理、物流经理、AI 产品经理、研究员、后端开发)的工作区,涵盖 74 种文件类型、20,476 个文件(最大约 20GB),并整理出 388 道任务、7,399 条评分细则,要求跨文件检索、上下文推理与自适应决策。另提供 100 题的 Workspace-Bench-Lite 子集。
OfficeQA 是 Databricks 发布的公开评测,考察模型在美国财政部公报历史文档语料上的端到端有据推理能力:需要跨语料定位相关表格并做精确数值推理。通常以智能体方式评测,文档以抽取文本形式提供并开放代码执行工具。OfficeQA Pro 为其面向前沿模型的 133 题加难子集(见 Office QA Pro 条目)。