DataLearner 标志
返回总榜单

大模型 Agent 能力评测排行榜

本页面提供大模型 Agent 能力评测排行榜,涵盖 Terminal-Bench 4.0、τ²-Bench、MCP-Atlas、Tool Decathlon、OSWorld-Verified 等主流 Agent 评测基准,深度对比 GPT、Claude、Qwen、DeepSeek 等模型的工具使用、任务规划与自主执行能力。

数据更新于 2026-10-01 08:16:28

截至 2026年10月,本页覆盖 Terminal-Bench 4.0, τ²-Bench, MCP-Atlas, Tool Decathlon 等评测基准,聚焦 大模型 Agent 能力评测排行榜 方向的模型对比。

点击模型名称可进入详情页查看上下文长度、许可方式与 API 价格。数据口径说明见 数据方法论。

基准评测
Terminal-Bench 4.0
τ²-Bench
MCP-AtlasTool Decathlon
OSWorld-Verified

榜单亮点

按 τ²-Bench 排序

大模型性能评测结果

数据来源:DataLearnerAI

点击任意行查看模型详情;勾选左侧 可对比最多 4 个模型。

Terminal-Bench 4.0—
τ²-Bench75.10
MCP-Atlas54.60
Tool Decathlon—
OSWorld-Verified—
免费商用
Terminal-Bench 4.0—
τ²-Bench42.20
MCP-Atlas—
Tool Decathlon—
OSWorld-Verified—
免费商用
Terminal-Bench 4.0—
τ²-Bench24.50
MCP-Atlas—
Tool Decathlon—
OSWorld-Verified—
免费商用
排序: