大模型 Agent 能力评测排行榜
本页面提供大模型 Agent 能力评测排行榜,涵盖 Terminal-Bench 4.0、τ²-Bench、MCP-Atlas、Tool Decathlon、OSWorld-Verified 等主流 Agent 评测基准,深度对比 GPT、Claude、Qwen、DeepSeek 等模型的工具使用、任务规划与自主执行能力。
数据更新于 2026-10-01 08:16:28
截至 2026年10月,本页覆盖 Terminal-Bench 4.0, τ²-Bench, MCP-Atlas, Tool Decathlon 等评测基准,聚焦 大模型 Agent 能力评测排行榜 方向的模型对比。
点击模型名称可进入详情页查看上下文长度、许可方式与 API 价格。数据口径说明见 数据方法论。
榜单亮点
按 τ²-Bench 排序大模型性能评测结果
数据来源:DataLearnerAI点击任意行查看模型详情;勾选左侧 可对比最多 4 个模型。
Terminal-Bench 4.0—
τ²-Bench76.90
MCP-Atlas—
Tool Decathlon—
OSWorld-Verified—
免费商用
Terminal-Bench 4.0—
τ²-Bench68.20
MCP-Atlas—
Tool Decathlon—
OSWorld-Verified—
免费商用
Terminal-Bench 4.0—
τ²-Bench49.00
MCP-Atlas—
Tool Decathlon—
OSWorld-Verified—
免费商用
Terminal-Bench 4.00.50
τ²-Bench—
MCP-Atlas—
Tool Decathlon—
OSWorld-Verified—
免费商用
Terminal-Bench 4.0—
τ²-Bench—
MCP-Atlas75.50
Tool Decathlon—
OSWorld-Verified65.90
免费商用
排序:





