大模型 Agent 能力评测排行榜
本页面提供大模型 Agent 能力评测排行榜,涵盖 Terminal-Bench 4.0、τ²-Bench、MCP-Atlas、Tool Decathlon、OSWorld-Verified 等主流 Agent 评测基准,深度对比 GPT、Claude、Qwen、DeepSeek 等模型的工具使用、任务规划与自主执行能力。
数据更新于 2026-10-01 08:16:28
截至 2026年10月,本页覆盖 Terminal-Bench 4.0, τ²-Bench, MCP-Atlas, Tool Decathlon 等评测基准,聚焦 大模型 Agent 能力评测排行榜 方向的模型对比。
点击模型名称可进入详情页查看上下文长度、许可方式与 API 价格。数据口径说明见 数据方法论。
点击任意行查看模型详情;勾选左侧 可对比最多 4 个模型。
排序:
暂无数据