DataLearner 标志

GPT-5.1-Codex-Max 评测详情

GPT-5.1-Codex-Max 当前已收录的代表性评测结果包括 Terminal-Bench(1 / 35,得分 58.10)、LiveBench(18 / 117,得分 73.98)、SWE-bench Verified(30 / 116,得分 76.80)。

评测结果

GPT-5.1-Codex-Max

评测结果

思考模式
工具使用

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
76.80
30 / 116

自主开发与终端任务

共 1 项评测
评测名称 / 模式
得分
排名/总数
58.10
1 / 35

跨能力综合测试

共 1 项评测
评测名称 / 模式
得分
排名/总数
LiveBench
深度思考模式
73.98
18 / 117

能力边界度量

共 1 项评测
评测名称 / 模式
得分
排名/总数
METR Time Horizons v1.1
常规模式工具
161.75
10 / 22

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
22.17
47 / 61