DataLearner 标志

DeepSeek-V3.1 Terminus 评测详情

DeepSeek-V3.1 Terminus 当前已收录的代表性评测结果包括 SimpleQA(2 / 46,得分 96.80)、MMLU-Pro(28 / 175,得分 85)、LiveCodeBench(33 / 125,得分 80)。

评测结果

DeepSeek-V3.1 Terminus

评测结果

思考模式
工具使用

综合知识考试

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMLU-Pro
常规模式
85
28 / 175
MMLU-Pro
思考模式
85
28 / 175
HLE
常规模式
21.70
147 / 235
HLE
思考模式
15.20
177 / 235

科学知识与推理

共 3 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
80.70
127 / 253
GPQA Diamond
思考模式
79
137 / 253
CritPt
思考模式
1.70
135 / 204

事实可靠性与幻觉

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleQA
常规模式
96.80
2 / 46

仓库修复与多文件工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
常规模式
68.40
69 / 116

算法与竞赛编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
LiveCodeBench
常规模式
74.90
43 / 125
LiveCodeBench
思考模式
80
33 / 125

数学

共 2 项评测
评测名称 / 模式
得分
排名/总数
AIME2025
常规模式
54
94 / 110
AIME2025
思考模式
90
40 / 110

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench Hard
常规模式工具
31.80
100 / 244
Terminal Bench Hard
思考模式工具
30.30
110 / 244
Terminal-Bench
常规模式工具
30
22 / 35
Terminal-Bench
思考模式工具
28
24 / 35

客服与业务流程

共 3 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench
常规模式工具
37
40 / 44
τ²-Bench
思考模式工具
37
40 / 44
τ³-Banking
思考模式工具
21
88 / 167

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
思考模式
38
115 / 134

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
思考模式
5.40
98 / 122