DataLearner 标志

Qwen3.5-122B-A10B 评测详情

Qwen3.5-122B-A10B 当前已收录的代表性评测结果包括 MMMU-Pro(89 / 229,得分 75)、Pinch Bench(15 / 38,得分 85.50)、Terminal Bench Hard(105 / 244,得分 31.10)。

评测结果

Qwen3.5-122B-A10B

评测结果

思考模式
工具使用

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench Hard
常规模式工具
29.50
115 / 244
Terminal Bench Hard
思考模式工具
31.10
105 / 244

多轮记忆与持续上下文

共 2 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
34.47
107 / 126
Context Arena
思考模式
68.50
67 / 126

跨应用与工具编排

共 2 项评测
评测名称 / 模式
得分
排名/总数
Claw Bench
思考模式工具
86
14 / 29
Pinch Bench
思考模式工具
85.50
15 / 38

跨长文理解与整合

共 1 项评测
评测名称 / 模式
得分
排名/总数
LongBench v2
常规模式
60.20
9 / 14

图像感知与视觉推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
70.30
128 / 229
MMMU-Pro
思考模式
75
89 / 229

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
CritPt
常规模式
0.90
162 / 204
CritPt
思考模式
0.60
172 / 204

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
思考模式
39.70
107 / 134

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
τ³-Banking
常规模式工具
10.30
131 / 167
τ³-Banking
思考模式工具
15.30
110 / 167

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
思考模式
3.40
104 / 122