DataLearner 标志

Claude Fable 5.1 评测详情

Claude Fable 5.1 当前已收录的代表性评测结果包括 HLE(2 / 235,得分 65)、ECI(2 / 167,得分 165)、SciCode(2 / 134,得分 63.10)。本页还提供与 3 个竞品模型及 1 个前代或同系列模型的对比,在有数据时会展示性能和价格视图。

评测结果

Claude Fable 5.1

评测结果

思考模式
工具使用
联网能力

抽象归纳与泛化

共 11 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
思考水平·低
90
74 / 193
ARC-AGI-1
思考水平·中
94.50
38 / 193
ARC-AGI-1
思考水平·高
96
30 / 193
ARC-AGI-1
思考水平·Max
97.50
11 / 193
ARC-AGI-1
思考水平·极高
96.50
24 / 193
ARC-AGI-2
思考水平·低
78.33
41 / 181
ARC-AGI-2
思考水平·中
86.25
26 / 181
ARC-AGI-2
思考水平·高
88.75
20 / 181
ARC-AGI-2
思考水平·Max
90
13 / 181
ARC-AGI-2
思考水平·极高
90
13 / 181
ARC-AGI-2
思考水平·极高工具
90
13 / 181

综合知识考试

共 5 项评测
评测名称 / 模式
得分
排名/总数
Global MMLU
思考水平·Max
94
1 / 1
MILU
思考水平·Max
93
1 / 1
HLE
思考水平·Max
60.90
9 / 235
HLE
思考水平·Max工具
65
2 / 235
HLE
思考水平·极高
46.50
53 / 235

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
2162
2 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
开启思考
86.60
2 / 96

仓库修复与多文件工程

共 6 项评测
评测名称 / 模式
得分
排名/总数
SWE-Bench Pro V2
思考水平·高工具
99.10
2 / 10
SWE-Bench Pro V2 Hard
思考水平·高工具
92.20
2 / 11
SWE-bench Multilingual
思考水平·Max工具
89.10
2 / 30
SWE-Bench Pro - Public
思考水平·Max工具
81.20
1 / 62
DeepSWE
思考水平·Max工具
67.40
32 / 92
SWE-bench Multimodal
思考水平·Max工具
54.70
1 / 1

跨应用与工具编排

共 2 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
思考水平·Max工具
87.20
3 / 44
Toolathlon-Verified
思考水平·Max工具
77.80
2 / 14

跨能力聚合指数

共 9 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
165
2 / 167
Vals Index
思考水平·Max工具
68.83
3 / 42
58
14 / 28
60
11 / 28
62
5 / 28
66
1 / 28
65
2 / 28
Vals Index v2.1
思考水平·Max工具
65.83
4 / 36
53.35
2 / 29

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld 2.0
思考水平·Max工具
77.90
2 / 14

程序生成与编辑

共 4 项评测
评测名称 / 模式
得分
排名/总数
Vibe Code Bench v1.1
思考水平·Max工具
90.26
4 / 61
Program Bench
思考水平·Max工具
87.60
1 / 15
FrontierCode 1.1 Extended
思考水平·中工具
63.60
3 / 7
FrontierCode 1.1 Main
思考水平·中工具
50.90
6 / 11

办公与文档流程

共 3 项评测
评测名称 / 模式
得分
排名/总数
OfficeQA
思考水平·Max工具
80.20
1 / 1
Office QA Pro
思考水平·Max工具
69
1 / 5
AutomationBench
思考水平·Max工具
31.40
20 / 25

科学知识与推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
MysteryMechanism
思考水平·Max工具
47.75
3 / 13
CritPt
思考水平·低
27.70
19 / 204
CritPt
思考水平·中
29.10
12 / 204
CritPt
思考水平·高
30.30
8 / 204
CritPt
思考水平·Max
29.70
11 / 204
CritPt
思考水平·极高
31.10
5 / 204

科学计算与科研编程

共 6 项评测
评测名称 / 模式
得分
排名/总数
SciCode
思考水平·低
56.70
23 / 134
SciCode
思考水平·中
56.40
27 / 134
SciCode
思考水平·高
58.70
13 / 134
SciCode
思考水平·Max
63.10
2 / 134
SciCode
思考水平·极高
60.90
4 / 134
Terminal-Bench-Science 0.1
思考水平·Max工具
40
4 / 18

客服与业务流程

共 7 项评测
评测名称 / 模式
得分
排名/总数
Public Benefits Bench v1.1
思考水平·Max工具
74.90
2 / 26
SAGE
思考水平·Max工具
48.53
20 / 64
τ³-Banking
思考水平·低工具
39
37 / 167
τ³-Banking
思考水平·中工具
41
29 / 167
τ³-Banking
思考水平·高工具
43.10
24 / 167
τ³-Banking
思考水平·Max工具
47.20
10 / 167
τ³-Banking
思考水平·极高工具
45.80
14 / 167

法律

共 7 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
思考水平·低工具
92.33
10 / 44
Harvey Lab-AA
思考水平·中工具
92.65
8 / 44
Harvey Lab-AA
思考水平·高工具
92.95
7 / 44
Harvey Lab-AA
思考水平·Max工具
93.02
6 / 44
Harvey Lab-AA
思考水平·极高工具
93.27
5 / 44
Legal Research Bench
思考水平·Max工具
55.29
1 / 42
Harvey's Legal Agent Benchmark
思考水平·Max工具
6.67
17 / 43

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
Tax Agent Bench
思考水平·Max工具
77.64
1 / 20
EMB (Excel Modeling)
思考水平·Max工具
76.67
1 / 42
Finance Agent v2
思考水平·Max工具
58.88
7 / 43

自主开发与终端任务

共 11 项评测
评测名称 / 模式
得分
排名/总数
CursorBench 3.2
思考水平·Max工具
73.40
1 / 5
Terminal-Bench 4.0
思考水平·低工具
43.33
20 / 98
Terminal-Bench 4.0
思考水平·中工具
53.94
12 / 98
Terminal-Bench 4.0
思考水平·高工具
54.55
10 / 98
Terminal-Bench 4.0
思考水平·Max工具
57.88
5 / 98
Terminal-Bench 4.0
思考水平·极高工具
57.88
5 / 98
CursorBench 4.0
思考水平·低工具
45.10
7 / 43
CursorBench 4.0
思考水平·中工具
46.80
4 / 43
CursorBench 4.0
思考水平·高工具
49.20
3 / 43
CursorBench 4.0
思考水平·Max工具
51.80
1 / 43
CursorBench 4.0
思考水平·极高工具
51.60
2 / 43

文档与图表理解

共 7 项评测
评测名称 / 模式
得分
排名/总数
Chartography
思考水平·Max
42.60
11 / 11
Chartography
思考水平·Max工具
86.20
2 / 11
GDP.pdf
思考水平·低
28
7 / 122
GDP.pdf
思考水平·中
26.80
11 / 122
GDP.pdf
思考水平·高
26.80
11 / 122
GDP.pdf
思考水平·Max
26.20
14 / 122
GDP.pdf
思考水平·极高
26.20
14 / 122

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
思考水平·Max工具联网
57.50
2 / 29

医学知识与健康咨询

共 3 项评测
评测名称 / 模式
得分
排名/总数
HealthBench
思考水平·Max
66.70
1 / 1
60
1 / 3

临床工作与医疗决策

共 3 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
思考水平·Max工具
91.29
2 / 66
HealthBench Professional
思考水平·Max
74.20
1 / 2
MedCode
思考水平·Max工具
53.51
6 / 64

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v3
思考水平·极高工具
0.26
3 / 13

编码综合评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA Coding Agent Index v1.5
思考水平·Max工具
62.20
1 / 11

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
思考水平·Max工具
54.61
6 / 43

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
思考水平·Max工具
90.78
4 / 26

数学

共 2 项评测
评测名称 / 模式
得分
排名/总数
ProofBench v1.1 (Lean 4)
思考水平·Max工具
100
1 / 28
FrontierMath Erdős
思考水平·Max工具
0
2 / 5

多轮记忆与持续上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
EBR-bench
思考水平·Max工具
57.14
3 / 23

竞品对比

Claude Fable 5.1 与同类主流模型的评测得分对比

评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。

评测项Claude Fable 5.1当前GPT-5.6 Sol ProGPT-5.6 Sol
ARC-AGI-1
Score (%)
抽象归纳与泛化
97.50思考水平·高
--
97.50思考水平·极高
ARC-AGI-2
Score (% solved); cost per task (USD)
抽象归纳与泛化
90.00思考水平·极高 | 工具
--
92.50思考水平·高
HLE
Accuracy
综合知识考试
65.00思考水平·高 | 工具
--
44.50思考水平·高
Creative Writing
Elo、大模型评判两两对战
写作与创意表达
2162.00常规模式
--
1971.60常规模式
SimpleBench
Score (AVG@5)
常识推理
86.60开启思考
71.70思考水平·极高
64.80思考水平·极高
DeepSWE
Pass@1 (DeepSWE v1.1)
仓库修复与多文件工程
67.40思考水平·高 | 工具
--
72.70思考水平·极高 | 工具
SWE-Bench Pro - Public
Accuracy
仓库修复与多文件工程
81.20思考水平·高 | 工具
--
64.60思考水平·极高 | 工具
SWE-Bench Pro V2
Resolve Rate (%, pass@1)
仓库修复与多文件工程
99.10思考水平·高 | 工具
--
95.50思考水平·极高 | 工具
SWE-Bench Pro V2 Hard
Resolve Rate (%, pass@1)
仓库修复与多文件工程
92.20思考水平·高 | 工具
--
82.40思考水平·极高 | 工具
MCP-Atlas
Pass rate / claim coverage
跨应用与工具编排
87.20思考水平·高 | 工具
--
81.80思考水平·高 | 工具
AA Intelligence Index (historical versions)
Historical index (not comparable)
跨能力聚合指数
66.00思考水平·高 | 工具
--
61.00思考水平·高 | 工具
ECI
ECI score (capability index, higher is better)
跨能力聚合指数
165.00思考水平·高
--
161.99思考水平·高
其余 36 个 benchmark 仍可在上方图表中查看。

Claude Fable 5.1 与同类模型的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

若存在上下文阈值,图中标准价仅适用于以下范围:

GPT-5.6 Sol Pro: 标准价适用于 <= 272000
模型供应商标准输入标准输出标准价适用于
Claude Fable 5.1
Anthropic$10 / 1M tokens$50 / 1M tokens—
GPT-5.6 Sol Pro
OpenAI$4 / 1M tokens$20 / 1M tokens<= 272000
GPT-5.6 Sol
OpenAI$4 / 1M tokens$20 / 1M tokens—

历代版本对比

Claude Fable 5.1 系列各版本的评测成绩纵向对比

Claude Fable 5.1Claude Fable 5
评测类别:
柱状图按当前筛选范围内每个模型在各评测中的最高分展示;百分制评测使用原始高度,超出 0-100 的评测按该评测内相对比例缩放,标签仍保留原始分数。

12 项可对比评测得分汇总。每个模型展示最佳得分,模式在分数下方标注。· 点击任意行可切换下方趋势图。

评测项Claude Fable 5.1当前Claude Fable 5
ARC-AGI-1
Score (%)
抽象归纳与泛化
97.50思考水平·高
98.50思考水平·极高 | 工具
ARC-AGI-2
Score (% solved); cost per task (USD)
抽象归纳与泛化
90.00思考水平·极高 | 工具
89.17思考水平·高
HLE
Accuracy
综合知识考试
65.00思考水平·高 | 工具
59.00深度思考模式
Creative Writing
Elo、大模型评判两两对战
写作与创意表达
2162.00常规模式
1943.10常规模式
SimpleBench
Score (AVG@5)
常识推理
86.60开启思考
81.90常规模式
DeepSWE
Pass@1 (DeepSWE v1.1)
仓库修复与多文件工程
67.40思考水平·高 | 工具
69.91深度思考模式 | 工具
SWE-Bench Pro - Public
Accuracy
仓库修复与多文件工程
81.20思考水平·高 | 工具
80.30深度思考模式 | 工具
MCP-Atlas
Pass rate / claim coverage
跨应用与工具编排
87.20思考水平·高 | 工具
83.30常规模式 | 工具
AA Intelligence Index (historical versions)
Historical index (not comparable)
跨能力聚合指数
66.00思考水平·高 | 工具
62.00思考水平·高 | 工具
ECI
ECI score (capability index, higher is better)
跨能力聚合指数
165.00思考水平·高
163.60思考水平·高
Vals Index
跨行业任务准确率综合指数
跨能力聚合指数
68.83思考水平·高 | 工具
66.04思考水平·高 | 工具
Vals Index v2.1
GDP-weighted accuracy (%)
跨能力聚合指数
65.83常规模式 | 工具
61.39常规模式 | 工具
其余 24 个 benchmark 仍可在上方图表中查看。

单评测历史趋势图

当前查看:ARC-AGI-1 · 抽象归纳与泛化

选择评测
常规常规 + 工具推理推理 + 工具深度推理深度推理 + 工具

横轴为模型与发布时间,纵轴为分数;同一模式会用实线串起版本变化,同代不同模式继续用虚线辅助对齐。

Claude Fable 5.1 所在系列的标准 API 价格对比

按模型并排展示标准文本输入价与输出价;若存在超长上下文加价,仅保留阈值内标准价,并在下方说明适用范围。

数据来源:DataLearnerAI,展示默认供应商的标准文本价格。 · USD / 1M tokens

模型供应商标准输入标准输出标准价适用于
Claude Fable 5.1
Anthropic$10 / 1M tokens$50 / 1M tokens—
Claude Fable 5
Anthropic$10 / 1M tokens$50 / 1M tokens—