DataLearner 标志
CL

Claude Opus 5.5

承诺至少可用至 2027-09-22推理大模型编程大模型OpusClaude 5.5

Claude Opus 5.5

别名:Opus 5.5

发布时间: 2026-09-22更新于: 2026-09-29知识截止: 2026-06承诺至少可用至: 2027-09-22浏览量: 745
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1M
多语言支持
支持
推理能力
5/5

Anthropic 于 2026 年 9 月 22 日正式发布 Claude Opus 5.5。该模型支持 100 万 token 上下文、12.8 万 token 输出、文本和图像输入以及始终开启的自适应思考;Claude API 标准价格为每百万 token 输入 $4、输出 $20。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Claude Opus 5.5

模型基本信息

推理过程
支持
思考模式
思考水平 · 自适应思考 (Adaptive Thinking) (默认)
上下文长度
1M tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
支持语种
中文 (中国)、英语 (美国)、日语 (日本)、韩语 (韩国)、德语 (德国)
发布时间
2026-09-22
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2026-06
Claude Opus 5.5

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
Claude Opus 5.5

官方介绍与博客

DataLearnerAI博客
暂无
Claude Opus 5.5

API接口信息

接口速度
4/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$4.00/ 1M tokens$20.00/ 1M tokens
批量模式
类型适用条件输入输出
文本-$2.00/ 1M tokens$10.00/ 1M tokens
快速模式
类型适用条件输入输出
文本-$8.00/ 1M tokens$40.00/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本5m$5.00/ 1M tokens$0.200/ 1M tokens
文本1h$8.00/ 1M tokens—

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Claude Opus 5.5

评测结果

Claude Opus 5.5 当前已收录的代表性评测结果包括 HLE(1 / 235,得分 67.70)、ARC-AGI-1(1 / 193,得分 98.50)、SciCode(1 / 134,得分 66.90)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

抽象归纳与泛化

共 10 项评测
评测名称 / 模式
得分
排名/总数
88.50
75 / 193
97.50
11 / 193
98.50
1 / 193
ARC-AGI-1
最高
97.50
11 / 193
ARC-AGI-1
极高
97.50
11 / 193
70.14
55 / 181
87.50
23 / 181
93.33
3 / 181
ARC-AGI-2
最高
91.67
9 / 181
ARC-AGI-2
极高
92.50
5 / 181

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
最高工具
67.70
1 / 235

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
2050.10
7 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
88.40
1 / 96

自主开发与终端任务

共 5 项评测
评测名称 / 模式
得分
排名/总数
87.64
8 / 57
Terminal-Bench 4.0
最高工具
59.60
3 / 98
Terminal-Bench 4.0
极高工具
66.40
2 / 98
52.50
3 / 4
CursorBench 4.0
最高工具
57.80
1 / 4

跨能力聚合指数

共 4 项评测
评测名称 / 模式
得分
排名/总数

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld 2.0
最高工具
81.80
1 / 14

程序生成与编辑

共 4 项评测
评测名称 / 模式
得分
排名/总数
90.29
3 / 61
54.60
1 / 11
54.40
2 / 11
Program Bench
最高工具
18.50
11 / 15

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
最高工具
40
15 / 25

科学知识与推理

共 2 项评测
评测名称 / 模式
得分
排名/总数
MysteryMechanism
最高工具
49.55
2 / 13
CritPt
最高
31.71
2 / 204

科学计算与科研编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SciCode
最高
66.90
1 / 134
63.30
2 / 18

金融

共 3 项评测
评测名称 / 模式
得分
排名/总数
75.94
2 / 42
Tax Agent Bench
最高工具
70.50
6 / 20
Finance Agent v2
最高工具
58.59
9 / 43

法律

共 2 项评测
评测名称 / 模式
得分
排名/总数
50.48
4 / 42
3.75
25 / 43

文档与图表理解

共 2 项评测
评测名称 / 模式
得分
排名/总数
Chartography
最高工具
89
1 / 11
GDP.pdf
最高
26.20
14 / 122

生物与基因

共 1 项评测
评测名称 / 模式
得分
排名/总数
BioMysteryBench
最高工具
79.26
1 / 4

维护、优化与工程管理

共 2 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
最高工具
66.65
2 / 43
SRE-Bench
最高工具
33.59
1 / 1

机器学习工程

共 1 项评测
评测名称 / 模式
得分
排名/总数

算法与竞赛编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
IOI (Vals v2)
最高工具
95.06
2 / 26

数学

共 1 项评测
评测名称 / 模式
得分
排名/总数
100
1 / 28

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
70.64
3 / 26
SAGE
最高工具
45.83
29 / 64

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
最高工具
91.43
1 / 66
MedCode
最高工具
49.80
11 / 64

多轮记忆与持续上下文

共 1 项评测
评测名称 / 模式
得分
排名/总数
EBR-bench
最高工具
71.43
2 / 23
Claude Opus 5.5

发布机构

Claude Opus 5.5

模型解读

Claude Opus 5.5 是 Claude 5.5 系列的第一个模型,2026 年 9 月 22 日发布。Anthropic 的说法是:它在多数工作上与更高一档的 Fable 5.1 相当,运行成本比 Opus 5 低 40%。官方表格的九项评测里,它都高于 Fable 5.1 和 Opus 5,例如 Terminal-Bench 4.0 为 66.4%(Fable 5.1 为 55.8%,Opus 5 为 52.3%),GDPval-AA 为 1846 Elo(1735 和 1708)。但在 OSWorld 2.1 和 Chartography 上,它只领先 Fable 5.1 1.1 和 0.6 个百分点,基本可以看作持平。

这些分数要打两个折扣来读。第一,Anthropic 自己说,到这个能力水平,评测分差已经不太能反映真实差距,它内部使用时,Opus 5.5 与 Fable 5.1 的差距比分数显示的小。第二,测试是在开启生产环境安全防护的条件下进行的:防护介入时,网络安全任务由 Opus 4.8 完成,生物和前沿大模型研发类任务由 Opus 5 完成,官方称这很可能拉低了 Opus 5.5 的成绩。

几天后发布的 Sonnet 5.5 单价只有它的一半,官方表格里与 Opus 5.5 的差距多数在 1.7 到 3.2 个百分点,Terminal-Bench 4.0 上 70.6% 还高于 Opus 5.5 的 66.4%。Anthropic 认为 Opus 5.5 的价值在需要持续判断的复杂开放式任务上。这类差异目前的评测覆盖得不多,这是我们的推断。任务范围明确、对成本敏感时,按官方评测看,Sonnet 5.5 通常已经够用。

评测怎么读

先看 effort 档位。除特别注明外,Opus 5.5 的成绩是自适应思考 max effort;Terminal-Bench 4.0 用的是 xhigh,因为那是它的最高分,站内 max 档只有 59.6%,xhigh 为 66.4%。调到 max 并不保证更高:FrontierCode 上 medium 为 54.6%,max 为 54.4%;ARC-AGI-1 和 ARC-AGI-2 的最好成绩都出现在 high(98.5% 和 93.33%),而不是 max。不过 CursorBench 4.0 从 medium 的 52.5% 到 max 的 57.8%,还能多 5.3 个百分点。哪一档划算,要按自己的任务测。

再看误差和运行条件。Terminal-Bench 4.0 的标准误是 ±2.6 个百分点,Opus 5.5 与 GPT-6 Astra(57.9%,OpenAI 自报)的差距超出了误差。Terminal-Bench-Science 0.1 的标准误是 ±3.5 到 5 个百分点,Astra 的 64.6% 高于 Opus 5.5 的 58.7%,差距在误差范围附近,不宜下结论。AutomationBench 由 Zapier 运行,没有配置回退模型,安全防护一介入就按失败计,所以 40.0% 会低于实际使用中的水平,同一评测里 GPT-6 Astra 为 41.4%。站内 Sonnet 5.5 在这项评测上是 44.7%,高于 Opus 5.5,两次运行的条件是否一致,我们没有核实。

还要看是否带工具。Opus 5.5 在 Chartography 上带工具为 89.0%,Sonnet 5.5 发布页给出的不带工具成绩是 64.4%,相差 24.6 个百分点。这项评测的成绩主要取决于模式,比较时要核对。

站内排名方面,Opus 5.5 排第一的有 HLE(带工具 67.7%,共 235 个模型)、ARC-AGI-1(98.5%,共 176 个)、SciCode(66.9%,共 134 个)、SimpleBench(88.4%,共 96 个)和 CursorBench 4.0(57.8%,共 47 个)。排名靠后的有 Harvey's Legal Agent Benchmark(43 个里第 25)、SAGE(64 个里第 29)和 AutomationBench(24 个里第 14)。看起来它强在通用推理、编程智能体和知识考试,在法律、客服这类垂直领域的智能体评测上不占优。但这些榜单收录的模型和条件各不相同,有的只收录几个模型(如 SRE-Bench 只有 5 个),只能当提示。

成本、速度与 effort

价格方面,输入 $4、输出 $20,比 Opus 5($5、$25)低 20%。缓存读取 $0.20,比 Opus 5 的 $0.50 低 60%,官方特意指出缓存读取占智能体和编程工作成本的大头,所以这一项对实际账单影响最大。输出速度比 Opus 5 快 30% 以上。Fast mode 最高 2.5 倍速,价格为 $8 / $40,目前是研究预览,只在 Claude API 提供。

"比 Opus 5 低 40%" 是官方在默认设置、典型工作负载下的测试结果,来自单价下降加上每个任务用的 token 变少。这里有一个容易忽略的因素:Opus 5.5 的默认 effort 是 medium,Opus 5 是 high。我们推断,一部分节省来自默认档位降低。官方文档还提示,同一 effort 档位下 Opus 5.5 每轮想得更多,xhigh 和 max 最明显。所以从 Opus 5 迁移时,如果你原来固定了 effort,实际节省可能达不到 40%,需要重新对比。

客户反馈方向一致,但都是 Anthropic 挑选的案例。Factory 称 medium 档能达到 Opus 5 high 档的质量,输出 token 少 20% 到 25%。Optiver 称在其智能体编程任务上质量持平,轮数、耗时和输出 token 约为一半,成本降 40% 到 50%。Deloitte 称最低档就能在代码评审中发现 72% 的已知 bug,Opus 5 high 档是 56%。长任务方面,早期测试者用它在不到 3 小时内审计并修复了一个 20 万行的代码库,Opus 5 要 20 多个小时、token 是 2.5 倍。Anthropic 内部把 HAProxy 从 C 改写成 Rust,Opus 5.5 用了 9.5 小时,Fable 5.1 用了 12 小时,成本低 51%,两者都通过了几乎全部回归测试。

这些证据集中在长时间自主运行的任务上,比如整库迁移和审计、需要交叉核对的金融和法律研究,以及一个会话调度多个子会话的工作流。Stripe 的测试者就用一个会话带着十几个子会话,完成了 40 个 stacked pull request 的 rebase。官方还称它写作更清楚,会先给最重要的信息,也更能遵守用户给定的写作规则。

接入、迁移与安全限制

模型 ID 为 claude-opus-5-5,在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 和 Claude Platform on AWS 上可用,支持零数据留存。从 Opus 5 迁移,有这些变化:

  • 思考不能关闭。thinking: {"type": "disabled"} 或手动设置 budget_tokens 会返回 400,想省成本只能降低 effort。这一点与 Sonnet 5.5 不同,后者可以用 between_tools 关闭前置思考。
  • 默认 effort 从 high 变为 medium,同一档位下思考更多,max_tokens 要给思考留出空间。
  • tool_choice 设为 any 或指定工具会返回 400,只支持 auto 和 none。
  • 思考块绑定产生它的模型。Opus 5.5 能读 Opus 5 及更早的 Opus、Sonnet、Haiku 的思考块,读不了 Fable 和 Mythos 的;反过来,只有 Fable 5.1 和 Mythos 5.1 能读 Opus 5.5 的。2026-08-31 及之后创建的账号,改动前面的系统提示、工具或历史消息后再回传思考块会报 400,所以对话历史要保持只追加。
  • Claude API 和 Google Cloud 上的 computer use 要改用 computer_toolset_20260801,Amazon Bedrock 仍接受旧工具。

还有一处不会报错:工具调用之间的说明文字会放进 thinking 块,默认 display 下内容为空。如果应用把这段文字展示给用户,需要设置 thinking.display,否则界面会在工具调用期间没有输出。

安全方面,Anthropic 称 Opus 5.5 在自动化行为审计(近 2,000 个场景)中是测过的模型里表现最好的。在新的突破容器边界倾向测试中,它的尝试次数比 Opus 5 和 Mythos 5.1 少约 85%,且都是低严重度、由模型主动报告的。提示注入方面,在 Gray Swan 的测试中与 Fable 5.1 并列最低。Anthropic 同时承认,模型经常怀疑自己正在被评估,这会削弱评测结果对真实使用的代表性。

它是第一个带 Fable 5.1 级别防护的 Opus:多数网络安全任务会转给 Opus 4.8 处理,日常写代码、找并修复 bug 不受影响。生物领域防护与 Fable 5.1 相同,另有防蒸馏的 preserved thinking。网络安全从业者可以申请 Cyber Verification Program,生命科学机构可以申请 Life Sciences Verification Program。

官方来源


常见问题(替换现有 4 条)

Claude Opus 5.5 是什么时候发布的?和 Opus 5 相比有什么变化? Anthropic 于 2026 年 9 月 22 日发布,是 Claude 5.5 系列的第一个模型。相比 Opus 5,价格更低(输入 $4、输出 $20、缓存读取 $0.20),输出快 30% 以上,官方称默认设置下典型工作负载成本低 40%;Terminal-Bench 4.0 从 52.3% 提高到 66.4%。

上下文和最大输出是多少? 100 万 token 上下文、12.8 万 token 最大输出,支持文本和图像输入,输出为文本。

API 价格是多少? 标准价格为每百万 token 输入 $4、输出 $20;缓存读取 $0.20,5 分钟缓存写入 $5,1 小时缓存写入 $8。Batch API 五折($2 / $10)。Fast mode 为 $8 / $40,最高 2.5 倍速,仅 Claude API 提供,目前是研究预览。

可以关闭思考吗?默认 effort 是多少? 不可以。自适应思考始终开启,发送 thinking: {"type": "disabled"} 会返回 400,只能通过 effort 调节思考深度。默认 effort 是 medium(Opus 5 为 high)。需要关闭前置思考时,可以考虑支持 between_tools 的 Sonnet 5.5。

Opus 5.5 和 Sonnet 5.5 怎么选? 任务范围明确、对成本和速度敏感,选 Sonnet 5.5:单价只有一半,官方评测里差距多数在 1.7 到 3.2 个百分点,Terminal-Bench 4.0 上还更高。任务长时间自主运行、开放式、需要持续判断,选 Opus 5.5,Anthropic 称它在这类工作上仍明显更强。

Opus 5.5 会拒绝网络安全类请求吗? 日常写代码、找并修复 bug 不受影响。多数网络安全任务会转给 Opus 4.8 处理;安全从业者可以申请 Cyber Verification Program 获得更高权限。生物领域的防护与 Fable 5.1 相同,生命科学机构可以申请 Life Sciences Verification Program。

Claude Opus 5.5

常见问题

Claude Opus 5.5 发布了吗?

已发布。Anthropic 于 2026 年 9 月 22 日推出该模型,Claude API 标识为 claude-opus-5-5。

上下文和最大输出是多少?

官方规格为 100 万 token 上下文、12.8 万 token 最大输出。

API 价格是多少?

Claude API 标准价格为每百万 token 输入 $4、输出 $20;缓存读取 $0.20,Batch API 输入和输出享 5 折。

可以关闭自适应思考吗?

不可以。自适应思考始终开启,可通过 effort 参数调节思考强度,默认档位是 medium。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码