Claude Opus 5.5 发布了吗?
已发布。Anthropic 于 2026 年 9 月 22 日推出该模型,Claude API 标识为 claude-opus-5-5。
Claude Opus 5.5
别名:Opus 5.5
Anthropic 于 2026 年 9 月 22 日正式发布 Claude Opus 5.5。该模型支持 100 万 token 上下文、12.8 万 token 输出、文本和图像输入以及始终开启的自适应思考;Claude API 标准价格为每百万 token 输入 $4、输出 $20。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $4.00/ 1M tokens | $20.00/ 1M tokens |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $2.00/ 1M tokens | $10.00/ 1M tokens |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $8.00/ 1M tokens | $40.00/ 1M tokens |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | 5m | $5.00/ 1M tokens | $0.200/ 1M tokens |
| 文本 | 1h | $8.00/ 1M tokens | — |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
Claude Opus 5.5 当前已收录的代表性评测结果包括 HLE(1 / 235,得分 67.70)、ARC-AGI-1(1 / 193,得分 98.50)、SciCode(1 / 134,得分 66.90)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
Claude Opus 5.5 是 Claude 5.5 系列的第一个模型,2026 年 9 月 22 日发布。Anthropic 的说法是:它在多数工作上与更高一档的 Fable 5.1 相当,运行成本比 Opus 5 低 40%。官方表格的九项评测里,它都高于 Fable 5.1 和 Opus 5,例如 Terminal-Bench 4.0 为 66.4%(Fable 5.1 为 55.8%,Opus 5 为 52.3%),GDPval-AA 为 1846 Elo(1735 和 1708)。但在 OSWorld 2.1 和 Chartography 上,它只领先 Fable 5.1 1.1 和 0.6 个百分点,基本可以看作持平。
这些分数要打两个折扣来读。第一,Anthropic 自己说,到这个能力水平,评测分差已经不太能反映真实差距,它内部使用时,Opus 5.5 与 Fable 5.1 的差距比分数显示的小。第二,测试是在开启生产环境安全防护的条件下进行的:防护介入时,网络安全任务由 Opus 4.8 完成,生物和前沿大模型研发类任务由 Opus 5 完成,官方称这很可能拉低了 Opus 5.5 的成绩。
几天后发布的 Sonnet 5.5 单价只有它的一半,官方表格里与 Opus 5.5 的差距多数在 1.7 到 3.2 个百分点,Terminal-Bench 4.0 上 70.6% 还高于 Opus 5.5 的 66.4%。Anthropic 认为 Opus 5.5 的价值在需要持续判断的复杂开放式任务上。这类差异目前的评测覆盖得不多,这是我们的推断。任务范围明确、对成本敏感时,按官方评测看,Sonnet 5.5 通常已经够用。
先看 effort 档位。除特别注明外,Opus 5.5 的成绩是自适应思考 max effort;Terminal-Bench 4.0 用的是 xhigh,因为那是它的最高分,站内 max 档只有 59.6%,xhigh 为 66.4%。调到 max 并不保证更高:FrontierCode 上 medium 为 54.6%,max 为 54.4%;ARC-AGI-1 和 ARC-AGI-2 的最好成绩都出现在 high(98.5% 和 93.33%),而不是 max。不过 CursorBench 4.0 从 medium 的 52.5% 到 max 的 57.8%,还能多 5.3 个百分点。哪一档划算,要按自己的任务测。
再看误差和运行条件。Terminal-Bench 4.0 的标准误是 ±2.6 个百分点,Opus 5.5 与 GPT-6 Astra(57.9%,OpenAI 自报)的差距超出了误差。Terminal-Bench-Science 0.1 的标准误是 ±3.5 到 5 个百分点,Astra 的 64.6% 高于 Opus 5.5 的 58.7%,差距在误差范围附近,不宜下结论。AutomationBench 由 Zapier 运行,没有配置回退模型,安全防护一介入就按失败计,所以 40.0% 会低于实际使用中的水平,同一评测里 GPT-6 Astra 为 41.4%。站内 Sonnet 5.5 在这项评测上是 44.7%,高于 Opus 5.5,两次运行的条件是否一致,我们没有核实。
还要看是否带工具。Opus 5.5 在 Chartography 上带工具为 89.0%,Sonnet 5.5 发布页给出的不带工具成绩是 64.4%,相差 24.6 个百分点。这项评测的成绩主要取决于模式,比较时要核对。
站内排名方面,Opus 5.5 排第一的有 HLE(带工具 67.7%,共 235 个模型)、ARC-AGI-1(98.5%,共 176 个)、SciCode(66.9%,共 134 个)、SimpleBench(88.4%,共 96 个)和 CursorBench 4.0(57.8%,共 47 个)。排名靠后的有 Harvey's Legal Agent Benchmark(43 个里第 25)、SAGE(64 个里第 29)和 AutomationBench(24 个里第 14)。看起来它强在通用推理、编程智能体和知识考试,在法律、客服这类垂直领域的智能体评测上不占优。但这些榜单收录的模型和条件各不相同,有的只收录几个模型(如 SRE-Bench 只有 5 个),只能当提示。
价格方面,输入 $4、输出 $20,比 Opus 5($5、$25)低 20%。缓存读取 $0.20,比 Opus 5 的 $0.50 低 60%,官方特意指出缓存读取占智能体和编程工作成本的大头,所以这一项对实际账单影响最大。输出速度比 Opus 5 快 30% 以上。Fast mode 最高 2.5 倍速,价格为 $8 / $40,目前是研究预览,只在 Claude API 提供。
"比 Opus 5 低 40%" 是官方在默认设置、典型工作负载下的测试结果,来自单价下降加上每个任务用的 token 变少。这里有一个容易忽略的因素:Opus 5.5 的默认 effort 是 medium,Opus 5 是 high。我们推断,一部分节省来自默认档位降低。官方文档还提示,同一 effort 档位下 Opus 5.5 每轮想得更多,xhigh 和 max 最明显。所以从 Opus 5 迁移时,如果你原来固定了 effort,实际节省可能达不到 40%,需要重新对比。
客户反馈方向一致,但都是 Anthropic 挑选的案例。Factory 称 medium 档能达到 Opus 5 high 档的质量,输出 token 少 20% 到 25%。Optiver 称在其智能体编程任务上质量持平,轮数、耗时和输出 token 约为一半,成本降 40% 到 50%。Deloitte 称最低档就能在代码评审中发现 72% 的已知 bug,Opus 5 high 档是 56%。长任务方面,早期测试者用它在不到 3 小时内审计并修复了一个 20 万行的代码库,Opus 5 要 20 多个小时、token 是 2.5 倍。Anthropic 内部把 HAProxy 从 C 改写成 Rust,Opus 5.5 用了 9.5 小时,Fable 5.1 用了 12 小时,成本低 51%,两者都通过了几乎全部回归测试。
这些证据集中在长时间自主运行的任务上,比如整库迁移和审计、需要交叉核对的金融和法律研究,以及一个会话调度多个子会话的工作流。Stripe 的测试者就用一个会话带着十几个子会话,完成了 40 个 stacked pull request 的 rebase。官方还称它写作更清楚,会先给最重要的信息,也更能遵守用户给定的写作规则。
模型 ID 为 claude-opus-5-5,在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 和 Claude Platform on AWS 上可用,支持零数据留存。从 Opus 5 迁移,有这些变化:
thinking: {"type": "disabled"} 或手动设置 budget_tokens 会返回 400,想省成本只能降低 effort。这一点与 Sonnet 5.5 不同,后者可以用 between_tools 关闭前置思考。max_tokens 要给思考留出空间。tool_choice 设为 any 或指定工具会返回 400,只支持 auto 和 none。computer_toolset_20260801,Amazon Bedrock 仍接受旧工具。还有一处不会报错:工具调用之间的说明文字会放进 thinking 块,默认 display 下内容为空。如果应用把这段文字展示给用户,需要设置 thinking.display,否则界面会在工具调用期间没有输出。
安全方面,Anthropic 称 Opus 5.5 在自动化行为审计(近 2,000 个场景)中是测过的模型里表现最好的。在新的突破容器边界倾向测试中,它的尝试次数比 Opus 5 和 Mythos 5.1 少约 85%,且都是低严重度、由模型主动报告的。提示注入方面,在 Gray Swan 的测试中与 Fable 5.1 并列最低。Anthropic 同时承认,模型经常怀疑自己正在被评估,这会削弱评测结果对真实使用的代表性。
它是第一个带 Fable 5.1 级别防护的 Opus:多数网络安全任务会转给 Opus 4.8 处理,日常写代码、找并修复 bug 不受影响。生物领域防护与 Fable 5.1 相同,另有防蒸馏的 preserved thinking。网络安全从业者可以申请 Cyber Verification Program,生命科学机构可以申请 Life Sciences Verification Program。
Claude Opus 5.5 是什么时候发布的?和 Opus 5 相比有什么变化? Anthropic 于 2026 年 9 月 22 日发布,是 Claude 5.5 系列的第一个模型。相比 Opus 5,价格更低(输入 $4、输出 $20、缓存读取 $0.20),输出快 30% 以上,官方称默认设置下典型工作负载成本低 40%;Terminal-Bench 4.0 从 52.3% 提高到 66.4%。
上下文和最大输出是多少? 100 万 token 上下文、12.8 万 token 最大输出,支持文本和图像输入,输出为文本。
API 价格是多少? 标准价格为每百万 token 输入 $4、输出 $20;缓存读取 $0.20,5 分钟缓存写入 $5,1 小时缓存写入 $8。Batch API 五折($2 / $10)。Fast mode 为 $8 / $40,最高 2.5 倍速,仅 Claude API 提供,目前是研究预览。
可以关闭思考吗?默认 effort 是多少?
不可以。自适应思考始终开启,发送 thinking: {"type": "disabled"} 会返回 400,只能通过 effort 调节思考深度。默认 effort 是 medium(Opus 5 为 high)。需要关闭前置思考时,可以考虑支持 between_tools 的 Sonnet 5.5。
Opus 5.5 和 Sonnet 5.5 怎么选? 任务范围明确、对成本和速度敏感,选 Sonnet 5.5:单价只有一半,官方评测里差距多数在 1.7 到 3.2 个百分点,Terminal-Bench 4.0 上还更高。任务长时间自主运行、开放式、需要持续判断,选 Opus 5.5,Anthropic 称它在这类工作上仍明显更强。
Opus 5.5 会拒绝网络安全类请求吗? 日常写代码、找并修复 bug 不受影响。多数网络安全任务会转给 Opus 4.8 处理;安全从业者可以申请 Cyber Verification Program 获得更高权限。生物领域的防护与 Fable 5.1 相同,生命科学机构可以申请 Life Sciences Verification Program。
已发布。Anthropic 于 2026 年 9 月 22 日推出该模型,Claude API 标识为 claude-opus-5-5。
官方规格为 100 万 token 上下文、12.8 万 token 最大输出。
Claude API 标准价格为每百万 token 输入 $4、输出 $20;缓存读取 $0.20,Batch API 输入和输出享 5 折。
不可以。自适应思考始终开启,可通过 effort 参数调节思考强度,默认档位是 medium。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
