Claude Sonnet 5.5 发布了吗?
已发布。Anthropic 于 2026 年 9 月 28 日发布,Claude API ID 为 claude-sonnet-5-5。
Claude Sonnet 5.5
别名:Sonnet 5.5
Anthropic 于 2026 年 9 月 28 日发布 Claude Sonnet 5.5:100 万 token 上下文、12.8 万常规最大输出、文本与图像输入;Claude API 每百万 token 输入 $2、输出 $10。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $2.00/ 1M tokens | $10.00/ 1M tokens |
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $1.00/ 1M tokens | $5.00/ 1M tokens |
| 类型 | 有效期 | 写入 | 读取 |
|---|---|---|---|
| 文本 | 5m | $2.50/ 1M tokens | $0.200/ 1M tokens |
| 文本 | 1h | $4.00/ 1M tokens | — |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
Claude Sonnet 5.5 当前已收录的代表性评测结果包括 Terminal-Bench 4.0(1 / 98,得分 70.60)、HLE(4 / 235,得分 64.50)、Vals Index v2.1(2 / 36,得分 67.04)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
Claude Sonnet 5.5 是 Claude 5.5 系列的第二个模型,走"快、便宜、够用"的路线。它的价格是 Opus 5.5 的一半(输入 $2、输出 $10,Opus 5.5 为 $4、$20),而在 Anthropic 披露的评测里,它的最好成绩已经很接近 Opus 5.5:在 CursorBench 4.0、FrontierCode 1.1(Xhigh)、HLE(带工具)、OSWorld 2.1 和 Chartography 上差 1.7 到 3.2 个百分点,GDPval-AA 的 Elo 分差只有 2 分(1844 对 1846),Terminal-Bench 4.0 上还高出 4.2 个百分点。
这些都是厂商选定的评测和配置。Anthropic 同时承认,在需要持续判断的复杂开放式任务上,Opus 5.5 仍然明显更强,内部测试和外部测试者的体验一致。更稳妥的理解是:Sonnet 5.5 适合范围明确、可以拆开交付的工作,比如修 bug、按既定架构实现功能、按模板生成文档、幻灯片和表格;架构设计和长链条的开放式判断,还是留给 Opus 5.5 或更高档的模型。
Terminal-Bench 4.0 的 70.6% 是这次发布最醒目的数字,官方表格里 Opus 5.5 为 66.4%(取其最高的 Xhigh 档)。但同一张表里 Sonnet 5 只有 10.3%,一个小版本涨了 60 个百分点,官方没有解释原因,也没有标注 70.6% 对应哪一档 effort。Sonnet 5 在 Chartography 上也只有 15.6%,而 Sonnet 5.5 是 61.6%。这是我们的推断:Sonnet 5 在部分评测上的基线偏低,"比上一代提升多少"容易被放大,与 Opus 5.5 的差距是更有参考价值的对照。
FrontierCode 1.1 Main 要留意 effort 档位。Sonnet 5.5 在 Xhigh 档得 52.1%,在 Max 档只有 46.2%,反而更低。Anthropic 的解释是:这个评测看代码改动能否不经人工修改直接合并,超出任务范围的改动会被扣分;Max 档下模型更常调用 Claude Code 的代码审查技能,把审查分给很多子代理,在 Cognition 检查的两个案例里,这导致了超时或额外改动。也就是说,46.2% 不是能力上限,52.1% 才是它的最好成绩。Anthropic 表格中 Opus 5.5 为 54.4%,GPT-6 Sol 为 49.3%。
GDPval-AA 和 AA-Briefcase 由 Artificial Analysis 运行,用的是发布前的部署版本。Anthropic 称该版本有一个会影响结构化输出的 bug,已经修复,预计影响很小,即使有也是低估。表中 GPT-6 Sol 的 GDPval-AA、AA-Briefcase 和 Chartography 成绩,可能还没有更新到 OpenAI 修复图像理解 bug 之后的版本,所以与 GPT-6 Sol 的比较暂时只能作参考。
站内排名还取决于收录了哪些模型:Terminal-Bench 4.0 排第 1(共 97 个),CursorBench 4.0 排第 2(共 47 个),HLE 带工具排第 4(共 235 个);Chartography 只收录 10 个模型,Sonnet 5.5 排第 9,AutomationBench 排第 11(共 24 个)。从这些排名看,它在编程智能体评测中很靠前,在图表理解和办公自动化上则不占优,这是我们的判断。
Sonnet 5.5 的单价与 Sonnet 5 完全相同,官方称单任务成本最多低 30%、生成速度快 30% 以上。两代模型用的是同一个 tokenizer,同样的文本 token 数不变,所以省下来的是完成任务所需的 token 和步骤。官方图表显示,在若干评测上,Low 或 Medium 档就能超过 Sonnet 5 的最好成绩,单任务成本约为后者的十分之一(厂商测试结果)。
客户反馈的方向一致,但都是 Anthropic 挑选的案例。Balyasny 在自己的 2,441 道金融任务上,每个回答约用 121k token,Sonnet 5 是 497k。Box 报告速度快 2.4 倍、总 token 少 12%。Base44 的 118 次应用构建中,Sonnet 5.5 平均迭代 3.6 次,Opus 5 是 7.7 次。这些数字能说明趋势,不能直接换算成你自己业务的成本。
默认 effort 也影响实际花费。Claude 应用和 Claude Code 默认 Medium,Claude Platform API 默认 High,所以同一个模型在 API 上默认想得更久、花得更多。Anthropic 说各档位的思考量已经重新标定,从 Sonnet 5 迁移时应重新对比一遍 effort,不要沿用旧设置。
按这些数据,它最合适的位置是编程智能体、代码评审、客服和金融类高频工作流,以及按模板生成文档和演示文稿。Creator 的反馈是一个典型用法:由 Opus 5.5 定架构和框架,再交给 Sonnet 5.5 实现。它的上限同样清楚:HLE 不带工具为 56.9%,带工具为 64.5%,仍低于 Opus 5.5 带工具的 67.7%。
模型 ID 为 claude-sonnet-5-5,已在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 和 Claude Platform on AWS 上线,支持零数据留存。参数量和架构未公布。从 Sonnet 5 迁移时,有五处会直接报错:
thinking: {"type": "between_tools"},原来的 "disabled" 会返回 400。between_tools 只能用于 low、medium、high,xhigh 和 max 不支持。tool_choice 设为 any 或指定某个工具会返回 400,只支持 auto 和 none。需要保证工具入参合法时,改用 strict tool use 或结构化输出。computer_toolset_20260801,旧的 computer_20251124 会报错。Amazon Bedrock 仍接受旧工具。还有一处不会报错,但会静默出问题:工具调用之间较长的说明文字会放进 thinking 块。默认的 display 为 omitted 时,这些块的文字是空的,如果应用把这段文字流式展示给用户,界面在工具调用期间就没有输出。需要设置 display,或者改用 between_tools。
安全方面,它是第一个带网络安全防护的 Sonnet 模型。日常写代码、修 bug 不受影响,较高风险的网络安全任务会明显回退到 Sonnet 5 处理,安全从业者可以申请 Cyber Verification Program 获得更高权限。它也是第一个带推理内容提取防护的 Sonnet,其思考块只能在生成它的账号里使用。生物领域的防护与 Sonnet 5 相同。Anthropic 还表示,Claude Haiku 5.5 将在几周内加入这个系列。
已发布。Anthropic 于 2026 年 9 月 28 日发布,Claude API ID 为 claude-sonnet-5-5。
标准模型支持 100 万 token 上下文和 12.8 万 token 最大输出;Batch API 可在测试版标头下输出最多 30 万 token。
Claude API 标准价格为每百万 token 输入 $2、输出 $10;缓存读取 $0.20,5 分钟缓存写入 $2.50,1 小时缓存写入 $4。
可以在 low、medium、high effort 下用 between_tools 关闭前置思考;xhigh 与 max 不支持这一设置。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
