DataLearner 标志
CL

Claude Sonnet 5.5

承诺至少可用至 2027-09-28推理大模型编程大模型SonnetClaude 5.5

Claude Sonnet 5.5

别名:Sonnet 5.5

发布时间: 2026-09-28更新于: 2026-09-29知识截止: 2026-06承诺至少可用至: 2027-09-28浏览量: 172
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1M
多语言支持
支持
推理能力
暂无数据

Anthropic 于 2026 年 9 月 28 日发布 Claude Sonnet 5.5:100 万 token 上下文、12.8 万常规最大输出、文本与图像输入;Claude API 每百万 token 输入 $2、输出 $10。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Claude Sonnet 5.5

模型基本信息

推理过程
支持
思考模式
思考水平 · 自适应思考 (Adaptive Thinking) (默认)
上下文长度
1M tokens
最大输出长度
128K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
支持语种
中文 (中国)、英语 (美国)、日语 (日本)、韩语 (韩国)、德语 (德国)
发布时间
2026-09-28
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2026-06
Claude Sonnet 5.5

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
Claude Sonnet 5.5

官方介绍与博客

DataLearnerAI博客
暂无
Claude Sonnet 5.5

API接口信息

接口速度
暂无数据
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$2.00/ 1M tokens$10.00/ 1M tokens
批量模式
类型适用条件输入输出
文本-$1.00/ 1M tokens$5.00/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本5m$2.50/ 1M tokens$0.200/ 1M tokens
文本1h$4.00/ 1M tokens—

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Claude Sonnet 5.5

评测结果

Claude Sonnet 5.5 当前已收录的代表性评测结果包括 Terminal-Bench 4.0(1 / 98,得分 70.60)、HLE(4 / 235,得分 64.50)、Vals Index v2.1(2 / 36,得分 67.04)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
HLE
最高
56.90
19 / 235
HLE
最高工具
64.50
4 / 235

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AutomationBench
最高工具
44.70
12 / 25

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
61.60
10 / 11

自主开发与终端任务

共 2 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 4.0
最高工具
70.60
1 / 98
CursorBench 4.0
最高工具
55.50
2 / 4

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
59.90
3 / 18

程序生成与编辑

共 2 项评测
评测名称 / 模式
得分
排名/总数
46.20
10 / 11
52.10
5 / 11

跨能力聚合指数

共 1 项评测
评测名称 / 模式
得分
排名/总数

和其他模型对比

Claude Sonnet 5.5

发布机构

Claude Sonnet 5.5

模型解读

Claude Sonnet 5.5 是 Claude 5.5 系列的第二个模型,走"快、便宜、够用"的路线。它的价格是 Opus 5.5 的一半(输入 $2、输出 $10,Opus 5.5 为 $4、$20),而在 Anthropic 披露的评测里,它的最好成绩已经很接近 Opus 5.5:在 CursorBench 4.0、FrontierCode 1.1(Xhigh)、HLE(带工具)、OSWorld 2.1 和 Chartography 上差 1.7 到 3.2 个百分点,GDPval-AA 的 Elo 分差只有 2 分(1844 对 1846),Terminal-Bench 4.0 上还高出 4.2 个百分点。

这些都是厂商选定的评测和配置。Anthropic 同时承认,在需要持续判断的复杂开放式任务上,Opus 5.5 仍然明显更强,内部测试和外部测试者的体验一致。更稳妥的理解是:Sonnet 5.5 适合范围明确、可以拆开交付的工作,比如修 bug、按既定架构实现功能、按模板生成文档、幻灯片和表格;架构设计和长链条的开放式判断,还是留给 Opus 5.5 或更高档的模型。

Claude Sonnet 5.5 评测很好,TB 4超越Opus 5.5,全球第一

Terminal-Bench 4.0 的 70.6% 是这次发布最醒目的数字,官方表格里 Opus 5.5 为 66.4%(取其最高的 Xhigh 档)。但同一张表里 Sonnet 5 只有 10.3%,一个小版本涨了 60 个百分点,官方没有解释原因,也没有标注 70.6% 对应哪一档 effort。Sonnet 5 在 Chartography 上也只有 15.6%,而 Sonnet 5.5 是 61.6%。这是我们的推断:Sonnet 5 在部分评测上的基线偏低,"比上一代提升多少"容易被放大,与 Opus 5.5 的差距是更有参考价值的对照。

FrontierCode 1.1 Main 要留意 effort 档位。Sonnet 5.5 在 Xhigh 档得 52.1%,在 Max 档只有 46.2%,反而更低。Anthropic 的解释是:这个评测看代码改动能否不经人工修改直接合并,超出任务范围的改动会被扣分;Max 档下模型更常调用 Claude Code 的代码审查技能,把审查分给很多子代理,在 Cognition 检查的两个案例里,这导致了超时或额外改动。也就是说,46.2% 不是能力上限,52.1% 才是它的最好成绩。Anthropic 表格中 Opus 5.5 为 54.4%,GPT-6 Sol 为 49.3%。

GDPval-AA 和 AA-Briefcase 由 Artificial Analysis 运行,用的是发布前的部署版本。Anthropic 称该版本有一个会影响结构化输出的 bug,已经修复,预计影响很小,即使有也是低估。表中 GPT-6 Sol 的 GDPval-AA、AA-Briefcase 和 Chartography 成绩,可能还没有更新到 OpenAI 修复图像理解 bug 之后的版本,所以与 GPT-6 Sol 的比较暂时只能作参考。

站内排名还取决于收录了哪些模型:Terminal-Bench 4.0 排第 1(共 97 个),CursorBench 4.0 排第 2(共 47 个),HLE 带工具排第 4(共 235 个);Chartography 只收录 10 个模型,Sonnet 5.5 排第 9,AutomationBench 排第 11(共 24 个)。从这些排名看,它在编程智能体评测中很靠前,在图表理解和办公自动化上则不占优,这是我们的判断。

Claude Sonnet 5.5 成本、速度与适用场景

Sonnet 5.5 的单价与 Sonnet 5 完全相同,官方称单任务成本最多低 30%、生成速度快 30% 以上。两代模型用的是同一个 tokenizer,同样的文本 token 数不变,所以省下来的是完成任务所需的 token 和步骤。官方图表显示,在若干评测上,Low 或 Medium 档就能超过 Sonnet 5 的最好成绩,单任务成本约为后者的十分之一(厂商测试结果)。

客户反馈的方向一致,但都是 Anthropic 挑选的案例。Balyasny 在自己的 2,441 道金融任务上,每个回答约用 121k token,Sonnet 5 是 497k。Box 报告速度快 2.4 倍、总 token 少 12%。Base44 的 118 次应用构建中,Sonnet 5.5 平均迭代 3.6 次,Opus 5 是 7.7 次。这些数字能说明趋势,不能直接换算成你自己业务的成本。

默认 effort 也影响实际花费。Claude 应用和 Claude Code 默认 Medium,Claude Platform API 默认 High,所以同一个模型在 API 上默认想得更久、花得更多。Anthropic 说各档位的思考量已经重新标定,从 Sonnet 5 迁移时应重新对比一遍 effort,不要沿用旧设置。

按这些数据,它最合适的位置是编程智能体、代码评审、客服和金融类高频工作流,以及按模板生成文档和演示文稿。Creator 的反馈是一个典型用法:由 Opus 5.5 定架构和框架,再交给 Sonnet 5.5 实现。它的上限同样清楚:HLE 不带工具为 56.9%,带工具为 64.5%,仍低于 Opus 5.5 带工具的 67.7%。

接入、迁移与安全限制

模型 ID 为 claude-sonnet-5-5,已在 Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry 和 Claude Platform on AWS 上线,支持零数据留存。参数量和架构未公布。从 Sonnet 5 迁移时,有五处会直接报错:

  • 关闭前置思考要发 thinking: {"type": "between_tools"},原来的 "disabled" 会返回 400。between_tools 只能用于 low、medium、high,xhigh 和 max 不支持。
  • tool_choice 设为 any 或指定某个工具会返回 400,只支持 auto 和 none。需要保证工具入参合法时,改用 strict tool use 或结构化输出。
  • 思考块会记录产生它的模型。Sonnet 5.5 读不了 Opus 5、Opus 5.5 以及 Fable、Mythos 系列的思考块。如果思考块生成之后,前面的系统提示、工具或历史消息被改过,再回传这个块,2026-08-31 及之后创建的账号默认会返回 400。对话历史要保持只追加。
  • 在 Claude API 和 Google Cloud 上,computer use 必须使用 computer_toolset_20260801,旧的 computer_20251124 会报错。Amazon Bedrock 仍接受旧工具。
  • advisor 工具不再接受 Sonnet 5、Opus 4.8、Opus 4.7 作为顾问模型。

还有一处不会报错,但会静默出问题:工具调用之间较长的说明文字会放进 thinking 块。默认的 display 为 omitted 时,这些块的文字是空的,如果应用把这段文字流式展示给用户,界面在工具调用期间就没有输出。需要设置 display,或者改用 between_tools。

安全方面,它是第一个带网络安全防护的 Sonnet 模型。日常写代码、修 bug 不受影响,较高风险的网络安全任务会明显回退到 Sonnet 5 处理,安全从业者可以申请 Cyber Verification Program 获得更高权限。它也是第一个带推理内容提取防护的 Sonnet,其思考块只能在生成它的账号里使用。生物领域的防护与 Sonnet 5 相同。Anthropic 还表示,Claude Haiku 5.5 将在几周内加入这个系列。

官方来源

Claude Sonnet 5.5

常见问题

Claude Sonnet 5.5 发布了吗?

已发布。Anthropic 于 2026 年 9 月 28 日发布,Claude API ID 为 claude-sonnet-5-5。

上下文与最大输出是多少?

标准模型支持 100 万 token 上下文和 12.8 万 token 最大输出;Batch API 可在测试版标头下输出最多 30 万 token。

API 价格是多少?

Claude API 标准价格为每百万 token 输入 $2、输出 $10;缓存读取 $0.20,5 分钟缓存写入 $2.50,1 小时缓存写入 $4。

可以关闭思考吗?

可以在 low、medium、high effort 下用 between_tools 关闭前置思考;xhigh 与 max 不支持这一设置。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码