DataLearner 标志
CL

Claude Sonnet 4.6

承诺至少可用至 2027-02-17聊天大模型SonnetClaude 4.6

Claude Sonnet 4.6

发布时间: 2026-02-17更新于: 2026-09-18知识截止: 2026-01承诺至少可用至: 2027-02-17浏览量: 2,194
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1M
多语言支持
支持
推理能力
5/5

Claude Sonnet 4.6 是Anthropic于 2026-02-17 发布的聊天大模型。支持文本、图像输入和文本输出,上下文窗口为 1M,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Claude Sonnet 4.6

模型基本信息

推理过程
支持
思考模式
常规模式思考水平 · 深度 (Deep)思考模式
上下文长度
1M tokens
最大输出长度
8K tokens
模型类型
聊天大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-02-17
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2026-01
Claude Sonnet 4.6

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
Claude Sonnet 4.6

官方介绍与博客

DataLearnerAI博客
暂无
Claude Sonnet 4.6

API接口信息

接口速度
暂无数据
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$3.00/ 1M tokens$15.00/ 1M tokens
批量模式
类型适用条件输入输出
文本-$1.50/ 1M tokens$7.50/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本5m$3.75/ 1M tokens$0.300/ 1M tokens
文本1h$6.00/ 1M tokens—

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Claude Sonnet 4.6

评测结果

Claude Sonnet 4.6 当前已收录的代表性评测结果包括 Terminal Bench Hard(17 / 244,得分 53)、LiveBench(11 / 117,得分 75.32)、SWE-bench Verified(18 / 116,得分 79.60)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

抽象归纳与泛化

共 5 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
高工具
86.50
87 / 193
ARC-AGI-1
最高工具
86
90 / 193
ARC-AGI-2
思考模式
58.33
80 / 181
ARC-AGI-2
高工具
60.42
74 / 181
ARC-AGI-2
最高
58.33
80 / 181

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
HLE
思考模式
33.20
109 / 235
HLE
思考模式工具
49
46 / 235

科学知识与推理

共 6 项评测
评测名称 / 模式
得分
排名/总数
83.33
102 / 253
GPQA Diamond
思考模式
89.90
43 / 253
83.33
102 / 253
78.79
139 / 253
CritPt
常规模式
0.90
162 / 204
CritPt
最高
3.10
114 / 204

仓库修复与多文件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
思考模式
79.60
18 / 116
DeepSWE
高工具
29.93
86 / 92

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1810.40
21 / 110

数学

共 1 项评测
评测名称 / 模式
得分
排名/总数
8.30
34 / 80

客服与业务流程

共 4 项评测
评测名称 / 模式
得分
排名/总数
τ²-Bench - Telecom
思考模式工具
97.90
6 / 30
62.45
15 / 26
SAGE
最高工具
46.58
27 / 64
τ³-Banking
最高工具
34.40
50 / 167

事实查找与深度检索

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
思考模式工具
74.70
30 / 58

跨能力综合测试

共 3 项评测
评测名称 / 模式
得分
排名/总数
70.44
36 / 117
72.99
23 / 117
75.32
11 / 117

自主开发与终端任务

共 4 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench 2.0
思考模式工具
59.10
22 / 48
Terminal Bench Hard
常规模式工具
46.20
29 / 244
53
17 / 244
Terminal-Bench 4.0
最高工具
3
72 / 98

多轮记忆与持续上下文

共 4 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
55.18
80 / 126
82.80
30 / 126
82.56
31 / 126
82.82
29 / 126

跨行业工作评估

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDPval-AA
思考模式
57
5 / 15

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
思考模式工具
72.50
19 / 28

跨应用与工具编排

共 3 项评测
评测名称 / 模式
得分
排名/总数
Pinch Bench
思考模式工具
88
6 / 38
MCP-Atlas
常规模式工具
69.50
32 / 44
62.68
31 / 45

跨能力聚合指数

共 2 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
152.25
37 / 167
Vals Index
最高工具
50.59
31 / 42

图像感知与视觉推理

共 4 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
常规模式
70.60
125 / 229
MMMU-Pro
思考模式工具
75.60
82 / 229
MMMU-Pro
unknown
74.50
95 / 229
MMMU-Pro
最高
73.30
110 / 229

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
最高
50.10
72 / 134

法律

共 4 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
常规模式工具
84.44
23 / 44
Harvey Lab-AA
最高工具
85.97
19 / 44
38.46
22 / 42
5
23 / 43

金融

共 2 项评测
评测名称 / 模式
得分
排名/总数
60.15
25 / 42
Finance Agent v2
最高工具
51.03
28 / 43

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
最高
15.80
57 / 122

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
最高工具联网
20
18 / 29

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
最高工具
39.89
21 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
51.48
36 / 61

和其他模型对比

Claude Sonnet 4.6

发布机构

Claude Sonnet 4.6

模型解读

Anthropic 于 2026 年 2 月 17 日发布了 Claude Sonnet 4.6,这是其 Sonnet 系列的最新版本。该模型被定位为 Sonnet 家族中能力最强的成员,在编码、计算机使用、长上下文推理、代理规划、知识工作和设计领域进行了全面升级。1M token 上下文窗口以 beta 形式提供(API 优先)。Anthropic 表示,该模型现已成为免费和 Pro 计划在 claude.ai 及 Claude Cowork 中的默认模型,免费层同时新增文件创建、连接器、技能和上下文压缩功能。

能力升级与具体改进

Sonnet 4.6 在多个领域较 Sonnet 4.5 实现显著提升,同时在部分任务中接近或匹配 2026 年 2 月 5 日发布的 Opus 4.6(Anthropic 的前沿模型)。

  • 编码:SWE-bench Verified 分数达 79.6%(Sonnet 4.5 为 77.2%,Opus 4.6 为 80.8%);Terminal-Bench 2.0 为 59.1%(Sonnet 4.5 为 51.0%)。在 Claude Code 中,早期开发者偏好率较 4.5 高约 70%,较 Opus 4.5 高 59%。模型在大型代码库导航、复杂 bug 修复、一致性及指令遵循方面改善明显,减少过度工程化和虚假成功声明。
  • 计算机使用:OSWorld-Verified 达 72.5%(Sonnet 4.5 为 61.4%,Opus 4.6 为 72.7%);保险基准准确率 94%。支持浏览器自动化、多步表单填写、复杂电子表格导航等零 API 操作任务,接近人类水平。
  • 知识工作与文档处理:OfficeQA 表现与 Opus 4.6 相当;Box 重推理 Q&A 较 4.5 提升 15 个百分点;金融服务基准答案匹配率显著提高。适用于企业文档(PDF、图表、表格)分析、金融建模和合规审查。
  • 代理规划与长上下文:支持长时序任务规划(如 Vending-Bench Arena 中早期资源投入与后期盈利调整)。1M token 上下文允许处理完整代码库、多份研究论文或长合同。
  • 设计:生成布局、动画和视觉输出的迭代次数减少,产出更符合生产标准。
  • 其他基准(选摘,来自系统卡):GPQA Diamond 89.9%(Sonnet 4.5 为 83.4%);MMMU-Pro(无工具)74.5%;Humanity’s Last Exam(无工具)33.2%;Finance Agent(最大思考)63.3%;WebArena-Verified 在单代理设置中领先;长上下文测试(OpenAI MRCR v2 1M)65.1%。

模型支持扩展思考模式(更多推理时间)和自适应思考模式(根据难度动态分配计算)。从 Sonnet 4.5 迁移通常只需少量提示调整。训练数据截止至 2025 年 5 月(部分文档提及可靠知识截止 2025 年 8 月,训练截止 2026 年 1 月)。

定价与可用性

定价与 Sonnet 4.5 保持一致:输入 $3 / 百万 token,输出 $15 / 百万 token。API ID 为 claude-sonnet-4-6,上下文窗口 200K(1M beta),最大输出 64K token。

可用平台包括:

  • claude.ai(免费/Pro 默认)、Claude Cowork、Claude Code。
  • 开发者平台(支持自适应思考、上下文压缩 beta)。
  • 主要云服务:Amazon Bedrock(anthropic.claude-sonnet-4-6)、Google Vertex AI、Microsoft Foundry。
  • GitHub Copilot(已逐步开放给 Pro+、Business 和 Enterprise 用户)。
  • Claude in Excel 插件(支持外部数据连接器,如 S&P Global、FactSet 等)。

官方强调模型性格呈现温暖、诚实、亲社会特征,具备幽默感。第三方评估(Vals AI、Andon Labs、ARC Prize 等)确认其在金融代理、cyber 和行为审计中的表现。Anthropic 继续实施 ASL-3 权重安全措施和持续监控。

总结定位

Sonnet 4.6 将此前主要依赖 Opus 级别的部分办公、编码和代理任务下放至更具性价比的 Sonnet 层级,同时保持中等延迟和规模适用性。Opus 4.6 仍适用于最复杂的前沿任务。模型现已开放,开发者可通过 claude.ai 或 API 直接测试,具体技术细节见 Anthropic 官方公告及系统卡。

该发布延续 Anthropic 约四个月一次的 Sonnet 更新节奏,反映其在平衡性能、成本与安全方面的持续迭代。更多基准细节和使用示例可参考 Anthropic 官网。

Claude Sonnet 4.6

常见问题

Claude Sonnet 4.6 是什么模型?

Claude Sonnet 4.6 是Anthropic于 2026-02-17 发布的聊天大模型。支持文本、图像输入和文本输出,上下文窗口为 1M,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

Claude Sonnet 4.6 支持哪些输入和输出模态?

当前官方资料记录其支持文本、图像输入,并生成文本输出。

Claude Sonnet 4.6 的上下文窗口和最大输出是多少?

上下文窗口为 1M,最大输出为 8K。未公开或无法确认的规格不做推测。

Claude Sonnet 4.6 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、多语言相关任务;实际效果应结合具体工作流验证。

Claude Sonnet 4.6 是否提供 API,价格如何查看?

页面已收录 Anthropic 的 8 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。

Claude Sonnet 4.6 是否开源?

代码与模型权重按 不开源 记录;使用前仍应核对官方许可原文。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码