DataLearner 标志
CL

Claude Opus 4.8

承诺至少可用至 2027-05-28推理大模型编程大模型OpusClaude 4.8

Claude Opus 4.8

发布时间: 2026-05-28更新于: 2026-09-18知识截止: 2026-01承诺至少可用至: 2027-05-28浏览量: 2,710
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1M
多语言支持
支持
推理能力
5/5

Anthropic 于 2026 年 5 月 28 日发布的 Opus 系列更新,API 模型 ID claude-opus-4-8,定位面向复杂推理、长期运行的智能体编码任务和高自主性工作。相比 Opus 4.7 在编码、智能体任务、专业知识工作、长上下文执行和工具调用稳定性上均有更新。可验证规格:Claude API、Amazon Bedrock 与 Vertex AI 上默认 1M token 上下文,Microsoft Foundry 上为 200K;同步 Messages API 最大输出 128K tokens;可靠知识截止与训练数据截止均为 2026 年 1 月。支持 adaptive thinking,不支持手动设置固定 thinking 预算。Anthropic 未公开参数量、激活参数或架构细节,本站不做推测填写。库内实测中生产力知识工作是它最强的一项——GDPval-AA 1890 在 21 个模型中排第 1;LiveBench 78.79 排 115 个第 4,HLE 带工具 57.90 排 181 个第 8,SWE-Bench Pro(Public)69.20 排 57 个第 4。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Claude Opus 4.8

模型基本信息

推理过程
支持
思考模式
思考水平 · 高 (High) (默认)常规模式思考水平 · 低 (Low)思考水平 · 中 (Medium)思考水平 · 极高 (Extra-High)思考水平 · 最高 (Max)
上下文长度
1M tokens
最大输出长度
125K tokens
模型类型
推理大模型
输入/输出模态
文本、图像 → 文本
发布时间
2026-05-28
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
2026-01
Claude Opus 4.8

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
Claude Opus 4.8

官方介绍与博客

Claude Opus 4.8

API接口信息

接口速度
3/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$5.00/ 1M tokens$25.00/ 1M tokens
缓存定价Prompt缓存
类型有效期写入读取
文本5m$6.25/ 1M tokens$0.500/ 1M tokens
文本1h$10.00/ 1M tokens—

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Claude Opus 4.8

评测结果

Claude Opus 4.8 当前已收录的代表性评测结果包括 LiveBench(3 / 117,得分 78.93)、SAGE(2 / 64,得分 54.79)、AIME 2026(1 / 30,得分 100)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

抽象归纳与泛化

共 8 项评测
评测名称 / 模式
得分
排名/总数
ARC-AGI-1
低工具
88
76 / 193
ARC-AGI-1
中工具
91.50
62 / 193
ARC-AGI-1
高工具
92
57 / 193
ARC-AGI-1
最高工具
92.50
52 / 193
ARC-AGI-2
低工具
62.22
71 / 181
ARC-AGI-2
中工具
71.67
53 / 181
ARC-AGI-2
高工具
72.08
51 / 181
1.52
22 / 51

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
HLE
扩展
49.80
44 / 235
HLE
扩展工具
57.90
15 / 235

科学知识与推理

共 5 项评测
评测名称 / 模式
得分
排名/总数
GPQA Diamond
常规模式
85.35
85 / 253
88.38
56 / 253
93.60
13 / 253
91.04
31 / 253
CritPt
最高
20.90
35 / 204

仓库修复与多文件工程

共 7 项评测
评测名称 / 模式
得分
排名/总数
SWE-bench Verified
扩展工具
88.60
5 / 116
69.20
5 / 62
DeepSWE
低工具
40.80
78 / 92
DeepSWE
中工具
48.67
69 / 92
DeepSWE
高工具
51.77
65 / 92
DeepSWE
极高工具
54.36
56 / 92
DeepSWE
深度工具
58.97
51 / 92

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1839.80
18 / 110

常识推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
SimpleBench
常规模式
64.80
24 / 96

事实查找与深度检索

共 1 项评测
评测名称 / 模式
得分
排名/总数
BrowseComp
高工具联网
84.30
12 / 58

跨能力综合测试

共 4 项评测
评测名称 / 模式
得分
排名/总数
71.42
33 / 117
75.47
9 / 117
77.16
6 / 117
LiveBench
深度
78.93
3 / 117

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
78.88
31 / 57
58.30
10 / 244

多轮记忆与持续上下文

共 2 项评测
评测名称 / 模式
得分
排名/总数
90.04
15 / 126
EBR-bench
最高工具
28.57
10 / 23

数学

共 5 项评测
评测名称 / 模式
得分
排名/总数
AIME 2026
最高工具
100
1 / 30
HMMT Feb 2026
最高工具
95.45
5 / 10
MathArena Apex
最高工具
81.25
1 / 17
80
9 / 58
56.10
11 / 42

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
扩展工具
83.40
4 / 28

跨应用与工具编排

共 4 项评测
评测名称 / 模式
得分
排名/总数
90.54
2 / 45
MCP-Atlas
最高工具
82.20
10 / 44
MCP-Atlas
深度工具
82.20
10 / 44
MCPMark-Verified
最高工具
76.38
6 / 8

跨能力聚合指数

共 4 项评测
评测名称 / 模式
得分
排名/总数

科学计算与科研编程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SciCode
最高
54.40
44 / 134
10.50
11 / 18

客服与业务流程

共 3 项评测
评测名称 / 模式
得分
排名/总数
68.13
8 / 26
SAGE
最高工具
54.79
2 / 64
τ³-Banking
最高工具
39.69
34 / 167

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
最高工具
91.08
11 / 44
43.75
12 / 42
9.58
12 / 43

金融

共 2 项评测
评测名称 / 模式
得分
排名/总数
69.37
10 / 42
Finance Agent v2
最高工具
53.92
19 / 43

机器学习工程

共 3 项评测
评测名称 / 模式
得分
排名/总数
WeirdML v2
常规模式工具
70.45
18 / 52
WeirdML v2
中工具
76.04
15 / 52
WeirdML v2
极高工具
82.89
7 / 52

综合偏好评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
1545.05
9 / 35

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
最高
22.80
26 / 122

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
最高工具联网
45
9 / 29

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
最高工具
47.25
10 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
82.72
13 / 61

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
最高工具
85.75
17 / 66
MedCode
最高工具
53.22
8 / 64

和其他模型对比

Claude Opus 4.8

发布机构

Claude Opus 4.8

模型解读

Claude Opus 4.8 的定位

Claude Opus 4.8 是 Anthropic 于 2026 年 5 月 28 日发布的 Opus 系列模型更新,官方 API 模型 ID 为 claude-opus-4-8。Anthropic 将其定位为面向复杂推理、长期运行的智能体编码任务和高自主性工作的高能力模型。与 Claude Opus 4.7 相比,Opus 4.8 延续同一 Opus 产品线,但在编码、智能体任务、专业知识工作、长上下文任务执行以及工具调用稳定性方面进行了更新。官方发布页同时说明,该模型已在发布当日面向 Claude API、Claude Platform、Amazon Bedrock、Google Vertex AI 和 Microsoft Foundry 等渠道开放;面向普通用户和企业用户,可通过 Claude 的 Pro、Max、Team 和 Enterprise 计划使用。

上下文、输出长度与模型规格

Anthropic 未公开 Claude Opus 4.8 的参数量、激活参数量、训练语料规模或完整架构细节,因此参数量字段不应根据外部猜测填写。官方模型文档给出的可验证规格包括:在 Claude API、Amazon Bedrock 与 Vertex AI 上默认支持 1M token 上下文窗口,在 Microsoft Foundry 上为 200K token 上下文窗口;同步 Messages API 的最大输出长度为 128K tokens。官方文档还列出其可靠知识截止时间为 2026 年 1 月,训练数据截止时间为 2026 年 1 月。

模态能力与思考机制

Claude 当前模型文档说明,现行 Claude 模型支持文本与图像输入、文本输出、多语言能力和视觉能力。因此,Claude Opus 4.8 可用于文本理解、图像/PDF/图表等视觉输入理解,以及文本生成任务;公开资料未显示其支持原生音频、视频或 embedding 输出。Opus 4.8 支持 adaptive thinking,但不支持手动设置固定 thinking budget 的旧式 extended thinking。启用方式为在请求中设置 thinking: {type: 'adaptive'},并通过 effort 参数控制推理深度;如果不显式设置 thinking 字段,请求会以非思考方式运行。官方文档列出的 effort 层级包括 low、medium、high、xhigh 和 max,其中 high 是默认值,xhigh 与 max 用于需要更深推理的任务。

相比 Opus 4.7 的主要变化

Anthropic 的发布说明将 Opus 4.8 描述为在 Opus 4.7 基础上的增量更新。官方文档列出的变化包括:面向长期智能体编码任务的更好长上下文处理、更少 compaction 后偏离任务的情况、更稳定的 reasoning effort 校准,以及更少遗漏必要工具调用的情况。发布页还强调了 honesty 相关改进:在官方评估中,Opus 4.8 相比前代更不容易在其生成代码存在缺陷时不加说明地继续推进,约为前代的四分之一;同时更倾向于标注工作中的不确定性,减少缺乏依据的结论表达。

性能信息与适用场景

Anthropic 官方页面称,Opus 4.8 面向生产级代码、复杂 AI agents 和复杂文档创建等高要求场景。官方页面公开的案例评价还提到,Opus 4.8 在 Online-Mind2Web 浏览器/计算机使用测试中取得 84% 分数,并在法律、金融文档、企业知识工作、长流程代码库修改等工作流中被测试。由于部分完整基准表以图片或系统卡形式发布,若后台需要逐项基准分数,建议后续以 Anthropic 的 Claude Opus 4.8 System Card 为准单独补充。

访问方式、价格与开放性

开发者可通过 Claude API 使用 claude-opus-4-8,也可通过 Anthropic 在 AWS、Amazon Bedrock、Google Vertex AI 和 Microsoft Foundry 上的渠道访问。官方标准价格为输入 5 美元/百万 tokens、输出 25 美元/百万 tokens;Prompt caching 价格为 5 分钟 cache write 6.25 美元/百万 tokens、1 小时 cache write 10 美元/百万 tokens、cache hit 与 refresh 0.50 美元/百万 tokens。Fast mode 是 API 的 research preview,通过 speed: 'fast' 启用,官方说明其使用相同模型权重和行为,不是单独模型;其价格为输入 10 美元/百万 tokens、输出 50 美元/百万 tokens。Claude Opus 4.8 未开源代码或 checkpoints,公开访问主要通过 Anthropic 及其云平台合作渠道提供。

Claude Opus 4.8

常见问题

Claude Opus 4.8 是什么模型?

Claude Opus 4.8 是Anthropic于 2026-05-28 发布的推理大模型。支持文本、图像输入和文本输出,上下文窗口为 1M,主要能力包括推理大模型、多语言。页面已收录官方资料、API 定价、公开评测,便于核对规格和使用成本。

Claude Opus 4.8 支持哪些输入和输出模态?

当前官方资料记录其支持文本、图像输入,并生成文本输出。

Claude Opus 4.8 的上下文窗口和最大输出是多少?

上下文窗口为 1M,最大输出为 125K。未公开或无法确认的规格不做推测。

Claude Opus 4.8 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、多语言相关任务;实际效果应结合具体工作流验证。

Claude Opus 4.8 是否提供 API,价格如何查看?

页面已收录 Anthropic 的 6 条定价规则。价格可能随地域、上下文档位、缓存和时间变化,应以页面价格表及官方计费页为准。

Claude Opus 4.8 是否开源?

代码与模型权重按 不开源 记录;使用前仍应核对官方许可原文。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码