DataLearner 标志
MU

Muse Spark 1.1

推理大模型编程大模型Muse SparkMuse Spark 1.1

Muse Spark 1.1 by Meta Superintelligence Labs

发布时间: 2026-07-09更新于: 2026-08-22浏览量: 1,932
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1M
多语言支持
暂无数据
推理能力
4/5

Muse Spark 1.1 是 Meta Superintelligence Labs 于 2026 年 7 月 9 日发布的升级版本,定位为面向智能体任务的多模态推理模型,重点提升工具使用、电脑操作、编码与多模态理解。背景是 Meta 在 2026 年 4 月推出 Muse Spark 时停掉了 Llama 系列并转向闭源托管,1.1 是新路线上的第一次迭代。它在多智能体工作流中既可作主 agent 规划并并行委派子 agent,也可作子 agent 执行限定任务;上下文窗口 100 万 tokens,官方称模型能主动检索早期信息并在长任务中压缩上下文,多模态输入覆盖视觉、音频、视频和 PDF。官方成绩为 MCP-Atlas 88.1、OSWorld-Verified 80.8、HLE(带工具)62.1、Terminal-Bench 2.1 80.0、SWE-Bench Pro 61.5。Meta 未公布 API 价格、参数规模与知识截止时间。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Muse Spark 1.1

模型基本信息

推理过程
支持
思考模式
思考模式 (默认)常规模式
上下文长度
1M tokens
最大输出长度
暂无数据
模型类型
推理大模型
输入/输出模态
文本、图像、音频、视频 → 文本
发布时间
2026-07-09
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
Muse Spark 1.1

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
Muse Spark 1.1

官方介绍与博客

DataLearnerAI博客
暂无
Muse Spark 1.1

API接口信息

接口速度
4/5
暂无公开的 API 定价信息。
Muse Spark 1.1

评测结果

Muse Spark 1.1 当前已收录的代表性评测结果包括 HLE(8 / 235,得分 62.10)、MCP-Atlas(2 / 44,得分 88.10)、SciCode(11 / 134,得分 58.80)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用

综合知识考试

共 1 项评测
评测名称 / 模式
得分
排名/总数
HLE
思考模式工具
62.10
8 / 235

写作与创意表达

共 1 项评测
评测名称 / 模式
得分
排名/总数
Creative Writing
常规模式
1927.10
11 / 110

仓库修复与多文件工程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SWE-Bench Pro - Public
思考模式工具
61.50
14 / 62
DeepSWE
思考模式工具
53.32
63 / 92

跨应用与工具编排

共 2 项评测
评测名称 / 模式
得分
排名/总数
MCP-Atlas
思考模式工具
88.10
2 / 44
Tool Decathlon
思考模式工具
75.60
1 / 10

多轮记忆与持续上下文

共 4 项评测
评测名称 / 模式
得分
排名/总数
70.32
63 / 126
74.38
51 / 126
69.86
65 / 126
70.01
64 / 126

桌面工作流

共 1 项评测
评测名称 / 模式
得分
排名/总数
OSWorld-Verified
思考模式工具
80.80
8 / 28

自主开发与终端任务

共 3 项评测
评测名称 / 模式
得分
排名/总数
Terminal-Bench 2.1
思考模式工具
80
29 / 57
Terminal-Bench 2.1
极高工具
76.20
34 / 57
Terminal-Bench 4.0
极高工具
6.10
65 / 98

跨能力聚合指数

共 3 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
154.32
32 / 167
Vals Index
极高工具
54.75
26 / 42

科学知识与推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
CritPt
极高
15.10
58 / 204

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
极高
58.80
11 / 134

客服与业务流程

共 3 项评测
评测名称 / 模式
得分
排名/总数
61.30
17 / 26
SAGE
极高工具
45.58
30 / 64
τ³-Banking
极高工具
40.46
30 / 167

金融

共 2 项评测
评测名称 / 模式
得分
排名/总数
Finance Agent v2
极高工具
57.21
12 / 43
56.36
29 / 42

法律

共 2 项评测
评测名称 / 模式
得分
排名/总数
37.98
24 / 42
20
4 / 43

综合偏好评测

共 1 项评测
评测名称 / 模式
得分
排名/总数
1536.36
12 / 35

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
极高
14.40
63 / 122

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
Code Migration
极高工具
31.11
27 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
72.16
24 / 61

临床工作与医疗决策

共 1 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
极高工具
88.89
7 / 66

和其他模型对比

Muse Spark 1.1

发布机构

Facebook AI研究实验室
Facebook AI研究实验室
查看发布机构详情
Muse Spark 1.1 by Meta Superintelligence Labs

模型解读

Meta 押注智能体方向的第二步

Muse Spark 1.1 是 Meta Superintelligence Labs 于 2026 年 7 月 9 日发布的 Muse Spark 系列升级版本。官方把它定位为面向智能体任务(agentic tasks)的多模态推理模型,重点提升工具使用、电脑操作、编码和多模态理解四项能力。

这条产品线值得注意的背景是:Meta 在 2026 年 4 月推出 Muse Spark 时,同时停掉了此前的 Llama 系列,路线也从开放权重转向闭源托管。Muse Spark 1.1 就是这条新路线上的第一次迭代。

能当主 agent,也能当子 agent

Meta 描述的能力重心在多智能体协作上:模型可以为个人智能体任务做规划、跨外部应用和服务做编排,并泛化到新的原生工具、MCP servers 和自定义技能。在多智能体工作流中,它既能作为主 agent 负责收集上下文、制定计划并并行委派子 agent,也能作为子 agent 执行限定任务、在需要时把问题回传升级。

电脑操作方面,官方强调它能在多应用、信息动态变化的环境中保持上下文,并根据任务性质自行选择「写脚本自动化」还是「直接操作界面」——这个判断能力往往比单纯会点鼠标更关键。编码方面则针对大型复杂代码库的调试、功能实现、迁移和端到端问题解决做了强化。

1M 上下文,而且会自己管理

模型上下文窗口为 100 万 tokens。比窗口大小更值得说的是官方描述的主动管理能力:它能记住早期操作、在需要时检索更早的信息,并在长任务中对上下文做压缩,以保留后续步骤真正需要的内容。对动辄几十轮工具调用的智能体任务而言,这种「自己收拾上下文」的能力决定了任务能跑多远。

多模态输入覆盖视觉、音频、视频和 PDF,典型用途包括视觉到代码的生成、图像与视频的细节描述,以及需要「感知 + 行动」结合的智能体流程。

官方评测

Meta 公布的基准成绩包括:MCP-Atlas 88.1、Tool Decathlon / Toolathlon-Verified 75.6、OSWorld-Verified 80.8、Humanity’s Last Exam(带工具)62.1、Terminal-Bench 2.1 80.0、SWE-Bench Pro 61.5、DeepSWE 1.1 53.3。官方另称其在内部编码评估中相较初代 Muse Spark 有显著提升。这些均为厂商自报口径。

安全评估

Meta 同步发布了 Muse Spark 1.1 Evaluation Report,说明模型在发布前按 Advanced AI Scaling Framework 完成了安全与能力评估,覆盖化学与生物、网络安全、失控风险、对抗鲁棒性和模型行为等类别。Meta 称部署后的残余风险在该框架下处于「中等或更低」范围。

怎么用,以及哪些信息还没有

随本次发布,Meta 同步推出了 Meta Model API 的 public preview,开发者可通过它调用 Muse Spark 1.1;模型也已在 Meta AI app 与 meta.ai 的 Thinking mode 中开放。

需要如实说明的是,Meta 在发布页中没有公布标准 API token 价格、参数规模、最大输出长度和知识截止时间,模型也未公开权重与训练细节,属于闭源托管模型,因此本页这些字段留空而非填入推测值。

后续版本方面:Meta 已于 2026 年 8 月 5 日发布编程向的 Muse Spark 1.2,并公布了明确的 API 价格;若以编码任务为主,建议直接看那一代。

Muse Spark 1.1

常见问题

Muse Spark 1.1 是什么模型?

Muse Spark 1.1 是 Meta Superintelligence Labs 于 2026 年 7 月 9 日发布的 Muse Spark 升级版,多模态推理模型,重点提升 agentic 任务、工具与电脑使用、编码和多模态理解;模型支持 1M token 上下文,并通过 Meta Model API public preview、Meta AI app 与 meta.ai 开放使用。

Muse Spark 1.1 支持哪些输入和输出模态?

当前官方资料记录其支持文本、图像、视频、音频输入,并生成文本输出。

Muse Spark 1.1 的上下文窗口和最大输出是多少?

上下文窗口为 1M。未公开或无法确认的规格不做推测。

Muse Spark 1.1 适合哪些任务?

根据已收录的官方能力标签,它适合推理大模型、编程大模型相关任务;实际效果应结合具体工作流验证。

Muse Spark 1.1 是否开源?

代码与模型权重按 不开源 记录;使用前仍应核对官方许可原文。

Is Muse Spark 1.1 open source?

The model weights are proprietary and are not published for download. Review the linked license text before commercial or derivative use.

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码