DataLearner 标志
MI

Mistral Medium 3.5

聊天大模型编程大模型Mistral MediumMistral Medium 3.5

Mistral Medium 3.5

发布时间: 2026-05-01更新于: 2026-09-15浏览量: 175
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
256K
多语言支持
暂无数据
推理能力
暂无数据

Mistral AI 于 2026 年 4 月底发布的中端旗舰模型,128B 稠密架构(不是 MoE),256K 上下文,支持文本与图像输入、文本输出,用一套权重同时覆盖指令跟随、推理和编程。权重按 Modified MIT License 开放,允许商业与非商业使用,但对大营收公司设有例外条款。推理模式可按请求在 reasoning_effort='none'(标准快速推理)与 'high'(启用测试时计算增强推理)之间切换,官方建议 high 档温度取 0.7、标准模式按任务在 0.0–0.7 之间取值。部署门槛相对友好——官方推荐的 vLLM 配置为 --tensor-parallel-size 8(8 卡张量并行)。官方 benchmark:SWE-Bench Verified 77.6%、τ³-Telecom 91.4%,并称在所有基准上超越此前的 Devstral 系列。它同时是 Mistral 的 Le Chat 与 Vibe 编程智能体的底层模型。API 价格为每百万 tokens 输入 $1.50、输出 $7.50。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Mistral Medium 3.5

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
256K tokens
最大输出长度
暂无数据
模型类型
聊天大模型
输入/输出模态
文本 → 文本
发布时间
2026-05-01
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
Mistral Medium 3.5

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
暂无
Mistral Medium 3.5

官方介绍与博客

官方论文
暂无
DataLearnerAI博客
暂无
Mistral Medium 3.5

API接口信息

接口速度
暂无数据
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$1.50/ 1M tokens$7.50/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Mistral Medium 3.5

评测结果

Mistral Medium 3.5 当前已收录的代表性评测结果包括 Terminal Bench Hard(86 / 244,得分 33.30)、ECI(90 / 167,得分 141.42)、τ³-Banking(112 / 167,得分 15.10)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式
工具使用
联网能力

自主开发与终端任务

共 1 项评测
评测名称 / 模式
得分
排名/总数
Terminal Bench Hard
思考模式工具
33.30
86 / 244

多轮记忆与持续上下文

共 2 项评测
评测名称 / 模式
得分
排名/总数
Context Arena
常规模式
17.64
125 / 126
32.05
114 / 126

跨能力聚合指数

共 3 项评测
评测名称 / 模式
得分
排名/总数
ECI
unknown
141.42
90 / 167
Vals Index
高工具
17.95
40 / 42

办公与文档流程

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-Briefcase
常规模式工具
519.11
3 / 3

图像感知与视觉推理

共 1 项评测
评测名称 / 模式
得分
排名/总数
MMMU-Pro
思考模式
64.90
154 / 229

科学计算与科研编程

共 1 项评测
评测名称 / 模式
得分
排名/总数
SciCode
思考模式
39.58
108 / 134

客服与业务流程

共 2 项评测
评测名称 / 模式
得分
排名/总数
SAGE
高工具
37.61
46 / 64
τ³-Banking
思考模式工具
15.10
112 / 167

法律

共 3 项评测
评测名称 / 模式
得分
排名/总数
Harvey Lab-AA
思考模式工具
69.10
34 / 44
9.13
40 / 42
0.42
35 / 43

金融

共 2 项评测
评测名称 / 模式
得分
排名/总数
32.10
40 / 43
11.19
41 / 42

文档与图表理解

共 1 项评测
评测名称 / 模式
得分
排名/总数
GDP.pdf
思考模式
2.80
106 / 122

专业数据分析

共 1 项评测
评测名称 / 模式
得分
排名/总数
AA-AnalystAgent
常规模式工具联网
12.50
23 / 29

维护、优化与工程管理

共 1 项评测
评测名称 / 模式
得分
排名/总数
5.13
41 / 43

程序生成与编辑

共 1 项评测
评测名称 / 模式
得分
排名/总数
2.89
57 / 61

数学

共 1 项评测
评测名称 / 模式
得分
排名/总数
9
28 / 28

临床工作与医疗决策

共 2 项评测
评测名称 / 模式
得分
排名/总数
MedScribe
高工具
67.73
63 / 66
MedCode
高工具
33.75
56 / 64

和其他模型对比

Mistral Medium 3.5

发布机构

Mistral Medium 3.5

模型解读

模型定位

Mistral Medium 3.5 是 Mistral AI 于 2026 年 4 月底发布的中端旗舰模型,官方 Hugging Face 仓库为 mistralai/Mistral-Medium-3.5-128B。它的设计目标是用一套权重同时覆盖指令跟随、推理和编程三类任务,面向智能体工作流、编程和复杂多步推理场景,并作为 Mistral 自家产品 Le Chat 与 Vibe 编程智能体的底层模型。

架构与规格

模型为 128B 稠密架构——不是混合专家(MoE),全部参数参与计算。上下文窗口 256K tokens;输入支持文本与图像,输出为文本。官方模型卡未明确给出最大输出长度。

推理模式

支持按请求切换的两档 reasoning effort:'none' 为标准快速推理,'high' 启用测试时计算增强推理。官方给出的采样建议是:reasoning_effort="high" 时温度取 0.7;标准模式下按任务性质在 0.0 到 0.7 之间取值。这种「一个模型两档模式」的设计避免了在快模型和慢模型之间切换的工程成本。

开放权重与许可

权重按 Modified MIT License 开放,允许商业与非商业使用,但对大营收公司设有例外条款——落地前需要核对自身是否触发该条款。这与标准 MIT 不同,不能按完全自由的开源协议对待。

部署要求

官方推荐的 vLLM 部署配置为 --tensor-parallel-size 8,即 8 卡张量并行。相比动辄需要多机集群的万亿参数模型,128B 稠密模型的自建门槛明显更低,单机 8 卡即可承载。

官方评测

Mistral 公布的成绩包括:SWE-Bench Verified 77.6%、τ³-Telecom 智能体评测 91.4%,官方并称其在所有基准上超越了此前的 Devstral 系列模型。

价格

API 价格为每百万 tokens 输入 $1.50、输出 $7.50。

Mistral Medium 3.5

常见问题

Mistral Medium 3.5 是开源的吗?可以商用吗?

权重是开放的,但许可不是标准开源协议。它采用 Modified MIT License,允许商业与非商业使用,但对大营收公司设有例外条款。落地前需要核对自身营收规模是否触发该条款,不能直接按完全自由的 MIT 对待。

自建 Mistral Medium 3.5 需要什么配置?

官方推荐的 vLLM 部署配置是 --tensor-parallel-size 8,也就是 8 卡张量并行。128B 稠密模型的门槛比万亿参数 MoE 低很多——单机 8 卡即可承载,不需要多机集群,这是它在自部署场景下的主要优势。

它是 MoE 还是稠密模型?

稠密模型,128B 参数全部参与计算,不是混合专家架构。这意味着它的推理成本与参数量直接相关,不像 MoE 那样能靠稀疏激活压低单次推理开销;但换来的是部署简单、行为稳定,且不需要处理专家路由带来的负载不均问题。

reasoning effort 的两档怎么用?

按请求切换:'none' 是标准快速推理,'high' 启用测试时计算增强推理。官方的采样建议不同——high 档用温度 0.7,标准模式按任务在 0.0 到 0.7 之间取。好处是不用在快模型和慢模型之间切换部署,同一套权重就能覆盖两种延迟需求。

Mistral Medium 3.5 的编程能力如何?

官方给出的 SWE-Bench Verified 成绩为 77.6%,智能体评测 τ³-Telecom 为 91.4%,并称其在所有基准上超越了此前的 Devstral 系列(Mistral 的编程专用线)。它也是 Mistral 自家 Vibe 编程智能体的底层模型。

它支持图片输入吗?上下文多长?

支持文本与图像输入,输出为文本。上下文窗口 256K tokens。官方模型卡没有明确给出最大输出长度。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码