DataLearner 标志
MI

Mistral 7B

已下架 · 2025-03-30基础大模型MistralMistral 7B

Mistral 7B

发布时间: 2023-09-27更新于: 2026-09-18退役: 2025-03-30浏览量: 923
模型参数
73亿
上下文长度
8K
多语言支持
暂无数据
推理能力
暂无数据

Mistral 7B 是由 MistralAI 发布的 AI 模型,发布时间为 2023-09-27,定位为 基础大模型,参数规模约为 73亿,上下文长度为 8K,模型文件大小约 15GB,采用 Apache 2.0 许可,在 MMLU 上取得 60.10 分。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Mistral 7B

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
8K tokens
最大输出长度
暂无数据
模型类型
基础大模型
输入/输出模态
暂无数据
发布时间
2023-09-27
模型文件大小
15GB
MoE架构
否
总参数 / 激活参数
73亿 / 不适用
知识截止
暂无数据
Mistral 7B

开源和体验地址

代码开源状态
预训练权重开源
Apache 2.0- 免费商用授权
在线体验
暂无
Mistral 7B

官方介绍与博客

DataLearnerAI博客
暂无
Mistral 7B

API接口信息

接口速度
暂无数据
暂无公开的 API 定价信息。
Mistral 7B

评测结果

Mistral 7B 当前已收录的代表性评测结果包括 AGIEval(12 / 28,得分 43)、MBPP(42 / 69,得分 50.20)、GSM8K(45 / 68,得分 52.10)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。

思考模式

综合知识考试

共 2 项评测
评测名称 / 模式
得分
排名/总数
MMLU
常规模式
60.10
92 / 124
AGIEval
常规模式
43
12 / 28

数学

共 1 项评测
评测名称 / 模式
得分
排名/总数
GSM8K
常规模式
52.10
45 / 68

程序生成与编辑

共 2 项评测
评测名称 / 模式
得分
排名/总数
MBPP
常规模式
50.20
42 / 69
HumanEval
常规模式
26.20
87 / 101
Mistral 7B

发布机构

Mistral 7B

模型解读

模型简介与特点

Mistral 7B 是 Mistral AI 公司推出的一款具有 73 亿参数的模型,它在多项基准测试中展现了优异的性能。该模型能够在诸如常识推理、世界知识、阅读理解、数学、编码等多个领域上与其他大型模型相媲美甚至超越。它采用了 Grouped-query attention (GQA) 和 Sliding Window Attention (SWA) 技术,不仅能快速进行推断,还能以较低的成本处理长序列。更值得一提的是,Mistral 7B 是在 Apache 2.0 许可下发布的,这意味着任何人都可以无限制地使用它​1​。

模型训练细节

虽然 Mistral 7B 的官方发布通知并没有详细披露模型的训练细节,但通过它的结构和性能我们可以推断,其训练过程很可能涉及了大量的数据和计算资源。模型的 Sliding Window Attention (SWA) 机制以及对不同任务的微调展现了其在多种情景下的适应性和灵活性。

模型评测结果

Mistral 7B 在多项基准测试中表现出色,例如在常识推理、世界知识和阅读理解等领域,其性能与参数量更大的 Llama 2 模型相当,甚至在某些任务上超越了 Llama 1 34B。在编码和推理基准测试上,Mistral 7B 的表现尤为突出,接近于 CodeLlama 7B 的性能,同时在英语任务上保持了良好的性能​1​。

模型开源

Mistral 7B采用Apache 2.0的开源协议,完全可以免费商用。同时,该模型可以在不同的云平台(如 AWS、GCP 和 Azure)上部署,并且在 HuggingFace 平台上也得到了支持。

技术名称描述
Grouped-query Attention (GQA)通过将查询分组来加速推断过程,提高了模型的效率。
Sliding Window Attention (SWA)使模型能够处理较长的序列,而且在每个层次上只关注前 4,096 个隐藏状态,降低了计算成本。
Fine-tuningMistral 7B可以容易地针对特定任务进行微调,如聊天任务微调展现了优异的性能。
Open Source License (Apache 2.0)该模型在 Apache 2.0 许可下发布,可以无限制地使用,包括本地使用或者在 AWS、GCP、Azure 云平台上部署。
Performance BenchmarkingMistral 7B与其他大型模型(如 Llama 2和 CodeLlama 7B)进行了广泛的基准测试比较,展现了在多个任务和领域上的优异性能。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码