DataLearner 标志
MM

MMS

基础大模型Audio

Massively Multilingual Speech

发布时间: 2023-05-23更新于: 2023-05-23浏览量: 682
在线体验GitHubHugging Face对比
模型参数
10亿
上下文长度
2K
多语言支持
暂无数据
推理能力
暂无数据

Massively Multilingual Speech 是由 Facebook AI研究实验室 发布的 AI 模型,发布时间为 2023-05-23,定位为 基础大模型,参数规模约为 10亿,上下文长度为 2K,模型文件大小约 10.8GB。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

MMS

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
2K tokens
最大输出长度
暂无数据
模型类型
基础大模型
输入/输出模态
暂无数据
发布时间
2023-05-23
模型文件大小
10.8GB
MoE架构
否
总参数 / 激活参数
10亿 / 不适用
知识截止
暂无数据
MMS

开源和体验地址

代码开源状态
暂无数据
预训练权重开源
暂无数据
Hugging Face
暂无
在线体验
暂无
MMS

官方介绍与博客

DataLearnerAI博客
暂无
MMS

API接口信息

接口速度
暂无数据
暂无公开的 API 定价信息。
MMS

发布机构

Facebook AI研究实验室
Facebook AI研究实验室
查看发布机构详情
Massively Multilingual Speech

模型解读

MMS模型的详细介绍: https://www.datalearner.com/blog/1051684857225321 

Massively Multilingual Speech简称MMS,是MetaAI发布的最新的语音模型,它可以完成自动语音识别(Auto Speech Recognition,ASR),也可以做语音合成(Text-to-Speech,TTS)。

现有的最大语音数据集最多覆盖100种语言。为了克服这一挑战,MetaAI转向了被翻译成许多不同语言的宗教文本,如圣经,这些翻译已经被广泛用于基于文本的语言翻译研究。通过这个项目,MetaAI创建了一个数据集,包含了在1100多种语言下的朗读《新约》的语音数据集,平均每种语言提供了32小时的数据。

MMS模型的一个显著特点是其覆盖的语言数量。通过使用wav2vec 2.0自我监督学习模型,MMS模型可以支持超过1100种语言的语音到文本和文本到语音转换,以及超过4000种语言的语言识别。这一点对于许多只有几百名使用者的语言来说,是非常重要的,因为对于这些语言,之前并没有语音技术的存在。

MMS比OpenAI的Whisper模型效果更好:

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码