DataLearner 标志
QW

Qwen-Audio-3.1-ASR

语音大模型Qwen Audio / RealtimeQwen Audio 3.1

Qwen-Audio-3.1-ASR

发布时间: 2026-09-22更新于: 2026-09-28浏览量: 28
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
暂无数据
多语言支持
30 种语言
推理能力
3/5

阿里巴巴语音识别系列,覆盖 30 种语言,分别提供短音频、长录音与实时转写接口。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Qwen-Audio-3.1-ASR

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
暂无数据
最大输出长度
暂无数据
模型类型
语音大模型
输入/输出模态
音频 → 文本
发布时间
2026-09-22
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
Qwen-Audio-3.1-ASR

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
在线体验
暂无
Qwen-Audio-3.1-ASR

官方介绍与博客

DataLearnerAI博客
暂无
Qwen-Audio-3.1-ASR

API接口信息

接口速度
3/5
暂无公开的 API 定价信息。
Qwen-Audio-3.1-ASR

发布机构

Qwen-Audio-3.1-ASR

模型解读

Qwen-Audio-3.1-ASR 是阿里巴巴的语音识别模型系列,已列入2026 年 9 月 22 日云栖大会官方发布公告。API 覆盖短音频、长录音文件和实时转写,选型时需要区分具体版本:说话人分离能力和计费随接口变化。

短录音、长文件和实时字幕使用不同接口

官方选型文档列出三个版本:qwen-audio-3.1-asr-flash 处理最长 5 分钟短音频;qwen-audio-3.1-asr-flash-filetrans 处理最长 12 小时、最大 2 GB 的录音文件;qwen-audio-3.1-asr-flash-streaming 通过 WebSocket 实时转写,文档未设音频总时长上限。三者均支持提示词上下文和热词;Flash 与 Filetrans 支持说话人分离,Streaming 不支持。

方言转写和声音理解要按版本区分

Qwen 官方研究页给出 30 种语言、16 种中文方言的覆盖范围,展示原生转写润色和带说话人标签的转写;环境声、音乐及声音场景理解归于 ASR-Next。部分展示结果沿用 3.0 报告,不能视为每个 3.1 接口都经过独立复测。本次未找到附可检查原始结果的独立 3.1 评测。

国际调用价格随接口变化

2026 年 9 月 28 日核对的新加坡官方美元报价:Flash 与 Filetrans 每百万音频输入 token 为 0.15 美元、每百万文本输出 token 为 0.47 美元;Streaming 分别为 0.93 和 0.70 美元。该报价按 token 计费,不能直接当作每分钟转写价。本页介绍整个系列,因此不设置统一的结构化价格或上下文上限。

按录音长度和说话人要求选择版本

短片段使用 Flash;需要区分说话人的会议、访谈录音使用 Filetrans;实时字幕使用 Streaming。声音场景问答需单独评估 ASR-Next。本地部署可考虑更早的开源 Qwen3-ASR 系列,不能据此认为 3.1 API 系列也已开放权重。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码