Qwen-Audio-3.1-ASR
阿里巴巴语音识别系列,覆盖 30 种语言,分别提供短音频、长录音与实时转写接口。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
发布机构
模型解读
Qwen-Audio-3.1-ASR 是阿里巴巴的语音识别模型系列,已列入2026 年 9 月 22 日云栖大会官方发布公告。API 覆盖短音频、长录音文件和实时转写,选型时需要区分具体版本:说话人分离能力和计费随接口变化。
短录音、长文件和实时字幕使用不同接口
官方选型文档列出三个版本:qwen-audio-3.1-asr-flash 处理最长 5 分钟短音频;qwen-audio-3.1-asr-flash-filetrans 处理最长 12 小时、最大 2 GB 的录音文件;qwen-audio-3.1-asr-flash-streaming 通过 WebSocket 实时转写,文档未设音频总时长上限。三者均支持提示词上下文和热词;Flash 与 Filetrans 支持说话人分离,Streaming 不支持。
方言转写和声音理解要按版本区分
Qwen 官方研究页给出 30 种语言、16 种中文方言的覆盖范围,展示原生转写润色和带说话人标签的转写;环境声、音乐及声音场景理解归于 ASR-Next。部分展示结果沿用 3.0 报告,不能视为每个 3.1 接口都经过独立复测。本次未找到附可检查原始结果的独立 3.1 评测。
国际调用价格随接口变化
2026 年 9 月 28 日核对的新加坡官方美元报价:Flash 与 Filetrans 每百万音频输入 token 为 0.15 美元、每百万文本输出 token 为 0.47 美元;Streaming 分别为 0.93 和 0.70 美元。该报价按 token 计费,不能直接当作每分钟转写价。本页介绍整个系列,因此不设置统一的结构化价格或上下文上限。
按录音长度和说话人要求选择版本
短片段使用 Flash;需要区分说话人的会议、访谈录音使用 Filetrans;实时字幕使用 Streaming。声音场景问答需单独评估 ASR-Next。本地部署可考虑更早的开源 Qwen3-ASR 系列,不能据此认为 3.1 API 系列也已开放权重。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
