DataLearner 标志
QW

Qwen-Audio-3.1-TTS-Flash

语音大模型实时对话大模型Qwen Audio / RealtimeQwen Audio 3.1

Qwen-Audio-3.1-TTS-Flash

发布时间: 2026-09-19更新于: 2026-09-28浏览量: 51
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
暂无数据
多语言支持
支持
推理能力
3/5

Qwen-Audio-3.1-TTS-Flash 是阿里巴巴的语音合成 API,新加坡地域自 2026 年 9 月 22 日起按输入 0.23 美元/百万 tokens、输出 1.87 美元/百万 tokens 计费。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Qwen-Audio-3.1-TTS-Flash

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
暂无数据
最大输出长度
暂无数据
模型类型
语音大模型
输入/输出模态
文本 → 音频
发布时间
2026-09-19
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
Qwen-Audio-3.1-TTS-Flash

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
Qwen-Audio-3.1-TTS-Flash

官方介绍与博客

DataLearnerAI博客
暂无
Qwen-Audio-3.1-TTS-Flash

API接口信息

接口速度
5/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$0.230/ 1M tokens—
音频-—$1.87/ 1M tokens

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Qwen-Audio-3.1-TTS-Flash

发布机构

Qwen-Audio-3.1-TTS-Flash

模型解读

Qwen-Audio-3.1-TTS-Flash 是阿里巴巴根据给定文字生成语音的托管模型,支持表现力控制。国际站近期需要更正的关键信息是计费方式:新加坡地域已于 2026 年 9 月 22 日从字符计费改为输入、输出 tokens 分别计费。

旧字符单价已被输入输出 token 价格替代

阿里云 9 月 21 日公告规定,新加坡地域自 9 月 22 日起,输入价格为 0.23 美元/百万 tokens,输出价格为 1.87 美元/百万 tokens。此前的 0.15 美元/万字符属于历史价格。文字输入和生成语音均会产生费用,不能只按旧字符单价估算当前总账单。

情绪与音色控制针对的是生成语音

模型支持指令跟随,并可通过标签控制情感、语气、角色、语速和音量;官方音色列表现已给出语言覆盖和区分大小写的音色 ID,例如英式英语 Emily_v3.1、美式英语 Brian_v3.1,以及多语种音色 longanhuan_v3.1 和 xunanchuan_v3.1。支持范围随所选音色而变。官方所说的噪声及混响鲁棒性,指向声音克隆所用的参考音频,不是语音识别准确率。

例如,上述多语种系统音色的官方表格列有日语、韩语、法语、德语、葡萄牙语、意大利语、越南语和印度尼西亚语,以及上海话、粤语、东北话、重庆话、陕西话、云南话、宁波话和甘肃话。另有普通话专用与英语专用音色;这些例子不能视为每个音色都具备的统一语言清单。

文本合成与声音克隆参考音频需要区分

API 型号为 qwen-audio-3.1-tts-flash,主输入为文本、输出为音频;声音克隆的参考音频承担音色条件输入的作用。该版本通过阿里云百炼和 QwenCloud 托管提供,目前未链接可下载权重。

官方文档提供 WebSocket 实时合成和 HTTP 非实时合成两种接入方式,同时支持声音克隆和 Voice Design。Voice Design 可根据自然语言描述创建音色,无需提供参考音频;音色描述支持中文和英文,合成语言仍需按音色及模型约束选择。

配音、转写和同传需要不同模型

语音回复、内容配音和多语言语音输出适合使用 TTS,前提是官方音色列表支持目标语言。把录音转成文字应比较专用 Qwen ASR 模型;实时翻译输入语音并发出译声则应比较 Qwen3.8-LiveTranslate。本次复核未找到这一具体 Flash 版本的独立测试,TTS Plus 的结果不能用来证明 Flash 的表现。

来源:官方模型与调用文档; Voice Design 官方指南; 阿里云 9 月 21 日调价公告;官方音色列表;QwenCloud 模型页。复核日期:2026 年 9 月 28 日。

Qwen-Audio-3.1-TTS-Flash

常见问题

Qwen-Audio-3.1-TTS-Flash 国际站现在多少钱?

新加坡地域自 2026 年 9 月 22 日起,输入 0.23 美元/百万 tokens,输出 1.87 美元/百万 tokens,两者分别计费。

0.15 美元/万字符还是现价吗?

不是。这是此前的国际站价格;9 月 22 日起新加坡地域已改为输入、输出 tokens 分别计费。

噪声鲁棒性指语音识别吗?

不是。官方描述的是声音克隆中参考音频的噪声与混响鲁棒性;本模型的主要任务是文本转语音。

Is this model an ASR speech-recognition model?

No. It synthesizes speech from text. ASR transcribes speech into text; Qwen3.8-LiveTranslate translates incoming speech into text and speech.

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码