Qwen-Audio-3.1-TTS-Flash 国际站现在多少钱?
新加坡地域自 2026 年 9 月 22 日起,输入 0.23 美元/百万 tokens,输出 1.87 美元/百万 tokens,两者分别计费。
Qwen-Audio-3.1-TTS-Flash
Qwen-Audio-3.1-TTS-Flash 是阿里巴巴的语音合成 API,新加坡地域自 2026 年 9 月 22 日起按输入 0.23 美元/百万 tokens、输出 1.87 美元/百万 tokens 计费。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $0.230/ 1M tokens | — |
| 音频 | - | — | $1.87/ 1M tokens |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
Qwen-Audio-3.1-TTS-Flash 是阿里巴巴根据给定文字生成语音的托管模型,支持表现力控制。国际站近期需要更正的关键信息是计费方式:新加坡地域已于 2026 年 9 月 22 日从字符计费改为输入、输出 tokens 分别计费。
阿里云 9 月 21 日公告规定,新加坡地域自 9 月 22 日起,输入价格为 0.23 美元/百万 tokens,输出价格为 1.87 美元/百万 tokens。此前的 0.15 美元/万字符属于历史价格。文字输入和生成语音均会产生费用,不能只按旧字符单价估算当前总账单。
模型支持指令跟随,并可通过标签控制情感、语气、角色、语速和音量;官方音色列表现已给出语言覆盖和区分大小写的音色 ID,例如英式英语 Emily_v3.1、美式英语 Brian_v3.1,以及多语种音色 longanhuan_v3.1 和 xunanchuan_v3.1。支持范围随所选音色而变。官方所说的噪声及混响鲁棒性,指向声音克隆所用的参考音频,不是语音识别准确率。
例如,上述多语种系统音色的官方表格列有日语、韩语、法语、德语、葡萄牙语、意大利语、越南语和印度尼西亚语,以及上海话、粤语、东北话、重庆话、陕西话、云南话、宁波话和甘肃话。另有普通话专用与英语专用音色;这些例子不能视为每个音色都具备的统一语言清单。
API 型号为 qwen-audio-3.1-tts-flash,主输入为文本、输出为音频;声音克隆的参考音频承担音色条件输入的作用。该版本通过阿里云百炼和 QwenCloud 托管提供,目前未链接可下载权重。
官方文档提供 WebSocket 实时合成和 HTTP 非实时合成两种接入方式,同时支持声音克隆和 Voice Design。Voice Design 可根据自然语言描述创建音色,无需提供参考音频;音色描述支持中文和英文,合成语言仍需按音色及模型约束选择。
语音回复、内容配音和多语言语音输出适合使用 TTS,前提是官方音色列表支持目标语言。把录音转成文字应比较专用 Qwen ASR 模型;实时翻译输入语音并发出译声则应比较 Qwen3.8-LiveTranslate。本次复核未找到这一具体 Flash 版本的独立测试,TTS Plus 的结果不能用来证明 Flash 的表现。
来源:官方模型与调用文档; Voice Design 官方指南; 阿里云 9 月 21 日调价公告;官方音色列表;QwenCloud 模型页。复核日期:2026 年 9 月 28 日。
新加坡地域自 2026 年 9 月 22 日起,输入 0.23 美元/百万 tokens,输出 1.87 美元/百万 tokens,两者分别计费。
不是。这是此前的国际站价格;9 月 22 日起新加坡地域已改为输入、输出 tokens 分别计费。
不是。官方描述的是声音克隆中参考音频的噪声与混响鲁棒性;本模型的主要任务是文本转语音。
No. It synthesizes speech from text. ASR transcribes speech into text; Qwen3.8-LiveTranslate translates incoming speech into text and speech.
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
