基于证据的综述 · 2026年8月
开放权重、托管 API 以及命名差异——清晰呈现。.
证据限制: 据称没有关于Qwen3-TTS的第一手试听评分。.
一篇有价值的 Qwen3-TTS 评测,在对语音进行评分之前,必须先回答一个更基本的问题:我们所说的究竟是哪款 Qwen3-TTS? 在2026年,这一名称涵盖了可下载的0.6B和1.7B检查点、阿里云托管的Qwen3-TTS API,以及一个同时推荐独立的Qwen-Audio 3.0 TTS产品系列的市场。 若将这些产品视为同一事物,会导致关于速度、语言和定价的宣传产生误导。.
简而言之,Qwen3-TTS 是 2026 年最具灵活性的开源语音堆栈之一。它支持十种语言、针对特定任务的检查点、约三秒的语音克隆、自然语言语音设计、流式传输支持,并采用 Apache-2.0 许可证发布。 但本评测并未制定听感评分标准:现有的测试环境未能提供真实的 Qwen3-TTS 端点,且本地 2 GB GPU 不适合进行具有代表性的 0.6B 与 1.7B 版本对比基准测试。.
2026年Qwen3-TTS的状态
Qwen 于 2026 年 1 月 22 日发布了公开的 Qwen3-TTS 权重。该 Qwen3-TTS 官方代码库 列出了五个已发布的 12Hz 检查点:1.7B VoiceDesign、1.7B CustomVoice、1.7B Base、0.6B CustomVoice 和 0.6B Base。相应的 Hugging Face 数据集 还包括分词器。这些是开发人员可以在已发布的许可下查看、下载和运行的模型。.
阿里云还通过非实时和实时接口,分别提供托管式的 Qwen3-TTS Flash、Instruct、语音克隆和语音设计系列产品。其当前 语音合成模型目录 应将其视为托管别名、区域、语言和接口的权威来源,因为这些详细信息可能会发生变化,而开放检查点的名称却不会随之改变。.
在命名方面还有一点需要注意。阿里云的2026年模型选择指南还建议用户在处理若干托管任务时选用Qwen-Audio 3.0 TTS。 Qwen-Audio 3.0 TTS 并非 0.6B 或 1.7B 版本的 Qwen3-TTS 检查点更名而来。如果您已经熟悉更广泛的 Qwen 系列,我们的 Qwen 3.8 最高规格及访问评测 说明了为何在Qwen系列产品中,精确的型号命名至关重要。.
在本地推理时请使用开放检查点名称;在调用 API 时请使用阿里云的精确模型 ID;而 Qwen-Audio 3.0 TTS 仅作为独立的替代方案使用。这样可以确保所有关于质量、延迟和价格的声明都与生成该声明的产品相关联。.
简评:功能强大、开放且注重证据
简评
公开部署、研究、克隆及角色配音。.
两种尺寸共设五个针对特定任务的检查点。.
供应商的处理速度因环境而异;此处暂不对此进行评分。Vendor speed is environment-specific; quality remains unrated here.
由 Qwen3-TTS 和 Qwen-Audio 3.0 托管的都是独立的路由。.
对于希望拥有控制权和部署选择权的团队而言,Qwen3-TTS 最具吸引力。 Base 检查点支持克隆,CustomVoice 提供可命名且带指令控制的预设语音,而 VoiceDesign 能够根据书面描述生成语音。对十种语言的支持使该技术栈比仅支持英语的公开演示版本实用得多,而 0.6B 版本则为开发者提供了更精简的入门起点。.
需要特别注意的是证据质量。Qwen 在经过优化的内部环境中报告了出色的基准测试结果和较低的首次数据包延迟。这些数据并未反映笔记本电脑的冷启动情况、容器的显存余量,以及贵公司产品名称的发音。97 毫秒这一通用承诺未说明具体的基准测试条件。.
对于自托管的原型,Qwen3-TTS 应位列候选名单的前列。对于生产环境 API,请将托管的 Qwen3-TTS 方案与较新的 Qwen-Audio 方案在推荐方案、运维支持、区域可用性以及克隆语音的管理成本等方面进行对比。 如果您的目标不仅限于语音,还涉及音效或音乐,那么更广泛的 Seed Audio 1.0 语音、音效和音乐测试 涵盖一种不同且更具多模态特征的音频工作流程。.
总结:Qwen3-TTS 在架构、开放性和功能覆盖方面表现出色。其实际生产级性能仍取决于具体的检查点或终点、您的硬件、所用语言,以及经过您自身脚本测试并已达成共识的参考语音。.
什么是 Qwen3-TTS?
Qwen3-TTS 是一系列基于离散语音分词器的语音生成模型,其运行速率为每秒 12.5 帧。根据 Qwen3-TTS 技术报告, 该系统是在涵盖十种语言、总计超过五百万小时的数据集上进行训练的。较低的音素率是该设计的核心:较少的声学音素既能减少解码工作量,又能使流式处理更具实用性,同时模型仍需保留音色、发音和韵律。.
三个层次,三条证据规则
0.6B / 1.7B
Base、CustomVoice 和 1.7B VoiceDesign。用于本地模型的预测。.
Flash / Instruct / VC / VD
请使用准确的 API 模型、接口、区域和日期。.
Qwen-Audio 3.0 文本转语音
当前的托管替代方案,并非更名后的开放检查点。.
已发布的五个评估指标是针对特定任务设计的,而不是像那种“越大模型越全能”的阶梯式架构:
| 已释放检查点 | 尺寸 | 最匹配的职位 | 重要边界 |
|---|---|---|---|
| Qwen3-TTS-12Hz-0.6B-Base | 0.6B | 规模较小的克隆和研究工作流程 | 没有预设的 CustomVoice 目录 |
| Qwen3-TTS-12Hz-1.7B-Base | 17亿 | 大容量克隆及后续工作 | 需要更多的内存和计算能力 |
| Qwen3-TTS-12Hz-0.6B-CustomVoice | 0.6B | 带指令控制的预设语音 | 使用已发布的扬声器套装 |
| Qwen3-TTS-12Hz-1.7B-CustomVoice | 17亿 | 大容量预设语音合成 | 不是 VoiceDesign 检查点 |
| Qwen3-TTS-12Hz-1.7B-VoiceDesign | 17亿 | 根据文字描述生成音色 | 尚未发布 0.6B 版 VoiceDesign 对等节点 |
如果您已有参考音源且获准使用该声音,那么“Base”是您的最佳选择。当Qwen已发布的预设音色中有适合该项目的选项时,“CustomVoice”是更便捷的途径。“VoiceDesign”则适用于“一位声音低沉柔和、沉稳成熟的旁白”这类角色需求,此类情况无需提供参考录音。.
如果预设的旁白效果理想,产品教程就不需要克隆;如果VoiceDesign能塑造出合适的角色形象,虚构角色可能也不需要使用真人录音。请根据相应的检查点对每项任务进行评估。.
本篇关于 Qwen3-TTS 的评测是如何进行的
本评测采用了四个证据层:官方文档、Qwen技术报告、本地硬件检测,以及对一个独立托管的音频封装器的受控测试。官方来源支持产品事实和供应商报告的基准测试结果。封装器的受控测试仅支持其观察到的行为,并不支持Qwen3-TTS语音质量评分。.
列出的可用任务环境 qwen-audio-3.0-tts-flash, 不是 qwen3-tts-* 模型.
生成一段清晰的英语语音录音。请准确朗读以下内容:'日出时,研究团队在公布结果前对每个信号进行了两次核查。'请使用温暖、沉稳的成年人旁白,语速自然,辅音发音清晰,并在'日出'一词后稍作停顿。 请勿添加音乐、音效、引言或引文中未出现的任何词语。.
在我们的测试中,该输入生成了一个时长为21.263673秒的MP3文件,并朗读了导航指示。测试结果表明,该封装器将完整的提示语视为语音文本。.
日出时,研究团队在公布结果前,对每个信号都进行了两次核查。.
我们仅使用目标句子重复了该对照实验。在我们的测试中,生成的MP3文件时长为6.086531秒,采样率为22,050 Hz,比特率为128 kbps,且为单声道。该文件与目标句子逐字一致,未添加任何说明。.
该用户聆听了这两个文件,并确认了以下评分。这是一项由单一听众进行的实际测试,并非MOS研究或听音小组测试。.
| 听力维度 | 指令型控制 | 纯文本控件 |
|---|---|---|
| 自然感 | 4/5 | 5/5 |
| 可懂度 | 5/5 | 5/5 |
| 发音 | 5/5 | 5/5 |
| 韵律学 | 4/5 | 5/5 |
| 文本保真度 | 1/5 | 5/5 |
| 风格规范 | 未计分 | 5/5 |
| 遗物缺失 | 5/5 | 5/5 |
| 生产环境中的可用性 | 1/5 | 5/5 |
包含说明的样本听起来清晰且总体自然,但朗读说明的内容破坏了文本的保真度,也影响了实际应用的可行性。纯文本样本听起来自然,完全遵循了原文句式,且无需对内容进行任何整理。这些评分仅描述了上述两种 qwen-audio-3.0-tts-flash 包装控件;它们并非 Qwen3-TTS 检查点的语音质量评分。.
切勿假设样式说明和叙述属于同一字段。我们的指南中提到 让人工智能生成的语音听起来更像真人 虽然改进了脚本,但端点字段决定了“路线”是控制语音还是开始录音。.
经现场检测,发现该设备搭载了一块配备 2 GB 显存的 NVIDIA GeForce MX450 显卡,系统内存约为 16.9 GB。对于计划中的 0.6B 与 1.7B 矩阵对比测试而言,这并非一个公平的测试平台。 CPU 卸载可能仅为初步测试,其速度并不具有代表性。因此,Qwen3-TTS 语音质量、本地 RTF、克隆相似度以及跨语言一致性仍未进行评分。.
Qwen3-TTS语音质量:证据能证明什么
官方报告显示,Qwen3-TTS 在可懂度、说话人相似度、指令遵循能力、多语言生成、长篇语音以及流式传输等方面表现优异。这些数据虽可作为有用的对比参考,但仍属于 Qwen 报告中的基准数据,而非本文生成的录音。.
制作语音测试应涵盖发音、杂音、语速、情感表达、可重复性、编辑工作量、缩写、日期、货币、URL、人名、语言转换以及长句等内容。.
将听力练习与文字稿和元数据结合起来;该 ChatGPT 音频转录工作流程 使文本检查具有可重复性。.
Qwen3-TTS 看起来很有前景,但本评测中没有第一手的测试得分。发货前,请使用多次生成、原生播放器、耳机和手机扬声器进行测试。.
外部评论者关注的重点
Qwen的社交媒体演示突显了其丰富的音色、语言和方言。独立创作者比詹·鲍恩(Bijan Bowen)重点关注了本地化实现和语音克隆功能;杰夫·吉尔林(Jeff Geerling)则将此次发布定位为对托管式文本转语音(TTS)平台的强劲开源竞争。这些仅代表评论者的个人观点,并非基准测试结果,也并非市场普遍共识的证明。.
Qwen3-TTS 的速度和延迟
首包延迟
0.288 / 0.313
并发度为 1 时,结果为 0.6B / 1.7B。.
经过优化的内部 vLLM 环境——不保证可在笔记本电脑上运行。.
0.6B 12Hz 型号的首包延迟为 97 毫秒。同一份技术报告中的表格显示,1.7B 12Hz 型号在并发度为 1 时的首包延迟为 101 毫秒。 报告的实时因子(RTF)分别为0.288和0.313。通俗来说,RTF小于1意味着在该环境下,综合处理的速度快于生成的音频时长。.
这些结果来自 Qwen 经过优化的内部 vLLM 配置。它们并非针对 Windows 笔记本电脑、冷启动的无服务器容器或共享 API 区域的通用“首次音频输出时间”承诺。 该报告还表明,并发性会影响延迟。模型加载、参考音频处理、网络传输、队列处理、音频打包以及客户端播放等环节,其处理时间均可能超出核心解码器的计时范围。.
一份公正的基准记录应包括:
- 硬件、精度、模型修订和后端处理。.
- 冷态或热态、并发性、首次音频播放时间、总时间、峰值显存、输出时长和RTF。.
- 对于 API:区域、连接类型、请求 ID、队列和重试。.
当内存和并发性比最大容量更重要时,0.6B模型应是更稳妥的选择。当机器还有余量时,1.7B模型则是更合理的优质候选方案。但如果不使用相同的提示词、发言者、采样设置和预热状态,仅凭模型规模无法判断实际的延迟差异。.
Qwen3-TTS 语言与发音
开源的 Qwen3-TTS 检查点支持十种语言:中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语。此列表来自当前代码库和已发布的模型材料。 请勿擅自添加泰语、印尼语、马来语或越南语,因为另一款 Qwen 音频产品已支持这些语言。.
| 语言 | 官方公开支持 | 生产审查优先级 |
|---|---|---|
| 中文 | 是 | 声调、人名、数字读法、地区性文字风格 |
| 英语 | 是 | 重音、缩写、品牌名称、长句 |
| 日语 | 是 | 音调、助词、人名、拉丁文混用 |
| 韩语 | 是 | 空格、外来词、句尾处理 |
| 德语 | 是 | 复合词、数字、辅音群 |
| 法语 | 是 | 联络、缩写、借用名称 |
| 俄语 | 是 | 重音、人名、数字、拉丁语插入语 |
| 葡萄牙语 | 是 | 确认目标地区的口音和拼写 |
| 西班牙语 | 是 | 确认地区口音和专有名词 |
| 意大利语 | 是 | 重音、双音节化、外来名词 |
“支持”是指该模型能够合成该语言;这并不意味着每个地区的每种声音都同样具有母语般的自然感。仅葡萄牙语和西班牙语就包含重要的地区性差异。在商业部署中,应明确目标地区,招募母语评审员,并针对人名、度量单位、地址和法律术语构建发音回归数据集。.
代码转换需要专门的测试。例如“上午9:30在圣保罗打开Qwen3-TTS API”这样的句子,融合了英语句式、模型名称、葡萄牙语发音、标点符号和时间信息。 这比干净的单语演示句子更接近真实的应用程序文案。对于视频配音,发音还必须与时间轴匹配;我们的 Veo 3.1 对话、音频和口型同步工作流程 涉及周围的同步问题。.
语音克隆、CustomVoice 和 VoiceDesign
Base 检查点支持利用大约三秒的参考音频快速进行语音克隆。这只是一个令人印象深刻的最低能力门槛,并不意味着三秒的音频总是最佳的生成样本。较短的参考音频可能无法完整涵盖音域、语速、元音覆盖范围、情感表达以及麦克风的一致性。.
阿里云的托管式注册指南更为保守:它要求至少三秒钟的连续清晰语音,允许更长的语音样本,并建议使用更清晰、更长的录音以实现实际克隆。请遵循当前的 语音克隆文档 应依据格式、采样率、声道、时长和区域规则,而非将论文中那三秒的演示视为上传规范。.
CustomVoice 避免克隆真实人物。公开版本提供了九种适用于不同语言或风格的高级音色,当预设身份和指令控制已足够满足需求时,这一特点使其颇具吸引力。.
VoiceDesign 能够根据自然语言描述生成音色。该托管服务 语音设计文档 展示了独立的创作工作流程。该流程适用于虚构角色和合成品牌声音,但描述内容仍需针对感知年龄、口音和文化偏见进行测试。.
语音身份风险矩阵
记录发言人、范围、任期和离任途径。.
对引用内容进行加密,并在删除源文件时一并删除衍生音频。.
屏蔽有害的身份声明,并添加举报功能。.
当听众可能将其误认为真人时,请对合成语音进行标注。.
克隆需要明确的授权和知情同意。应保留原始同意记录,明确允许的使用范围,防止下游重新注册,并提供删除流程。这些风险并非理论上的; 面部识别与语音识别的隐私与同意分析 解释了为什么身份识别、生物识别数据和防冒充措施应当纳入产品设计之中,而不是作为附带说明。.
Qwen3-TTS 0.6B 与 1.7B:该运行哪个?
当您的首要考虑因素是部署时,请选择 0.6B。对于较小的 GPU、更高的并发度、更快的实验以及注重成本的自主托管场景,这是更优的选择。该规模下同时存在 Base 和 CustomVoice 两种版本,因此您无需从最大的检查点开始,即可评估克隆或预设语音模型。.
当质量余量和功能广度更为重要时,请选择 1.7B。这是唯一支持 VoiceDesign 的已发布规格,对于愿意以内存和吞吐量换取容量的团队而言,这是更合理的选择。 技术报告中的并发度为1时的测试数据表明,在Qwen的优化配置下,首包延迟和RTF存在微小差异,但您的实际硬件环境可能会放大或缩小这一差距。.
| 决策因素 | 从 0.6B 开始 | 从17亿开始 |
|---|---|---|
| GPU内存不足 | 更贴合 | 卸载风险较高或并发度较低 |
| 需要 VoiceDesign | 未收录于已发行的套装中 | 必填 |
| 需要碱基克隆 | 可用 | 另有更大容量的型号可供选择 |
| 需要 CustomVoice | 可用 | 另有更大容量的型号可供选择 |
| 需要进行快速可行性测试 | 最佳起点 | 管道工程完工后使用 |
| 需要确定最终的生产方案 | 对两者进行基准测试 | 对两者进行基准测试 |
参数数量并不等同于VRAM需求。精度、注意力机制的实现方式、缓存、引用长度、批量大小以及框架开销都会产生影响。一个勉强能加载的模型无法作为可靠的生产服务。.
对于本次评测中检测的 2 GB 版 MX450,两种配置均无法提供具有代表性的 GPU 基准测试路径。采用更新的 CUDA 堆栈以及合适的 GPU 或官方托管端点,才是切实可行的下一步措施。“在 CPU 卸载下运行”仅是一条兼容性说明,而非有意义的性能评判。.
Qwen3-TTS API:HTTP、流式传输和模型 ID
根据播放需求选择传输方式
批量添加旁白和完整文件的最简便方法。.
分批交付;仍需验证音频何时可播放。.
最适合对话和渐进式播放。.
阿里云提供了非实时 HTTP 生成和实时 WebSocket 两种模型。当您可以等待完整结果且希望采用最简单的请求流程时,请使用非实时合成。 当对话延迟或渐进式播放至关重要时,请使用 WebSocket 流式传输。HTTP 流式传输或服务器发送事件(SSE)虽可返回增量数据,但不应将其与专用的低延迟实时模型系列混为一谈。.
当前托管的语音库包括:用于内置语音的 Qwen3-TTS Flash、用于自然语言性能控制的 Instruct Flash、用于克隆语音的 VC,以及用于设计语音的 VD。 非实时和实时路径的模型 ID 及带日期的快照各不相同,因此请从当前文档中复制这些信息,而非通过类比来构造名称。.
当前的 Qwen-TTS API 文档 将每次请求的输入限制为 512 个令牌。这是该系列适用的限制;其他 TTS 模型中记录的另一条 600 个字符的规则不应复制到 Qwen3-TTS 集成中。 完整音频的 URL 有效期为 24 小时,因此生产系统应将所需文件移至持久化存储中,而非将响应 URL 作为永久媒体使用。.
import os
import dashscope
dashscope.base_http_api_url = "https://dashscope-intl.aliyuncs.com/api/v1"
response = dashscope.MultiModalConversation.call(
model="qwen3-tts-flash",
api_key=os.environ["DASHSCOPE_API_KEY"],
text="您的订单已准备好,下午4:30可前来取货。",
voice="Cherry",
language_type="English",
)
print(response)
API 密钥和端点区域必须一致。北京和新加坡的部署环境使用不同的凭据和基础 URL,且模型的可用性可能因区域而异。切勿将密钥嵌入 WordPress、客户端 JavaScript 或移动端二进制文件中。请通过您控制的服务器发送合成请求,记录请求 ID 时请勿记录敏感输入内容,并为生成的音频设置生命周期策略。.
对于长文档,应按语义边界进行分段,保留上下文,对数字进行标准化处理,并在每次连接处进行监听。即使通话之间节奏或情绪发生变化,有效的片段听起来仍可能像独立的录音片段。.
Qwen3-TTS在国际地区的定价
国际地区定价概览
闪光灯
$0.10
每10,000个输入字符指导 / VC / VD
$0.115
每10,000个输入字符Flash / VC
$0.13
每10,000个输入字符指导
$0.143
每10,000个输入字符VD
$0.143353
每10,000个输入字符语音生成: 每名注册学员 $0.01 · 每种设计语音 $0.20。.
阿里云的 Model Studio 价格页面 以下为2026年8月11日查询时列出的国际区域价格。对于这些行,输入数据需付费,输出数据免费。价格、免费配额、别名及区域可用性可能会发生变化,因此在进行大规模批处理之前,请确认所选的部署方案。.
| 路线 | 型号系列 | 每10,000个输入字符的价格 |
|---|---|---|
| 非实时 | Qwen3-TTS 闪存 | $0.10 |
| 非实时 | 讲师、副教授或教授 | $0.115 |
| 实时 | Flash 或当前 VC | $0.13 |
| 实时 | 指导 | $0.143 |
| 实时 | VD | $0.143353 |
语音创建与语音合成是分开计费的。同一份国际定价表中,Qwen语音注册的费用为每克隆$0.01,语音设计的费用为每设计语音$0.20。克隆或设计的语音身份在使用时,将产生相应的按字符计费的语音合成费用。.
将配音制作、角色合成、基础设施和重新生成分别纳入预算。实际制作成本往往取决于剪辑时间和重复录音的次数。.
API 定价与本地成本并不相同。开放式检查点虽然取消了按字符计费的供应商收费模式,但会增加 GPU 时间、部署工程、监控、存储、扩展以及故障响应等成本。当控制权、业务量、数据本地性或定制化需求足以证明这种运维负担是合理的,自建方案便更具优势。.
替代方案与 GlobalGPT 音频路径
Qwen3-TTS 并非适用于所有音频任务的最佳选择。对于重视精致的控制面板、丰富的生产工具且希望减少基础设施维护的团队而言,ElevenLabs 是一个更成熟的托管语音平台。 OpenAI 语音模型可能更适合那些已将某个 API 生态系统作为标准平台的开发者。Qwen-Audio 3.0 TTS 是 Qwen 系列中较新的托管方案,在遵循阿里云当前建议时,可将其作为参考选项。.
音乐和音效的需求应另作比较。该 ElevenLabs、Lyria 3 Pro 和 Mureka 的音质对比 这有助于将语音合成工具与完整的音乐生成工具区分开来。文本转语音模型不应因无法生成经过母带处理的歌曲而被扣分,而音乐模型也不应被选作低延迟的旁白API。.
GlobalGPT 目前拥有一个经过验证的 音频生成器路径 其中列出了 qwen-audio-3.0-tts-flash 以及 Seed Audio 1.0。所查阅的页面中并未列出 Qwen3-TTS。这使得 GlobalGPT 成为一个实际独立的音频工作区,但并不意味着该处可使用已开放的 Qwen3-TTS 检查点。.
如果您的最终产品是视频,请决定是否需要单独的旁白、生成的对话、音效,还是能配合画面生成声音的模型。我们对 Veo 3.1 是否有声音 该方案体现了这一更广泛的决策思路。最明智的做法往往是采用一组小型专用工具,而不是强行让一个模型承担所有音频任务。.
许可、同意、隐私及商业用途
Qwen3-TTS 代码库及已发布的模型卡均采用 Apache-2.0 许可证。该许可证对商业开发、修改和分发持开放态度,但并不授予他人对他人声音、表演、剧本、商标或个人数据的权利。模型许可证与内容权利属于不同的层面。.
本地推理能让您拥有更大的控制权,同时也承担更多的安全责任。请对参考录音进行加密、限制访问权限、最大限度地缩短保留时间、记录衍生内容,并将删除操作扩展至已注册的语音和缓存的输出结果。.
对于托管合成服务,在发送机密脚本或语音样本之前,请先查阅服务条款,并了解区域数据处理、数据保留及企业管控措施。.
每个面向公众的克隆声音都应明确其所有者、附有同意记录、制定允许使用政策,并设有滥用应对措施。当合成声音可能被合理地误认为真人时,应添加相关披露信息。禁止冒充普通民众和高风险公众人物,并提供举报有害音频的渠道。.
哪些人适合使用 Qwen3-TTS?
哪条路线合适?
管道验证、更紧凑的内存、Base 或 CustomVoice。.
VoiceDesign 与基于 GPU 冗余空间的音质-容量对比。.
当区域、隐私和定价条件都合适时,操作速度更快。.
无需配置的工作室、授权市场或现有供应商支持。.
Qwen3-TTS 适合需要开放权重、部署选项、克隆功能或基于文本描述的角色语音的研究人员、开发者、游戏团队和本地化团队。.
如果您正在验证处理流程、管理有限的内存,或者测试 Base 和 CustomVoice 是否满足产品需求,请从 0.6B 开始。 如果您需要使用 VoiceDesign,或者拥有足够的硬件资源来妥善比较音质和吞吐量,请从 1.7B 开始。如果基础设施是瓶颈,且区域可用性、凭据和数据处理方式符合项目要求,请使用托管 API。.
如果您需要无需任何配置即可使用的编辑工作室、拥有大量授权语音资源的市场,或是其他供应商提供的现有企业级支持,请选择其他方案。未经书面同意,切勿进行克隆。.
使用五个真实脚本、三个重复项、一个名称复杂的列表、一个长段落以及一项恢复测试。测量延迟和开销,然后询问母语听众,结果是否无需修复即可使用。编辑工作可能会使基准测试中的优势化为乌有。.
Qwen3-TTS 常见问题解答
Qwen3-TTS 是免费的吗?
已发布的 Qwen3-TTS 检查点遵循 Apache-2.0 许可协议,因此您可以免费下载并运行它们,无需支付按字符计费的模型费用。 自行部署仍需承担计算、存储、运维和监控成本。阿里云托管的 Qwen3-TTS API 属于付费服务,具体价格和配额因区域而异。.
Qwen3-TTS 能否用于商业用途?
Apache-2.0 许可允许对已发布的代码和模型权重进行商业使用,但并不授予您克隆他人声音或使用受保护的脚本和品牌的权利。商业项目仍需获得发言人的同意、确保内容权利、遵守隐私规定,并符合当地法律及平台条款。.
Qwen3-TTS 支持哪些语言?
已发布的 Qwen3-TTS 版本支持中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语和意大利语。托管模型的语言覆盖范围可能因端点和语音而异,因此在构建多语言产品之前,请确认具体的阿里云模型 ID 和区域。.
Qwen3-TTS 的延迟真的能达到 97 毫秒吗?
Qwen 在经过优化的内部 vLLM 环境中,针对 0.6B 12Hz 型号在并发度为 1 时报告了 97 毫秒的首包延迟。这是供应商提供的一个有效基准测试结果,并非对所有设备的普遍承诺。 冷启动、硬件、精度、网络传输、队列以及客户端缓冲等因素都可能增加实际观测到的延迟。.
Qwen3-TTS 需要多少 VRAM?
对于每种配置,并不存在一个放之四海皆准的VRAM数值。模型规模、精度、注意力后端、批量大小、缓存、参考长度以及框架开销都会产生影响。此次测试的2 GB MX450不适合作为代表性基准测试对象;应以接近生产环境的并发度测试所选检查点,并预留运行余量。.
Qwen3-TTS语音克隆需要多少音频数据?
示例材料展示了从大约三秒钟起即可实现快速克隆,而托管式注册指南则建议使用清晰连贯的连续语音,并允许使用更长的语音样本。请将三秒钟视为能力下限,而非自动的质量目标。请使用已获得授权、无噪音的音频,且该音频应涵盖说话者的正常音域和目标语言。.
Qwen3-TTS API 的输入限制是多少?
当前的 Qwen-TTS API 文档规定,Qwen-TTS 模型的最大输入长度为 512 个令牌。完整音频 URL 的有效期为 24 小时。请在语义分界处将长脚本拆分为多个片段,并将所需输出复制到持久存储中,切勿将返回的 URL 视为永久托管地址。.
我可以在 GlobalGPT 上使用 Qwen3-TTS 吗?
所列出的带复选标记的 GlobalGPT 音频发生器 qwen-audio-3.0-tts-flash 以及 Seed Audio 1.0,而非 Qwen3-TTS。你可以将该路径作为独立的音频工作流使用,但不应将其描述为访问公开的 0.6B 或 1.7B Qwen3-TTS 检查点。.
最终判决
这篇关于 Qwen3-TTS 的评测发现其功能范围异常广泛:开放的 0.6B 和 1.7B 检查点、支持十种语言、预设语音、快速克隆、VoiceDesign、流式架构、宽松的许可协议以及托管 API。.
需要坦诚指出的是,还存在一些限制,这些限制同样重要。在现有的任务环境中并未生成实际的 Qwen3-TTS 音频,且所测试的 2 GB GPU 无法支持具有代表性的本地对比。因此,本文既不给出语音质量评分,也不声称其性能普遍达到 97 毫秒。.
如果您重视模型规模和可控性,请先测试 0.6B 检查点,然后在相同的脚本和硬件环境下将其与 1.7B 进行对比。 如果您更重视快速投入生产,请测试您计划购买的阿里云具体方案,并将其与定位不同的 Qwen-Audio 3.0 语音合成(TTS)产品系列进行对比。请将模型名称、端点、区域、同意记录、延迟以及总编辑成本等信息记录在同一决策表中。.
Qwen3-TTS 值得一试。不要天真地以为仅凭文档就能替你“听”到声音。成功的方案,必须能够经受住你们的命名规则、语言环境、硬件配置、隐私要求以及生产截止日期的考验。.



