Qwen3-TTS-12Hz-1.7B-CustomVoice (Qwen)
指令式多语言TTS,流式延迟低至97ms,9音色
仓库标识Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
显存未知许可 可商用任务 语音合成最近核对 2026-08-05
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
适合与不适合
独立证据与社区反馈
社区普遍认为 Qwen3-TTS-1.7B 是当前最好的开源语音克隆模型之一,1.7B 版本对参考音频中的背景噪声更具鲁棒性,音色还原度高,多语言自然度明显优于同类方案;但开启 FlashAttention 前推理速度极慢,且合成语音普遍偏快。
- 高保真语音克隆,仅需约 3 秒参考音频即可复刻目标说话人音色
- 多语言语音合成在非英语语种上不再有机械感,质量显著提升
- 通过自然语言指令对目标音色进行风格控制
- 基于文本描述自由设计/创建自定义语音
- 1.7B 模型相较 0.6B 版本能更好地忽略参考音频中的轻微背景噪声,不会将噪声注入生成结果
- 完全本地部署,无需依赖云服务即可完成语音克隆与设计
- 支持全量微调
- 低延迟流式音频生成
- 在未启用 FlashAttention 的情况下推理极慢,RTX 5090 上仅 0.3 倍实时速度,GPU 占用率仅 30%
- 合成语音语速普遍偏快,无论参考语音如何,听起来都很急促
- 语音克隆效果与原始音频存在可感知差异
- Voice Design 模式的输出质量不适合用作训练数据
- 独立评测Qwen3-TTS Family is Now Open Sourced: Voice Design, ...
- 社区实测Qwen3-TTS family is now open sourced: Voice design ...
- 独立评测Qwen3-TTS: The ElevenLabs Killer?
- 社区实测Qwen3-TTS, a series of powerful speech generation capabilities : r/StableDiffusion
- 独立评测Qwen3-TTS: The Complete 2026 Guide to Open-Source ...
- 社区实测VoiceDesign, CustomVoice, and Base, 5 models (0.6B & 1.8B), Support for 10 languages : r/LocalLLaMA
- 官方/厂商Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice · Hugging Face
可信度HF下载182万,点赞1.5k,vLLM-Omni day-0支持,含多项基准数据
完整规格
下载动量
30天下载 2592.4k → 2609.7k · likes +77