Qwen3-TTS-12Hz-1.7B-CustomVoice (Qwen)
指令式多语言TTS,流式延迟低至97ms,9音色
~1.2GB 4-bit许可 可商用任务 语音合成最近核对 2026-06-21
- 格式
- 4-bit
- 文件
- ~1GB
- 运行内存
- ~1.2GB–1.5GB
- 运行时
- transformers
- 下载
- 1,821,209
仅 safetensors · 无 pickle 加载风险
适合与不适合
独立证据与社区反馈
社区普遍认为 Qwen3-TTS 是当前最强的开源语音克隆 TTS 之一,仅需 3 秒参考音频即可生成高度拟人的克隆语音,支持 10 余种语言且可在 CUDA/ROCm/MPS 等多种硬件上本地运行,已被用于替代 ElevenLabs 等付费服务。但推理速度偏慢、GPU 利用率低,部分用户认为其表达力相比 VibeVoice 偏平淡。
- 仅需 3 秒参考音频即可完成语音克隆
- 可在 CUDA、ROCm、MPS 等多种硬件后端上本地运行
- 支持中英日韩德法俄葡西意等 10 种主流语言
- 支持通过自然语言指令进行语音设计
- CustomVoice 提供 9 种覆盖不同性别、年龄、语言和方言的预置音色
- 已被社区用于生产环境生成博客旁白,替代 Google Cloud TTS 和 ElevenLabs
- 社区 fork 实现了实时流式推理,RTF 可超过 1.0
- 已有 ComfyUI 自定义节点集成
- 推理速度偏慢,有用户反馈生成速度低
- GPU 利用率仅约 12%,存在优化空间
- 与 VibeVoice 相比表达力偏平淡/单调
- VoiceDesign 模型设计的语音难以在下一次生成中保留复用
- 社区反馈缺少阿拉伯语、越南语、荷兰语、罗马尼亚语、粤语等语言支持
- 社区 faster 版本在 PyTorch ≤2.5.0 上 CUDA graph 捕获不可靠
- 社区实测Qwen3 TTS 1.7B Best Open Source Voice Cloning Model : r/aicuriosity
- 社区实测VoiceDesign, CustomVoice, and Base, 5 models (0.6B & 1.8B), Support for 10 languages : r/LocalLLaMA
- 社区实测Qwen3-TTS 1.7B vs VibeVoice 7B : r/StableDiffusion
- 独立评测The Real Cost of Running Qwen TTS Locally: Three Machines Compared | TinyComputers.io
- 独立评测Qwen3-TTS Family is Now Open Sourced: Voice Design, Clone, and Generation! - Alibaba Cloud Community
- 独立评测Qwen3-TTS: The ElevenLabs Killer?
- 转载/仓库Qwen3-TTS is an open-source series of TTS models ... - GitHub
- 官方/厂商Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice · Discussions
- 转载/仓库GitHub - andimarafioti/faster-qwen3-tts: Real-time text-to-speech with Qwen3-TTS · GitHub
可信度HF下载182万,点赞1.5k,vLLM-Omni day-0支持,含多项基准数据
完整规格
下载动量
30天下载 2376.6k → 2388.8k · likes +152