模型 / Qwen3-TTS-12Hz-1.7B-CustomVoice (Qwen)

Qwen3-TTS-12Hz-1.7B-CustomVoice (Qwen)

指令式多语言TTS,流式延迟低至97ms,9音色

作者 Qwen

仓库标识Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice

显存未知许可 可商用任务 语音合成最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
transformers
下载
1,821,209

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
Qwen3-TTS新增指令控制与低延迟流式生成,通过pip/DashScope即可试用,性能领先。
对位
对位 CosyVoice3、Spark-TTS 等开源指令TTS
适合
低延迟实时语音交互(端到端97ms) / 多语言指令式配音(9音色,10语种)
不适合
需语音克隆的场景(应使用Base模型)

独立证据与社区反馈

6 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

社区普遍认为 Qwen3-TTS-1.7B 是当前最好的开源语音克隆模型之一,1.7B 版本对参考音频中的背景噪声更具鲁棒性,音色还原度高,多语言自然度明显优于同类方案;但开启 FlashAttention 前推理速度极慢,且合成语音普遍偏快。

  • 高保真语音克隆,仅需约 3 秒参考音频即可复刻目标说话人音色
  • 多语言语音合成在非英语语种上不再有机械感,质量显著提升
  • 通过自然语言指令对目标音色进行风格控制
  • 基于文本描述自由设计/创建自定义语音
  • 1.7B 模型相较 0.6B 版本能更好地忽略参考音频中的轻微背景噪声,不会将噪声注入生成结果
  • 完全本地部署,无需依赖云服务即可完成语音克隆与设计
  • 支持全量微调
  • 低延迟流式音频生成
  • 在未启用 FlashAttention 的情况下推理极慢,RTX 5090 上仅 0.3 倍实时速度,GPU 占用率仅 30%
  • 合成语音语速普遍偏快,无论参考语音如何,听起来都很急促
  • 语音克隆效果与原始音频存在可感知差异
  • Voice Design 模式的输出质量不适合用作训练数据

可信度HF下载182万,点赞1.5k,vLLM-Omni day-0支持,含多项基准数据

完整规格

规模
1.7B · 权重格式未知,无法估算显存
授权
Apache-2.0 · 可商用
框架
transformers / vllm-omni
访问提示
标记为魔搭可用,具体仓库请自行核对

下载动量

30天下载 2592.4k → 2609.7k · likes +77

观测时间线