模型 / MOSS-TTS-v1.5 (OpenMOSS)

MOSS-TTS-v1.5 (OpenMOSS)

零样本语音克隆多语言TTS模型,支持31种语言及显式暂停控制。

作者 OpenMOSS-Team

~5.1GB 4-bit许可 可商用任务 语音合成最近核对 2026-07-19
格式
4-bit
文件
~4.4GB
运行内存
~5.1GB–6.6GB
运行时
transformers
下载
5,447

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
需自行部署推理代码,示例清晰;相比1.0版本有质量改进和新增语言支持。
对位
对位CosyVoice、FishSpeech等开源TTS
适合
多语种有声内容生成 / 零样本个性化语音克隆
不适合
低延迟实时语音交互场景

独立证据与社区反馈

3 个独立来源 · 另 1 官方/转载最近验证 2026-07-19

MOSS-TTS-v1.5 被社区视为当前开源语音克隆的领先方案,综合表现优于 Fish Audio S2 Pro 和 Qwen 3 TTS

  • 开源可商用的语音克隆(对比 Fish Audio 不可商用)
  • 多语言合成能力(支持31种语言,含粤语、泰语等新增语言)
  • 多推理后端支持(SGLang-Omni 和 vLLM-Omni 均已适配)
  • 长参考音频场景下的稳定语音克隆
  • 不指定语言标签时,部分语言质量可能相比 1.0 版本回退
  • 生成质量对部署配置敏感,需调优才能达到最佳效果

可信度论文arxiv 2603.18090,ModelScope可访问,支持31种语言零样本克隆。

完整规格

规模
8.5B · 下载 ~4.4GB · 显存最低 ~5.1GB · 推荐 ~6.6GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
transformers
访问提示
标记为魔搭可用,具体仓库请自行核对

观测时间线