模型 / MOSS-TTS-Local-Transformer-v1.5 (OpenMOSS)

MOSS-TTS-Local-Transformer-v1.5 (OpenMOSS)

零样本声音克隆多语言TTS模型,支持31种语言和本地部署

作者 OpenMOSS-Team

~2.7GB 4-bit许可 可商用任务 语音合成最近核对 2026-06-28
格式
4-bit
文件
~2.4GB
运行内存
~2.7GB–3.5GB
运行时
transformers
下载
5,655

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
MOSS-TTS v1.5 支持31种语言零样本声音克隆、立体声48kHz输出,可通过SGLang兼容OpenAI API或HuggingFace快速部署,适合多语言TTS与克隆场景。
对位
对位 CosyVoice 2
适合
零样本多语言语音克隆 / 长文本合成与精确停顿控制
不适合
实时流式低延迟场景

独立证据与社区反馈

3 个独立来源最近验证 2026-06-28

社区普遍认可其语音克隆质量,但参考代码推理速度偏慢(RTF ~2),部署复杂度较高。

  • 零样本语音克隆效果出色,有用户明确表示偏好其克隆质量超过 fish audio s2 pro
  • 支持 31 种语言的多语种合成,指定语言标签后质量提升明显
  • 参考 Python 推理代码速度仅 RTF ~2(约 50% 实时),本地实时使用有压力
  • 服务化部署复杂,需处理参考音频编码、自回归生成、多码本采样与有状态解码器等多阶段流水线

可信度HuggingFace 5655 下载,47 赞,Apache-2.0,arXiv 2603.18090

完整规格

规模
4.6B · 下载 ~2.4GB · 显存最低 ~2.7GB · 推荐 ~3.5GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
transformers / sglang
语种
31种语言 (含中·粤·英·日·韩·法·德·西等)
访问提示
标记为魔搭可用,具体仓库请自行核对

下载动量

30天下载 50.1k → 60.1k · likes +12

观测时间线