模型 / MOSS-TTS-v1.5 (OpenMOSS)

MOSS-TTS-v1.5 (OpenMOSS)

零样本语音克隆多语言TTS模型,支持31种语言及显式暂停控制。

作者 OpenMOSS-Team

仓库标识OpenMOSS-Team/MOSS-TTS-v1.5

显存未知许可 可商用任务 语音合成最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
transformers
下载
5,447

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
需自行部署推理代码,示例清晰;相比1.0版本有质量改进和新增语言支持。
对位
对位CosyVoice、FishSpeech等开源TTS
适合
多语种有声内容生成 / 零样本个性化语音克隆
不适合
低延迟实时语音交互场景

独立证据与社区反馈

2 个独立来源最近验证 2026-08-09

MOSS-TTS-v1.5 的 8B 版本在英文语音克隆上口碑突出,社区帖子称其为 2026 年 6 月当前最强;但实测它不支持流式、只能整段生成,实时语音场景延迟过高,得换用更小的 MOSS-TTS-Realtime。

  • 英文语音克隆(voice cloning)——社区帖子称其为当前英文克隆的最强模型
  • 高质量整段语音生成/克隆需求(非实时场景)
  • 8B v1.5 不支持流式输出,必须一次性发送整个音频,实时语音应用里耗时太长、不够快
  • 实时场景只能改用更小的 MOSS-TTS-Realtime,8B 版本不适合实时生成

可信度论文arxiv 2603.18090,ModelScope可访问,支持31种语言零样本克隆。

完整规格

规模
8.5B · 权重格式未知,无法估算显存
授权
Apache-2.0 · 可商用
框架
transformers
访问提示
标记为魔搭可用,具体仓库请自行核对

在线体验

观测时间线