MOSS-TTS-v1.5 (OpenMOSS)
零样本语音克隆多语言TTS模型,支持31种语言及显式暂停控制。
仓库标识OpenMOSS-Team/MOSS-TTS-v1.5
显存未知许可 可商用任务 语音合成最近核对 2026-08-09
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
适合与不适合
独立证据与社区反馈
MOSS-TTS-v1.5 的 8B 版本在英文语音克隆上口碑突出,社区帖子称其为 2026 年 6 月当前最强;但实测它不支持流式、只能整段生成,实时语音场景延迟过高,得换用更小的 MOSS-TTS-Realtime。
- 英文语音克隆(voice cloning)——社区帖子称其为当前英文克隆的最强模型
- 高质量整段语音生成/克隆需求(非实时场景)
- 8B v1.5 不支持流式输出,必须一次性发送整个音频,实时语音应用里耗时太长、不够快
- 实时场景只能改用更小的 MOSS-TTS-Realtime,8B 版本不适合实时生成
- 社区实测r/LocalLLaMA on Reddit: Moss tts 1.5 8b Examples. It is the currently best voice cloning model for English as of June 2026
- 社区实测r/LocalLLaMA on Reddit: OpenMOSS-Team/MOSS-TTS-v1.5 · Hugging Face
可信度论文arxiv 2603.18090,ModelScope可访问,支持31种语言零样本克隆。