指南 / 语音合成模型 / 可商用

可商用的语音合成模型

共 8 个

Kokoro-82M (hexgrad) 82M 参数轻量 TTS 模型,支持多语言,可本地部署 MOSS-TTS-Local-Transformer-v1.5 (OpenMOSS) 零样本声音克隆多语言TTS模型,支持31种语言和本地部署 Inflect-Nano-v1 (owensong) 超小型英文TTS,总4.63M参数,适合本地/嵌入式实验 ZONOS2 (Zyphra) 基于 MoE 的多语言 TTS,支持零样本克隆与流式生成 Qwen3-TTS-12Hz-1.7B-CustomVoice (Qwen) 指令式多语言TTS,流式延迟低至97ms,9音色 MOSS-TTS-v1.5 (OpenMOSS) 零样本语音克隆多语言TTS模型,支持31种语言及显式暂停控制。 Irodori-TTS-500M-v3 (Aratako) 日语TTS,表情符号控制风格,零样本克隆 OmniVoice (k2-fsa) 为开发者提供600+语言零样本语音合成