IndexTTS-2
精准时长控制与情感表达的中文零样本TTS
许可 需自查任务 语音合成最近核对 2026-07-22
适合与不适合
- License未明确(unknown),商用需自行评估风险
- 显存需求较高:推荐参数(如80-200)需根据显存调整,4GB可尝试但可能受限
- 英文及跨语言效果论文有报但社区实测稀少,中文外场景效果不保证
- 无原生流式支持,完整生成耗时较长,不适合实时播报
独立证据与社区反馈
社区普遍认可其情感控制与语音克隆能力突出,但精准时长控制实际未兑现,目前仅适合非商用场景。
- 零样本语音克隆:提供一段任意语言的音频即可高精度还原说话人风格与节奏
- 情感控制:支持文本描述、情绪向量或音频参考等多种方式调节合成语音的情感表达
- 本地部署:完全开放权重,可离线运行
- 宣传的精确时长控制功能实际未支持,与此前宣传不符
- 仅支持英文和中文输出,覆盖语种有限
- 目前仅限非商业用途免费,商业使用需单独授权
- 社区实测IndexTTS2, the most realistic and expressive text-to-speech model so far, has leaked their demos ahead of the official launch! And... wow!
- 社区实测🌈 The new IndexTTS-2 model is now supported on TTS Audio Suite v4.9 with Advanced Emotion Control - ComfyUI
- 社区实测I quite like IndexTTS2 personally, it does voice cloning and also lets you modul... | Hacker News
- 独立评测IndexTTS2 Comprehensive Review: In-Depth Analysis of 2025's Most Powerful Emotional Speech Synthesis Model - DEV Community
可信度由Bilibili团队开发,附论文(arXiv 2506.21619)、GitHub及HuggingFace/ModelScope开源,社区已有本地运行案例。
完整规格
下载动量
30天下载 15.5k → 15.2k · likes +20