模型 / IndexTTS-2

IndexTTS-2

精准时长控制与情感表达的中文零样本TTS

作者 IndexTeam

许可 需自查任务 语音合成最近核对 2026-07-22

适合与不适合

对位
相比其他中文TTS,在情感自然度和时长控制上优势明显,但英文/跨语言实测覆盖不足。
适合
视频配音与对口型(时长精确可控) / 有声书/播客的情感化生成 / 需要中文情感零样本克隆的创作场景
不适合
对延迟敏感的实时流式交互(如实时对话助手)或主要面向英文的场景。
  • License未明确(unknown),商用需自行评估风险
  • 显存需求较高:推荐参数(如80-200)需根据显存调整,4GB可尝试但可能受限
  • 英文及跨语言效果论文有报但社区实测稀少,中文外场景效果不保证
  • 无原生流式支持,完整生成耗时较长,不适合实时播报

独立证据与社区反馈

4 个独立来源最近验证 2026-07-22

社区普遍认可其情感控制与语音克隆能力突出,但精准时长控制实际未兑现,目前仅适合非商用场景。

  • 零样本语音克隆:提供一段任意语言的音频即可高精度还原说话人风格与节奏
  • 情感控制:支持文本描述、情绪向量或音频参考等多种方式调节合成语音的情感表达
  • 本地部署:完全开放权重,可离线运行
  • 宣传的精确时长控制功能实际未支持,与此前宣传不符
  • 仅支持英文和中文输出,覆盖语种有限
  • 目前仅限非商业用途免费,商业使用需单独授权

可信度由Bilibili团队开发,附论文(arXiv 2506.21619)、GitHub及HuggingFace/ModelScope开源,社区已有本地运行案例。

完整规格

商用
需自查
访问提示
标记为魔搭可用,具体仓库请自行核对

下载动量

30天下载 15.5k → 15.2k · likes +20

观测时间线