模型 / MisoTTS-8B (MisoLabs)

MisoTTS-8B (MisoLabs)

基于 Sesame CSM 的对话 TTS 模型,支持语音上下文延续

作者 MisoLabs

~4.9GB 4-bit许可 需自查任务 语音合成最近核对 2026-06-19
格式
4-bit
文件
~4.3GB
运行内存
~4.9GB–6.4GB
运行时
pytorch

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
基于Sesame CSM架构的TTS模型,提供推理代码和演示地址。
对位
对位 Sesame CSM 开源实现
适合
高质量对话语音合成 / 从短音频提示生成语音延续
不适合
长篇有声书朗读

独立证据与社区反馈

4 个独立来源最近验证 2026-06-19

社区认可其开源与情感表达能力,但普遍反映合成稳定性不足,短文本也出现幻觉,作为 8B 模型表现低于预期。

  • 开源可用的情感语音合成与对话生成
  • 支持语音克隆能力
  • 短文本也会出现幻觉/乱读,需通过减少大写等方式缓解但无法根除
  • 合成一致性不足,同一段话容易出现偏离
  • 作为 8B 参数模型,实际表现让人觉得训练不充分

可信度Hugging Face 76 点赞,骨干为 Llama-8B 加 Sesame CSM 架构

完整规格

规模
8B · 2048 · 下载 ~4.3GB · 显存最低 ~4.9GB · 推荐 ~6.4GB · 4-bit(估算)
授权
other · 需自查
框架
pytorch
语种
未声明
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 0 → 0 · likes +8

观测时间线