模型 / scenema-audio (ScenemaAI)

scenema-audio (ScenemaAI)

TTS 模型,面向语音合成开发者

作者 ScenemaAI

任务 语音合成最近核对 2026-07-22
运行时
未公开
下载
176

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
需自建Docker无现成API;情感控制与场景感知。
对位
对位 Bark、VITS 等 TTS 方案
适合
文本转语音合成 / AI 语音内容制作
不适合
高并发实时语音服务

独立证据与社区反馈

3 个独立来源 · 另 1 官方/转载最近验证 2026-07-22

开发者自述可实现零样本语音克隆,能分离语音身份与情感表现,但社区独立实测反馈极少。

  • 用数秒参考音频即可克隆语音身份
  • 语音身份与情感表现分离,情感由文本提示驱动
  • 开发者自述 ID-LORA 方案质量很差
  • 模型文件较大(全精度约 9.8GB,INT8 约 4.9GB)
  • 是扩散模型而非传统 TTS 管线,开发者提及存在常见问题但未具体列出

可信度Hugging Face 下载量 176,点赞 65

完整规格

授权
other
框架
未公开
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 65 → 71 · likes +4

观测时间线