🎙️multimodalart / scenema-audio
零样本表现力语音克隆与生成,支持情感、语速和呼吸控制,基于音频扩散 Transformer,需下载约 38GB 模型权重。
休眠 状态观测于 2026-09-17
用途与交互
- 用途
- 音频·语音·音乐
- 输入
- 文本 · 音频
- 输出
- 音频
空间 / multimodalart / scenema-audio
零样本表现力语音克隆与生成,支持情感、语速和呼吸控制,基于音频扩散 Transformer,需下载约 38GB 模型权重。
休眠 状态观测于 2026-09-17
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索