模型 / Irodori-TTS-500M-v3 (Aratako)

Irodori-TTS-500M-v3 (Aratako)

日语TTS,表情符号控制风格,零样本克隆

作者 Aratako

~0.3GB 4-bit许可 可商用任务 语音合成最近核对 2026-06-21
格式
4-bit
文件
~0.3GB
运行内存
~0.3GB–0.4GB
运行时
pytorch

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
有HF Space可试用;v3为同系列升级有改进。
对位
对标 Echo-TTS 及日语 TTS 方案
适合
零样本日语语音克隆 / 表情符号驱动风格与音效控制
不适合
非日语文本或需精确汉字阅读

独立证据与社区反馈

2 个独立来源 · 另 2 官方/转载最近验证 2026-06-21

日文 TTS 基础模型,emoji 风格控制是最大差异化功能,社区围绕它做了 OpenAI 兼容服务和轻量微调方案。

  • 通过 emoji 控制日文语音的情感与风格(如😭带哭腔)
  • 提供了比 LoRA 更轻量的说话人嵌入训练方法(Speaker Inversion)
  • OpenAI TTS API 兼容服务器,方便接入现有工具链
  • 使用 whisper 音频做参考时,因 emoji 标注的 conditioning 方式可能导致参考音复现度偏低
  • 实际推理需要 CUDA 或 ROCm GPU,纯 CPU 不实用

可信度67 赞,基于 Echo-TTS 架构,500M 参数,集成 SilentCipher 水印

完整规格

规模
500M · 下载 ~0.3GB · 显存最低 ~0.3GB · 推荐 ~0.4GB · 4-bit(估算)
授权
MIT · 可商用
框架
pytorch
血统
微调自 Irodori-TTS-500M-v2
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 0 → 0 · likes +7

观测时间线