模型 / Gepard-1.0 (nineninesix)

Gepard-1.0 (nineninesix)

流式自回归 TTS,面向实时对话与语音代理

作者 nineninesix

~0.3GB 4-bit许可 需自查任务 语音合成最近核对 2026-07-22
格式
4-bit
文件
~0.3GB
运行内存
~0.3GB–0.4GB
运行时
VLLM
下载
1,468

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve nineninesix/gepard-1.0

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Gepard是实时流式自回归TTS,支持语音克隆和低延迟对话,适合语音助手和实时语音合成,有在线Demo可立即体验。
对位
对位 Fish-S2 / Chatterbox / Qwen3-TTS
适合
实时语音代理 / 流式对话与配音
不适合
精确声纹匹配任务

独立证据与社区反馈

2 个独立来源最近验证 2026-07-22

社区对低延迟流式 TTS 能力有认可,但对其语言支持单一、需 GPU 运行、与更大模型集成方式存在疑虑

  • 实时对话场景的低延迟流式语音合成(~50ms 首音延迟,~20x 实时率)
  • 流式生成,文本到达即开始合成音频,无需等待完整句子
  • vLLM 原生支持,可在单卡上支持高并发(256 路并行)
  • 零样本语音克隆(几秒参考音频即可)
  • Apache 2.0 开源
  • 仅支持英语,不支持其他语言(包括德语)
  • 需要 GPU 运行
  • 参数规模小(555M),独立使用时的通用能力(如工具调用)存疑
  • 与更大模型搭配使用的最佳方式尚不明确

可信度Apache 2.0 许可,vLLM 原生支持,公布 Seed-TTS-eval 全部指标

完整规格

规模
555M · 下载 ~0.3GB · 显存最低 ~0.3GB · 推荐 ~0.4GB · 4-bit(估算)
授权
Apache 2.0 (codec: NVIDIA Open Model License) · 需自查
框架
vllm / transformers
语种
英语(美/英) · 西班牙语(墨) · 葡萄牙语(巴西) · 荷兰语
血统
微调自 qwen3_5-full-attn-only-14
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 5.9k → 8.7k

观测时间线