模型 / OmniVoice (k2-fsa)

OmniVoice (k2-fsa)

为开发者提供600+语言零样本语音合成

作者 k2-fsa

~0.4GB 4-bit许可 可商用任务 语音合成最近核对 2026-07-22
格式
4-bit
文件
~0.3GB
运行内存
~0.4GB–0.5GB
运行时
omnivoice
下载
2,087,606

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
有HF Space和Colab可用,pip安装即用;下载量200万+支持600语言,架构为扩散语言模型。
对位
对位 XTTS-v2、Fish Audio
适合
全球多语种语音合成与声音克隆 / 创意声音设计与非语言符号表达
不适合
实时流式对话系统

独立证据与社区反馈

6 个独立来源 · 另 3 官方/转载最近验证 2026-07-22

OmniVoice 被社区普遍视为当前开源 TTS 中语言覆盖最广、零样本语音克隆质量突出的选择,盲评 4.9/5、GPU 上 40 倍实时,免费 Apache 2.0 协议;但一致性和部分场景落后于 Qwen3-TTS,CPU 推理偏慢,Voice Design 稳定性不足。

  • 600+ 语言支持,零样本 TTS 中覆盖面最广
  • 零样本语音克隆,仅需 3 秒参考音频即可复刻音色
  • Apache 2.0 开源协议,无需注册账号即可免费使用
  • GPU 上可达 40 倍实时推理速度
  • Voice Design 功能支持按属性自定义合成音色
  • 基座模型为 Qwen3-0.6B,可在消费级硬件上运行
  • Whisper 自动转写参考音频,无需手动输入参考文本
  • 多语言基准测试词错误率仅 2.85%,盲评得分 4.9/5
  • PyTorch 版本在 CPU 上推理较慢,尚无 ONNX/GGML 版本
  • Qwen3-TTS 的输出在一致性和部分场景下仍优于 OmniVoice
  • Voice Design 功能稳定性不如 Voice Clone
  • Voice Clone 虽稳定但参数调优难度更高
  • HuggingFace 部署未暴露 temperature 等控制参数,影响对比测试
  • 对非语言内容(如语气停顿)更敏感,容易产生不理想输出

可信度下载量超 208 万,论文 arXiv:2604.00688,910 点赞

完整规格

规模
613M · 不适用 · 下载 ~0.3GB · 显存最低 ~0.4GB · 推荐 ~0.5GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
omnivoice
血统
微调自 Qwen3-0.6B
访问提示
Hugging Face 可能需要代理

观测时间线