OmniVoice (k2-fsa)
为开发者提供600+语言零样本语音合成
仓库标识k2-fsa/OmniVoice
显存未知许可 可商用任务 语音合成最近核对 2026-08-09
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
适合与不适合
独立证据与社区反馈
OmniVoice 被多数社区用户视为当前最佳开源多语言 TTS,说话人相似度与多语言准确率在基准测试中超越 ElevenLabs,延迟低至 300-450ms,且可完全本地运行;但部分用户反馈特定输入下存在误读和停顿问题。
- 覆盖 600+ 语言,单模型支持多语言 TTS
- 零样本声音克隆,仅需 3 秒参考音频即可复刻说话人音色
- 完全本地/自托管运行,数据不出服务器
- 低延迟实时合成,TTFT 可达 300–450ms
- Apache 2.0 开源许可,商业使用友好
- 说话人相似度 SIM-o 0.830,显著高于 ElevenLabs 的 0.655
- 多语言基准错误率 2.85%,远低于 ElevenLabs 的 10.95%
- 实时因子 RTF 低至 0.025,合成速度远超实时播放
- 支持 FlashInfer 和 CUDA Graph 加速推理,优化批处理与单流延迟
- 部分场景下跳过或误读基础词汇,逗号后出现无法通过编辑修复的卡顿停顿
- 有用户反馈音色克隆效果“像模仿”,VibeVoice 在某些情况下更自然
- 降低 num_step 可提速但输出质量随之下降,需权衡速度与质量
- 纯 CPU 推理性能受限,最佳体验依赖 GPU 加速
- 社区实测Whats the best open source/free TTS
- 社区实测ComfyUI-OmniVoice-TTS
- 社区实测OmniVoice Audio Studio
- 社区实测[deleted by user] : r/LocalLLaMA
- 独立评测OmniVoice Review: We Tested the ElevenLabs Rival | TECHSY
- 独立评测Meet OmniVoice Studio: A Local, Open-Source Alternative to ElevenLabs - MarkTechPost
- 社区实测I know this isn't technically an LLM but OmniVoice is FUCKING AMAZING.
- 社区实测What's top dog for voice cloning?
- 独立评测OmniVoice: Free AI Voice Generator & Voice Cloning
- 基准/排行OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models
- 独立评测OmniVoice - Comparateur-IA
- 独立评测Xiaomi OmniVoice open-source TTS model for over 600 languages, outperforms ElevenLabs in Chinese accuracy? | HM.AI
- 独立评测Benchmarking OmniVoice on Strix Halo | Sleeping Robots
- 官方/厂商GitHub - k2-fsa/OmniVoice: High-Quality Voice Cloning TTS for 600+ Languages · GitHub
可信度下载量超 208 万,论文 arXiv:2604.00688,910 点赞
完整规格
在线体验
观测时间线
模型家族
- Qwen3-0.6B
- 微调 OmniVoice (k2-fsa)
- 微调 S1-mini (Superwhisper)
- 量化 hamo-score-0.6b (HamoAI)