Higgs TTS 3 (Boson AI)
对话式语音合成,100+语种,零样本克隆与内联控制
~2.8GB 4-bit许可 需自查任务 语音合成最近核对 2026-07-12
- 格式
- 4-bit
- 文件
- ~2.4GB
- 运行内存
- ~2.8GB–3.6GB
- 运行时
- SGL-OMNI
- 下载
- 103,905
仅 safetensors · 无 pickle 加载风险
快速上手示例
sgl-omni serve --model-path bosonai/higgs-tts-3-4b 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
社区对 Higgs TTS 3 的语音自然度和多语言能力评价积极,认为相比前代和同类开源方案(如 spark-tts)有明显跃升,零样本声音克隆质量出色,且对内容创作者提供免费商用许可颇具吸引力;但本地部署门槛较高,全精度模型需 18-20GB 显存,8GB 显卡即使用量化版本也体验缓慢。
- 零样本声音克隆质量出色,支持从参考音频复刻说话人音色
- 支持 100+ 语言,词错误率(WER)达到个位数水平
- 面向语音对话场景设计,输出自然、有表现力的对话式语音,而非机械朗读
- 量化版本 QT8 质量接近全精度模型,QT4 在合适参数下也表现不错,降低了一定硬件门槛
- 对数字创作者免费商用许可(含盈利内容),仅需注明 Boson AI's Higgs Audio 出处
- 在对比测试中以 75.7% 胜率击败 GPT-4o-mini-tts
- 生成质量大幅超越 spark-tts
- 支持内联控制情感、风格、韵律、停顿和音效
- 全精度模型需 18-20GB 显存,8GB 显卡无法运行完整模式
- 8GB 显卡即使使用量化版本(QT8/QT4)也较慢,需借助 CPU 内存卸载
- 长文本批量生成时可能出现缺词,需用 STT 逐条校验
- 8GB 显卡无法使用声音克隆功能
- 独立评测Higgs TTS 3: Beyond Reading, Toward Real Speech for Voice AI
- 独立评测Higgs Audio v3 TTS on SGLang-Omni - LMSYS Org
- 社区实测Higgs Audio V2: A New Open-Source TTS Model with Voice ...
- 社区实测Higgs Audio v3 TTS 4B. Built for voice chat. Support 100 ...
- 官方/厂商bosonai/higgs-tts-3-4b - Hugging Face
- 转载/仓库GitHub - boson-ai/higgs-audio: Text-audio foundation model from ...
- 转载/仓库This model is amazing but it is quite complex and slow to run on 8gb VRAM GPU. · Issue #117 · boson-ai/higgs-audio · GitHub
可信度下载103k,赞581,SeedTTS/CV3等4项基准WER最低,100+语种
完整规格
下载动量
30天下载 225.1k → 333.2k