模型 / Higgs TTS 3 (Boson AI)

Higgs TTS 3 (Boson AI)

对话式语音合成,100+语种,零样本克隆与内联控制

作者 bosonai

~2.8GB 4-bit许可 需自查任务 语音合成最近核对 2026-07-12
格式
4-bit
文件
~2.4GB
运行内存
~2.8GB–3.6GB
运行时
SGL-OMNI
下载
103,905

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

sgl-omni serve --model-path bosonai/higgs-tts-3-4b

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Higgs TTS 3是首个支持100+语言、零样本语音克隆和内联情感控制的4B开源TTS,可通过SGLang/vLLM-Omni或API快速部署,适合构建语音代理,但需接受非商业许可证。
对位
对位 Fish Audio S2 Pro、Qwen3-TTS-1.7B
适合
语音代理对话合成 / 零样本多语种声音克隆与情绪控制
不适合
商业化部署与未经授权的语音克隆

独立证据与社区反馈

4 个独立来源 · 另 3 官方/转载最近验证 2026-07-12

社区对 Higgs TTS 3 的语音自然度和多语言能力评价积极,认为相比前代和同类开源方案(如 spark-tts)有明显跃升,零样本声音克隆质量出色,且对内容创作者提供免费商用许可颇具吸引力;但本地部署门槛较高,全精度模型需 18-20GB 显存,8GB 显卡即使用量化版本也体验缓慢。

  • 零样本声音克隆质量出色,支持从参考音频复刻说话人音色
  • 支持 100+ 语言,词错误率(WER)达到个位数水平
  • 面向语音对话场景设计,输出自然、有表现力的对话式语音,而非机械朗读
  • 量化版本 QT8 质量接近全精度模型,QT4 在合适参数下也表现不错,降低了一定硬件门槛
  • 对数字创作者免费商用许可(含盈利内容),仅需注明 Boson AI's Higgs Audio 出处
  • 在对比测试中以 75.7% 胜率击败 GPT-4o-mini-tts
  • 生成质量大幅超越 spark-tts
  • 支持内联控制情感、风格、韵律、停顿和音效
  • 全精度模型需 18-20GB 显存,8GB 显卡无法运行完整模式
  • 8GB 显卡即使使用量化版本(QT8/QT4)也较慢,需借助 CPU 内存卸载
  • 长文本批量生成时可能出现缺词,需用 STT 逐条校验
  • 8GB 显卡无法使用声音克隆功能

可信度下载103k,赞581,SeedTTS/CV3等4项基准WER最低,100+语种

完整规格

规模
4B · 8192 · 下载 ~2.4GB · 显存最低 ~2.8GB · 推荐 ~3.6GB · 4-bit(估算)
授权
boson-higgs-audio-v3-research-and-non-commercial-license · 需自查
框架
vllm-omni / sglang-omni
语种
100+ 语种 (含中/英/日/韩/阿拉伯等85种<5% WER)
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 225.1k → 333.2k

观测时间线