模型 / Higgs-Audio-v3-TTS-4B (Boson AI)

Higgs-Audio-v3-TTS-4B (Boson AI)

语音对话TTS:100+语种、零样克隆、情感/风格内联控制

作者 bosonai

~2.8GB 4-bit许可 需自查任务 语音合成最近核对 2026-07-22
格式
4-bit
文件
~2.4GB
运行内存
~2.8GB–3.6GB
运行时
SGL-OMNI
下载
408

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

sgl-omni serve --model-path bosonai/higgs-audio-v3-tts-4b

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Higgs Audio v3 TTS 支持100+语言零样本语音克隆与内联情绪控制,适合研究与非商业用途,需GPU(推荐H100)。
对位
对位 Fish Audio S2 Pro / Qwen3-TTS-1.7B / OmniVoice
适合
语音对话代理与聊天机器人 / 多语种、情感可控的语音生成
不适合
商业用途或未经授权的声音克隆

独立证据与社区反馈

4 个独立来源 · 另 1 官方/转载最近验证 2026-07-22

定位为对话场景而非朗读的 TTS 模型,支持百种语言与零样本声音克隆,社区有开发者为其构建前端工具

  • 支持 100 种以上语言的语音合成
  • 零样本声音克隆,仅需短参考音频即可模仿说话人音色
  • 可对情绪、风格、音效和韵律进行细粒度内联控制
  • 内置对话式语音生成能力,而非单纯朗读文本
  • 将表达性语音、多语言、声音克隆和精细控制整合到单一模型
  • 仅限研究与非商业用途(Boson Higgs Audio v3 Research and Non-Commercial License)
  • 旧版仓库已废弃,文档分散在模型卡与 SGLang 使用指南中

可信度SeedTTS/CV3等4项多语种零样克隆基准WER均最低 (SeedTTS 1.11, CV3 4.41)

完整规格

规模
4B · 8k · 下载 ~2.4GB · 显存最低 ~2.8GB · 推荐 ~3.6GB · 4-bit(估算)
授权
Boson Research & Non-Commercial License · 需自查
框架
sglang-omni / Boson AI API
语种
100+语言,含中、英、日、韩、法、德等83种高质量语种
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 225.1k → 333.2k · likes +139

观测时间线