指南 / 语音合成模型
语音合成模型
共 25 个 · 数据更新于 2026-09-12
中文 TTS 开源模型怎么选
面向要在本地合成中文语音的人:按语言、授权、运行资料是否齐全挑重点;不评音质,没跑过的不承诺。
- 指令控制、预置音色、可商用 Qwen3-TTS-12Hz-1.7B-CustomVoice (Qwen)
- 多语种、对话式表现力;研究/非商业许可 Higgs TTS 3 (Boson AI)
- 小体积、多语种、可商用;中文未单列,纯 CPU 受限 OmniVoice (k2-fsa)
- 整段生成、零样本克隆、可商用;不支持流式 MOSS-TTS-v1.5 (OpenMOSS)
优先看
以下是编辑复核后的起点,完整候选仍见下表。
中文语音合成
- IndexTTS-2
精准时长控制与情感表达的中文零样本TTS
- 中文支持经人工复核确认
- 有可直接运行的部署命令
- 有社区实测记录
当前运行配置
tencent/AuK- 显存
- 暂无估算
查看详情查看运行方式
python -m sglang_omni.cli serve --model-path tencent/AuK- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 语言
- 未公开
- 国内可达
- 魔搭可用
当前运行配置
BreezeBlue/Breeze-TTS-2- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- 研究/非商业许可;代码 Apache-2.0
- 语言
- 英文 / 中文
- 国内可达
- 需代理
当前运行配置
Audio8/Audio8-TTS-Preview-0.1b- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Audio8 Community License v1.0
- 上下文
- 2048
- 语言
- 中文(主) · 英文(主) · 德 / 西 / 法 / 意 / 日 / 韩
- 国内可达
- 需代理
当前运行配置
IndexTeam/IndexTTS-2.5- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- bilibili-model-license
- 语言
- 中文 / 英文 / 日语 / 西班牙语 / 阿拉伯语
- 国内可达
- 魔搭可用
当前运行配置
fishaudio/s2-pro- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- fish-audio-research-license
- 语言
- 日 / 英 / 中 (主) · 韩 / 西 / 葡 / 阿 / 俄 / 法 / 德等80+语言
- 国内可达
- 需代理
当前运行配置
Audio8/Audio8-TTS-Preview-0.6b- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 2048
- 语言
- 粤语 / 中文 / 荷兰语 / 英语 / 法语 / 德语 / 意大利语 / 日语 / 韩语 / 波兰语 / 西班牙语
- 国内可达
- 需代理
当前运行配置
Nanthasit/sakthai-tts-model- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT (包装) / Apache 2.0 (Kokoro)
- 上下文
- 不适用
- 语言
- 英/日/中/韩/法/西/葡/意/德/波/俄/阿/印/孟/泰
- 国内可达
- 需代理
当前运行配置
owensong/Inflect-Nano-v2- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 不适用
- 语言
- 英文
- 国内可达
- 需代理
当前运行配置
owensong/Inflect-Micro-v2- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 无限制(标点分块)
- 语言
- 英文
- 国内可达
- 需代理
当前运行配置
nineninesix/gepard-1.0- 显存
- 暂无估算
查看详情查看运行方式
vllm serve nineninesix/gepard-1.0- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0 (codec: NVIDIA Open Model License)
- 语言
- 英语(美/英) · 西班牙语(墨) · 葡萄牙语(巴西) · 荷兰语
- 国内可达
- 需代理
当前运行配置
hexgrad/Kokoro-82M- 显存
- 暂无估算
查看详情查看运行方式
pip install kokoro && python -c "from kokoro import KPipeline; KPipeline('a'); print('Kokoro loaded')"- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 语言
- 8 种语言
- 国内可达
- 需代理
当前运行配置
OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5- 显存
- 暂无估算
当前运行配置
owensong/Inflect-Nano-v1- 显存
- 暂无估算
当前运行配置
IndexTeam/IndexTTS-2- 显存
- 暂无估算
查看详情查看运行方式
暂无已验证的一键部署命令,需参考官方GitHub仓库(https://github.com/index-tts/index-tts)手动安装- 为何暂无估算
- 缺少可用的显存依据
- 国内可达
- 魔搭可用
当前运行配置
Zyphra/ZONOS2- 显存
- 暂无估算
查看详情查看运行方式
git clone https://github.com/Zyphra/ZONOS2 && cd ZONOS2 && uv sync && uv run python -m minisgl --model-path Zyphra/ZONOS2 --tts-default-voices-dir ./default_voices/(需 NVIDIA GPU, Linux)- 为何暂无估算
- 缺少可用的显存依据
- 许可证
- apache-2.0
- 语言
- 英语(主)·中文(主)·日语(主) · 韩/俄/意/葡/法/西/越/德/希伯来/荷兰/瑞典等 32 语种
- 国内可达
- 需代理
当前运行配置
Aratako/Irodori-TTS-500M-v3- 显存
- 暂无估算
查看详情查看运行方式
git clone https://github.com/Aratako/Irodori-TTS- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
Dramabox (ResembleAI)
微调自 LTX-2.3
通用文本转语音,面向配音与有声内容制作者
当前运行配置
k2-fsa/OmniVoice- 显存
- 暂无估算
查看详情查看运行方式
pip install omnivoice- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 不适用
- 国内可达
- 需代理
当前运行配置
Supertone/supertonic-3- 显存
- 暂无估算
查看详情查看运行方式
pip install supertonic- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- OpenRAIL-M
- 国内可达
- 需代理
TTS 模型,面向语音合成开发者
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- 当前为预览版(Preview)检查点,语言覆盖和方言支持有限 —— Audio8/Audio8-TTS-Preview-0.6b
- 参考音频过长、嘈杂或转录不准会降低合成稳定性和说话人相似度 —— Audio8/Audio8-TTS-Preview-0.6b
- 需trust_remote_code=True加载,存在自定义代码安全审计需求 —— Audio8/Audio8-TTS-Preview-0.6b
- 目前仅支持英文(英文音素前端) —— owensong/Inflect-Nano-v2
- 当前模型音色单一,多语言和多音色尚在规划中 —— owensong/Inflect-Nano-v2
- 独立开发者项目,后续更新依赖社区反馈和兴趣 —— owensong/Inflect-Nano-v2
- 训练语料生成管线、私有过滤基础设施与完整优化配方未公开,可复现性受限 —— owensong/Inflect-Micro-v2
- 固定单一音色,不可自定义语音 —— owensong/Inflect-Micro-v2
展开其余 50 条
- 产品化集成前需评估局限性,不宜仅凭基准分数做决策 —— owensong/Inflect-Micro-v2
- 以准确性换取速度,流式生成可能牺牲文本准确度 —— nineninesix/gepard-1.0
- 训练数据主要来自 OpenAI 和 ElevenLabs 的合成输出,存在潜在版权与许可风险 —— hexgrad/Kokoro-82M
- 对长叙事文本表现优于日常对话,对话场景下自然度可能不足 —— hexgrad/Kokoro-82M
- 需要 espeak 作为系统依赖处理 OOD 回退及部分非英语语言,增加部署复杂度 —— hexgrad/Kokoro-82M
- 最快的推理配置不一定是最佳音质,需在速度与质量之间权衡 —— hexgrad/Kokoro-82M
- 现有托管 API 服务较少,不易找到现成的云端调用方案 —— hexgrad/Kokoro-82M
- 全精度模型需 18-20GB 显存,8GB 显卡无法运行完整模式 —— bosonai/higgs-tts-3-4b
- 8GB 显卡即使使用量化版本(QT8/QT4)也较慢,需借助 CPU 内存卸载 —— bosonai/higgs-tts-3-4b
- 长文本批量生成时可能出现缺词,需用 STT 逐条校验 —— bosonai/higgs-tts-3-4b
- 8GB 显卡无法使用声音克隆功能 —— bosonai/higgs-tts-3-4b
- 生产级服务化部署难度较高,涉及多阶段推理链路 —— OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5
- 生成质量不及 VibeVoice Large —— OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.5
- 音质机械、有金属感,韵律平淡,不适合沉浸式听感 —— owensong/Inflect-Nano-v1
- 输出长度限制在约 15 秒 —— owensong/Inflect-Nano-v1
- 仅支持单一英语男声,无多说话人、无声音克隆、无流式输出 —— owensong/Inflect-Nano-v1
- 对长文本、罕见词、数字缩写等鲁棒性不足,独立合成片段拼接时连贯性差 —— owensong/Inflect-Nano-v1
- License未明确(unknown),商用需自行评估风险 —— IndexTeam/IndexTTS-2
- 显存需求较高:推荐参数(如80-200)需根据显存调整,4GB可尝试但可能受限 —— IndexTeam/IndexTTS-2
- 英文及跨语言效果论文有报但社区实测稀少,中文外场景效果不保证 —— IndexTeam/IndexTTS-2
- 无原生流式支持,完整生成耗时较长,不适合实时播报 —— IndexTeam/IndexTTS-2
- 采用 Flow Matching,不支持流式输出 —— IndexTeam/IndexTTS-2
- 音频中容易出现伪影,部分用户反馈反复调整仍无法获得自然输出,不如 Higgs Audio 效果好 —— IndexTeam/IndexTTS-2
- 官方宣传的精确音频时长控制功能实际并未支持,令用户失望 —— IndexTeam/IndexTTS-2
- 在 ComfyUI 的 TTS Audio Suite 集成中,有用户反馈情感向量节点无法影响音频输入的情感特征 —— IndexTeam/IndexTTS-2
- 安装过程存在兼容性问题,依赖 nvidia-cuda-toolkit —— Zyphra/ZONOS2
- RTX 5090 等新硬件不支持 —— Zyphra/ZONOS2
- 推理速度慢 —— Zyphra/ZONOS2
- 文本开头部分可能丢失 —— Zyphra/ZONOS2
- 仅支持 Ubuntu 22.04 + NVIDIA GPU —— Zyphra/ZONOS2
- 仅限研究和非商业用途,生产/商用/创收需额外获取商业许可 —— bosonai/higgs-audio-v3-tts-4b
- 复杂发音(Complex Pronunciation)主观评测得分仅 25.10%,在对比模型中仍属短板 —— bosonai/higgs-audio-v3-tts-4b
- 需 48 GB 显存级别显卡才能加载,消费级 GPU 可能无法运行 —— bosonai/higgs-audio-v3-tts-4b
- TTS 输出一致性不足,极短文本也会产生幻觉 —— MisoLabs/MisoTTS
- 有用户认为这类规模仍不够稳定,稳定性问题比想象中明显 —— MisoLabs/MisoTTS
- 在未启用 FlashAttention 的情况下推理极慢,RTX 5090 上仅 0.3 倍实时速度,GPU 占用率仅 30% —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
- 合成语音语速普遍偏快,无论参考语音如何,听起来都很急促 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
- 语音克隆效果与原始音频存在可感知差异 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
- Voice Design 模式的输出质量不适合用作训练数据 —— Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
- 8B v1.5 不支持流式输出,必须一次性发送整个音频,实时语音应用里耗时太长、不够快 —— OpenMOSS-Team/MOSS-TTS-v1.5
- 实时场景只能改用更小的 MOSS-TTS-Realtime,8B 版本不适合实时生成 —— OpenMOSS-Team/MOSS-TTS-v1.5
- 新专区的内容全部由 AI 生成,多名用户因此表示要取消订阅、寻找替代品。 —— ResembleAI/Dramabox
- DramaBox 内容在 DramaFren 等约 18 个同类 App 中也有覆盖,独占性存疑。 —— ResembleAI/Dramabox
- 部分场景下跳过或误读基础词汇,逗号后出现无法通过编辑修复的卡顿停顿 —— k2-fsa/OmniVoice
- 有用户反馈音色克隆效果“像模仿”,VibeVoice 在某些情况下更自然 —— k2-fsa/OmniVoice
- 降低 num_step 可提速但输出质量随之下降,需权衡速度与质量 —— k2-fsa/OmniVoice
- 纯 CPU 推理性能受限,最佳体验依赖 GPU 加速 —— k2-fsa/OmniVoice
- N100、Raspberry Pi 5 等低功耗设备的性能表现尚无社区实测数据 —— Supertone/supertonic-3
- Supertone Shift 服务条款中用户内容是否用于产品改进的表述不够明确 —— Supertone/supertonic-3
- 模型权重使用 LTX-2 Community License,非完全开放 —— ScenemaAI/scenema-audio