speaker-diarization-3.1 (pyannote)
多说话人分割模型,从音频中区分谁在何时说话
仓库标识pyannote/speaker-diarization-3.1
许可 可商用任务 语音识别最近核对 2026-08-09
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
- 运行时
- pyannote.audio
- 下载
- 10,040,330
适合与不适合
独立证据与社区反馈
Pyannote 3.1 是当前开源说话人分离的事实标准,在标准基准上 DER 约 11-19%,精度与易用性平衡最好,社区支持广泛;但 CPU 推理极慢,GPU 依赖强,且已出现 community-1、DiariZen 等精度更高的开源替代方案。
- 成为开源说话人分离的标准工具,社区讨论和集成最广泛
- 标准基准上 DER 约 11-19%,精度与实现难度平衡最好
- 在学术基准测试中以 11.2% DER 达到最佳性能
- 管道已在大量跨域数据集上完成了基准测试验证
- 提供高水平的分离性能和说话人归属结果
- 神经分割模型针对 GPU 推理进行了高度优化
- 有 SaaS/on-prem 版本,速度提升至少 2 倍、效果提升约 20%
- CPU 上推理极慢,处理单次通话耗时很长,MacBook 风扇狂转
- CPU 运行时的负载比替代方案 diarize 高约 3 倍
- 在高品质、非重叠的音频样本中仍无法正确检测不同说话人
- 有用户反馈 pyannote 准确度不够,转而使用付费方案
- community-1 在所有关键指标上均已显著超越 3.1
- 实时说话人分离场景中表现不理想,社区仍在寻找替代方案
- 主要错误来源于漏检语音片段,其次是说话人混淆
- 社区实测r/LocalLLaMA on Reddit: Looking for diarization model better than Pyannote
- 社区实测r/speechtech on Reddit: I built a CPU-only speaker diarization library: it is ~7× faster than pyannote with comparable DER
- 社区实测Show HN: Diarize – CPU-only speaker diarization, 7x faster than pyannote | Hacker News
- 社区实测r/MachineLearning on Reddit: [D] Struggling with Accurate Speaker Diarization: Need Model/Service Recommendations
- 社区实测r/MachineLearning on Reddit: [D] Anyone used or know any real time speaker diarization model?
- 社区实测r/MachineLearning on Reddit: [D] Speaker diarization models for 3 or more overlapping speakers?
- 独立评测Speaker Diarization DER performance comparison | pyannoteAI Benchmark
- 独立评测Best Speaker Diarization Models Compared [2026]
- 独立评测Community-1: Unleashing open-source diarization - pyannoteAI
- 基准/排行Benchmarking Diarization Models
- 独立评测I Built a Speaker Diarization Library That's 7x Faster Than Pyannote on CPU
- 官方/厂商pyannote/speaker-diarization-3.1 · Hugging Face
可信度HuggingFace 下载超 1000 万次,1946 赞
完整规格
下载动量
30天下载 9142.2k → 8467.9k · likes +569