模型 / speaker-diarization-3.1 (pyannote)

speaker-diarization-3.1 (pyannote)

多说话人分割模型,从音频中区分谁在何时说话

作者 pyannote

仓库标识pyannote/speaker-diarization-3.1

许可 可商用任务 语音识别最近核对 2026-08-09
运行时
pyannote.audio
下载
10,040,330

Hugging Face 源仓库 ↗

适合与不适合

入选理由
可通过HuggingFace pipeline一行代码跑通说话人分离。
对位
对位 NeMo Speaker Diarization,替代 pyannote 2.x
适合
会议转录说话人分离 / 多角色电话录音分割
不适合
低资源实时流式处理

独立证据与社区反馈

11 个独立来源 · 另 1 官方/转载最近验证 2026-08-09

Pyannote 3.1 是当前开源说话人分离的事实标准,在标准基准上 DER 约 11-19%,精度与易用性平衡最好,社区支持广泛;但 CPU 推理极慢,GPU 依赖强,且已出现 community-1、DiariZen 等精度更高的开源替代方案。

  • 成为开源说话人分离的标准工具,社区讨论和集成最广泛
  • 标准基准上 DER 约 11-19%,精度与实现难度平衡最好
  • 在学术基准测试中以 11.2% DER 达到最佳性能
  • 管道已在大量跨域数据集上完成了基准测试验证
  • 提供高水平的分离性能和说话人归属结果
  • 神经分割模型针对 GPU 推理进行了高度优化
  • 有 SaaS/on-prem 版本,速度提升至少 2 倍、效果提升约 20%
  • CPU 上推理极慢,处理单次通话耗时很长,MacBook 风扇狂转
  • CPU 运行时的负载比替代方案 diarize 高约 3 倍
  • 在高品质、非重叠的音频样本中仍无法正确检测不同说话人
  • 有用户反馈 pyannote 准确度不够,转而使用付费方案
  • community-1 在所有关键指标上均已显著超越 3.1
  • 实时说话人分离场景中表现不理想,社区仍在寻找替代方案
  • 主要错误来源于漏检语音片段,其次是说话人混淆

可信度HuggingFace 下载超 1000 万次,1946 赞

完整规格

规模
不适用(音频长度可分批)
授权
mit · 可商用
框架
pyannote.audio / HuggingFace Transformers
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 9142.2k → 8467.9k · likes +569

观测时间线