模型 / XEUS (CMU WAVLab)

XEUS (CMU WAVLab)

覆盖4000+语言的语音基础模型,供ASR/翻译微调

作者 espnet

~0.3GB 4-bit许可 不可商用任务 语音识别最近核对 2026-07-12
格式
4-bit
文件
~0.3GB
运行内存
~0.3GB–0.5GB
运行时
espnet
下载
149

Hugging Face 源仓库 ↗

适合与不适合

入选理由
需ESPnet代码运行,无现成API;仅有自引论文和基准,无社区复现;覆盖4000+语言,新架构SOTA
对位
对位MMS、XLS-R等跨语言语音模型
适合
多语言语音识别微调 / 语音翻译与语音tokenization
不适合
不微调直接用于生产ASR

独立证据与社区反馈

1 个独立来源 · 另 1 官方/转载最近验证 2026-07-12

独立来源不足,尚未形成社区共识:多语言语音预训练模型,HuggingFace 社区关注度中等(约 150 赞),ESPnet 生态用户群体为主要受众

  • 覆盖 4,057 种语言的大规模语音预训练
  • 开源发布检查点,支持 ESPnet 调用
  • 单语 SUPERB 基准上 4 项任务达到 SOTA
  • 核心代码仍在合并进 ESPnet 主仓库,尚未稳定
  • 需下游微调才能用于识别/翻译等具体任务,不可开箱即用

可信度ML-SUPERB超越MMS/XLS-R,577M参数,100万小时预训练

完整规格

规模
577M · 下载 ~0.3GB · 显存最低 ~0.3GB · 推荐 ~0.5GB · 4-bit(估算)
授权
CC BY-NC-SA 4.0 · 不可商用
框架
espnet / pytorch / flash-attn
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 36 → 41

观测时间线