模型 / GigaAM-Multilingual (ai-sage)

GigaAM-Multilingual (ai-sage)

70+语言语音识别,关注俄语、哈萨克语等小语种

作者 ai-sage

~0.1GB 4-bit许可 可商用任务 语音识别最近核对 2026-07-22

仅 safetensors · 无 pickle 加载风险

格式
4-bit
文件
~0.1GB
运行内存
~0.1GB–0.2GB
运行时
transformers
下载
2,399

Hugging Face 源仓库 ↗

适合与不适合

入选理由
GigaAM Multilingual 是针对俄语及中亚低资源语音识别的开源模型,在中亚语言上大幅超越 Whisper、Seamless M4T。提供清晰的使用示例,但需本地运行 PyTorch 代码。
对位
对位 Whisper large v3,小语种 ASR 表现更优
适合
俄/哈/吉/乌语等小语种 ASR / 多语言语音转录服务
不适合
英语高精度 ASR

独立证据与社区反馈

1 个独立来源 · 另 1 官方/转载最近验证 2026-07-22

独立来源不足,尚未形成社区共识:社区认为 GigaAM Multilingual 在俄语及中亚语言上效果突出,超过 Whisper Large v3,但英语表现一般。

  • 俄语、哈萨克语、吉尔吉斯语、乌兹别克语语音识别准确率领先
  • 开源可用(MIT 许可),支持 CTC/RNNT 微调、ONNX 导出和 Triton 部署
  • 英语语音识别表现仅为 moderate

可信度在 Common Voice、FLEURS 及内部测试集上,俄/哈/吉/乌语 WER 优于 Whisper large v3

完整规格

规模
220M / 600M · 下载 ~0.1GB · 显存最低 ~0.1GB · 推荐 ~0.2GB · 4-bit(估算)
授权
mit · 可商用
框架
transformers
血统
量化自 GigaAM-Multilingual
访问提示
Hugging Face 可能需要代理

下载动量

观测时间线

模型家族

查看全部家族 →