Mega-ASR (THU)
面向远场、混响、重叠语音等严重声学退化的鲁棒语音识别
~1GB 4-bit许可 可商用任务 语音识别最近核对 2026-06-19
- 格式
- 4-bit
- 文件
- ~0.9GB
- 运行内存
- ~1GB–1.3GB
- 运行时
- PyTorch
适合与不适合
独立证据与社区反馈
独立来源不足,尚未形成社区共识:社区对 Mega-ASR 的实际表现持观望态度,有人指出其演示在理想条件下效果很好,但真实场景的鲁棒性仍有待验证。
- 演示在完美条件下表现良好,但实际复杂声学环境下的泛化能力存疑
可信度arXiv论文2605.19833,仓库含模型权重、路由器和评估脚本
完整规格
下载动量
30天下载 0 → 0 · likes +8