模型 / Mega-ASR (THU)

Mega-ASR (THU)

面向远场、混响、重叠语音等严重声学退化的鲁棒语音识别

作者 zhifeixie

~1GB 4-bit许可 可商用任务 语音识别最近核对 2026-06-19
格式
4-bit
文件
~0.9GB
运行内存
~1GB–1.3GB
运行时
PyTorch

Hugging Face 源仓库 ↗

适合与不适合

入选理由
基于Qwen3-ASR的鲁棒ASR新方案,有论文和代码示例。
对位
对位Whisper等常规ASR在恶劣声学条件下
适合
严重噪声、混响、剪切、限带语音转录 / 远场、重叠语音、低质量录音识别
不适合
安静环境下的高保真转写

独立证据与社区反馈

1 个独立来源最近验证 2026-06-19

独立来源不足,尚未形成社区共识:社区对 Mega-ASR 的实际表现持观望态度,有人指出其演示在理想条件下效果很好,但真实场景的鲁棒性仍有待验证。

  • 演示在完美条件下表现良好,但实际复杂声学环境下的泛化能力存疑

可信度arXiv论文2605.19833,仓库含模型权重、路由器和评估脚本

完整规格

规模
1.7B · 下载 ~0.9GB · 显存最低 ~1GB · 推荐 ~1.3GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
PyTorch / Transformers
血统
微调自 Qwen3-ASR-1.7B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 0 → 0 · likes +8

观测时间线