指南 / 语音识别模型

语音识别模型

共 10 个 · 数据更新于 2026-07-18

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

模型参数量显存门槛上下文许可证商用语言国内可达部署
GigaAM-Multilingual (ai-sage)
量化自 GigaAM-Multilingual
原生 · MLX
220M / 600M~0.1GB 4-bitmit可商用需代理python -c "from transformers import AutoModel; model=AutoModel.from_pretrained('ai-sage/GigaAM-Multilingual', revision='ctc', trust_remote_code=True); print(model.transcribe('example.wav'))"
GigaAM-Multilingual MLX INT8 (ai-babai)
量化自 gigaam-multilingual-mlx
224M~0.2GB 8-bitMIT可商用需代理uvx gigaam-multilingual-mlx gigaam-stt <audio> --variant int8
GigaAM-Multilingual-MLX INT4 (ai-babai)
量化自 gigaam-multilingual-mlx
161M~0.1GB 4-bit不适用MIT可商用需代理uv tool install gigaam-multilingual-mlx==0.2.0 && gigaam-stt audio.wav --variant int4
cohere-transcribe-arabic (CohereLabs) 2.1B~1.2GB 4-bit需自查需代理python -c "from transformers import pipeline; pipe = pipeline('automatic-speech-recognition', 'CohereLabs/cohere-transcribe-arabic-07-2026'); print(pipe('audio.wav'))"
Nemotron-3.5-ASR-Streaming-0.6B (NVIDIA) 600M~0.4GB 4-bitNVIDIA Open Model License需自查魔搭可用nemo_asr.models.ASRModel.from_pretrained('nvidia/nemotron-3.5-asr-streaming-0.6b') 等 2 种
Mega-ASR (THU)
微调自 Qwen3-ASR-1.7B
1.7B~1GB 4-bitapache-2.0可商用需代理from MegaASR.model.megaASR import MegaASR 等 3 种
speaker-diarization-3.1 (pyannote) 不适用(音频长度可分批)mit可商用需代理pip install pyannote.audio && from pyannote.audio import Pipeline; pipeline = Pipeline.from_pretrained('pyannote/speaker-diarization-3.1') 等 3 种
Whisper Large v3 MLX (mlx-community) 1.55B~0.9GB 4-bit30s 音频片段MIT可商用需代理mlx_whisper.transcribe(audio, path_or_hf_repo='mlx-community/whisper-large-v3-mlx') 等 2 种
Whisper-large-v3-turbo (mlx-community) 809M~0.5GB 4-bit30s需代理pip install mlx-whisper && mlx_whisper audio.wav --model mlx-community/whisper-large-v3-turbo
XEUS (CMU WAVLab) 577M~0.3GB 4-bitCC BY-NC-SA 4.0不可商用需代理python -c "from espnet2.tasks.ssl import SSLTask; model, _ = SSLTask.build_model_from_file(None, 'espnet/XEUS/checkpoint.pth', 'cuda')" 等 3 种

常见坑

  • 英语语音识别表现仅为 moderate —— ai-sage/GigaAM-Multilingual
  • 英语识别表现中等(moderate) —— ai-babai/gigaam-multilingual-mlx-int8-g64
  • 英语识别质量中等,WER 显著高于目标语言 —— ai-babai/gigaam-multilingual-mlx-int4-g64
  • 部分语言转写存在系统性问题,如希腊语 final sigma 被映射为 <unk>,德语场景下表现欠佳 —— nvidia/nemotron-3.5-asr-streaming-0.6b
  • 缺少马来亚拉姆语、泰米尔语等文字的 token 支持;印尼语、波斯语等语言尚未覆盖 —— nvidia/nemotron-3.5-asr-streaming-0.6b
  • transcribe() 接口存在 bug,社区成员反馈调用失败 —— nvidia/nemotron-3.5-asr-streaming-0.6b
  • 英文场景下官方建议使用纯英文版 Nemotron,效果更优 —— nvidia/nemotron-3.5-asr-streaming-0.6b
  • 社区反馈体量极小 (Reddit 仅 4 赞 4 评论),缺乏大规模实测验证 —— nvidia/nemotron-3.5-asr-streaming-0.6b
展开其余 14 条
  • 演示在完美条件下表现良好,但实际复杂声学环境下的泛化能力存疑 —— zhifeixie/Mega-ASR
  • 非英语场景表现不佳,有用户反馈「does not work very well」 —— pyannote/speaker-diarization-3.1
  • 说话人识别效果被部分用户评价为「lackluster」 —— pyannote/speaker-diarization-3.1
  • 已被社区版 community-1 大幅超越,后者在所有关键指标上显著优于 3.1 —— pyannote/speaker-diarization-3.1
  • 模型更适配英语,中文等非英语语言效果可能打折扣 —— pyannote/speaker-diarization-3.1
  • 需要 GPU 才能获得较快的推理速度,纯 CPU 场景不理想 —— pyannote/speaker-diarization-3.1
  • 部署配置难度为中等 —— pyannote/speaker-diarization-3.1
  • 短音频存在较高的固定开销,40 秒音频可能耗时超过 22 秒,与 5 分钟音频(约 28 秒)耗时接近 —— mlx-community/whisper-large-v3-mlx
  • 小型号 (如 small) 处理短音频时开销不成比例,选型需注意实际任务场景 —— mlx-community/whisper-large-v3-mlx
  • 准确率仍不及 AssemblyAI 等商业服务 —— mlx-community/whisper-large-v3-turbo
  • MLX 版本在 macOS 上仍比 Turbo 更快 —— mlx-community/whisper-large-v3-turbo
  • v3 系列较 v2 准确率有所下降 —— mlx-community/whisper-large-v3-turbo
  • 核心代码仍在合并进 ESPnet 主仓库,尚未稳定 —— espnet/xeus
  • 需下游微调才能用于识别/翻译等具体任务,不可开箱即用 —— espnet/xeus

收藏本页,或 订阅 RSS 追踪每日更新。