模型 / Nemotron-3.5-ASR-Streaming-0.6B (NVIDIA)

Nemotron-3.5-ASR-Streaming-0.6B (NVIDIA)

覆盖40种语言的流式ASR,600M,可调延迟,面向实时语音代理

作者 nvidia

~0.4GB 4-bit许可 需自查任务 语音识别最近核对 2026-07-22
格式
4-bit
文件
~0.3GB
运行内存
~0.4GB–0.5GB
运行时
nemo
下载
225

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
多语言流式ASR模型,支持40语种和自动语言检测,缓存感知架构,需NeMo环境部署。
对位
替代 Parakeet-RNNT-1.1B 多语言 ASR
适合
低延迟多语种语音转写 / 实时多语言语音代理
不适合
未微调的适配语种直接使用

独立证据与社区反馈

2 个独立来源 · 另 2 官方/转载最近验证 2026-07-22

社区讨论体量极小,模型作为新发布的多语言流式 ASR 引起了一定技术关注,但实际使用反馈有限,多语言覆盖存在明显短板。

  • 支持 40+ 语言的实时流式语音识别,CPU 上可达到 ~1-2x RTF 的低延迟推理
  • OpenMDW 开源许可,降低了商业应用与二次开发的门槛
  • GPU 上推理速度极快 (RTF 0.0066 on RTX 5090)
  • 部分语言转写存在系统性问题,如希腊语 final sigma 被映射为 <unk>,德语场景下表现欠佳
  • 缺少马来亚拉姆语、泰米尔语等文字的 token 支持;印尼语、波斯语等语言尚未覆盖
  • transcribe() 接口存在 bug,社区成员反馈调用失败
  • 英文场景下官方建议使用纯英文版 Nemotron,效果更优
  • 社区反馈体量极小 (Reddit 仅 4 赞 4 评论),缺乏大规模实测验证

可信度225下载, 102赞, FLEURS 英语 WER 7.91%@1.12s 块, NVIDIA 发布

完整规格

规模
600M · 下载 ~0.3GB · 显存最低 ~0.4GB · 推荐 ~0.5GB · 4-bit(估算)
授权
NVIDIA Open Model License · 需自查
框架
nemo / pytorch
访问提示
标记为魔搭可用,具体仓库请自行核对

下载动量

30天下载 315.3k → 590.2k · likes +237

观测时间线