此页是 2026-09-07 的观测快照,查看该模型当前信息 → /m/microsoft__vibevoice-asr-streaming-7b/

归档 / 2026-09-07 / VibeVoice-ASR-Streaming-7B (Microsoft)

VibeVoice-ASR-Streaming-7B (Microsoft)

流式说话人归属语音转写,支持10语言与热词

入选理由
流式ASR新模型,支持说话人分离与自定义热词,十种语言,有在线demo可即时试用,适合会议纪要等场景。
对位
适合
实时会议多说话人转写 / 含专有名词的流式语音识别
不适合
低显存端侧离线转写
规模
7B · 未知 · Q4 ~5.7GB / FP16 ~21GB
授权
MIT · 需自查
框架
transformers
可信度
HF 下载量 889,点赞 110;模型卡标注 MIT

仅 safetensors · 无 pickle 加载风险

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   5 / 5
总分
11

HuggingFace 原始数据 (抓取于 2026-09-07)

作者
microsoft
任务类型
automatic-speech-recognition
推理库
transformers
下载
889
点赞
110
许可证
MIT
标签
transformers, safetensors, vibevoice, ASR, Transcription, Speech-to-Text, Streaming, automatic-speech-recognition, en, zh, es, pt, de, ja, ko, fr, ru, it, arxiv:2609.02812, license:mit, endpoints_compatible, region:us

探索

源链接