模型 / NAVA (Baidu)

NAVA (Baidu)

6.3B 文本生成同步音视频,支持多说话人音色控制

作者 ernie-research

~3.8GB 4-bit许可 可商用任务 视频生成最近核对 2026-06-02
格式
4-bit
文件
~3.3GB
运行内存
~3.8GB–4.9GB
运行时
diffusers
下载
104

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
有详细使用示例和评测,需手动下载数十GB权重并配置8卡环境。
对位
对位 Ovi 1.1、MOVA、Davinci、LTX 2.3 等
适合
文本/图片生成 720p 同步音视频 / 多说话人音色控制配音视频
不适合
长于 10 秒视频或非中英文输入

完整规格

规模
6.3B · 文本 512 tokens · 最大 10 秒视频 · 下载 ~3.3GB · 显存最低 ~3.8GB · 推荐 ~4.9GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
diffusers / torchrun
视频
文生 · 720p · 10s · 推荐 8 卡 Ulysses 并行
血统
微调自 Wan2.2-TI2V-5B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 208 → 105 · likes +3

观测时间线

模型家族

查看全部家族 →