模型 / NAVA-6.3B (Baidu)

NAVA-6.3B (Baidu)

文本/图像生成音视频同步内容,支持多说话人音色控制

作者 baidu

~3.8GB 4-bit许可 可商用任务 视频生成最近核对 2026-06-28
格式
4-bit
文件
~3.3GB
运行内存
~3.8GB–4.9GB
运行时
torch
下载
159

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
NAVA以6.3B参数实现视频音频联合生成,新架构有亮点,需自行部署(8GPU+数十GB权重)。
对位
对位 Ovi 1.1 / LTX 2.3 等开源音视频模型
适合
文本/图像生成带同步音频的视频 / 多说话人场景指定音色控制
不适合
单 GPU 实时推理或长于 10 秒视频

独立证据与社区反馈

1 个独立来源 · 另 1 官方/转载最近验证 2026-06-28

独立来源不足,尚未形成社区共识:官方宣称音画同步达到同类最佳,但社区实际讨论极少,尚难形成口碑共识

  • 联合音视频生成:单一 6.3B 模型同时输出视频与音频(来源 1)
  • Apache 2.0 全栈开源:提供推理/训练代码与 Gradio 演示(来源 1、2)
  • 峰值显存需求 80 GB,消费级显卡无法运行(来源 1)
  • 推理前必须用内置 rewriter 将简短描述改写为长段落分镜提示词,否则效果不佳(来源 1)

可信度VerseBench Sync-C 7.79最高,WER 0.099,Apache-2.0

完整规格

规模
6.3B · 下载 ~3.3GB · 显存最低 ~3.8GB · 推荐 ~4.9GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
torch / diffusers
视频
文生 · 1280x704 · 最长10s · 推荐8 GPU
血统
微调自 Wan2.2-TI2V-5B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 208 → 105 · likes +3

观测时间线

模型家族

  • Wan2.2-TI2V-5B

查看全部家族 →