模型 / NAVA-6.3B (Baidu)

NAVA-6.3B (Baidu)

文本/图像生成音视频同步内容,支持多说话人音色控制

作者 baidu

仓库标识baidu/NAVA

显存未知许可 可商用任务 视频生成最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
torch
下载
159

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
NAVA以6.3B参数实现视频音频联合生成,新架构有亮点,需自行部署(8GPU+数十GB权重)。
对位
对位 Ovi 1.1 / LTX 2.3 等开源音视频模型
适合
文本/图像生成带同步音频的视频 / 多说话人场景指定音色控制
不适合
单 GPU 实时推理或长于 10 秒视频

独立证据与社区反馈

1 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

独立来源不足,尚未形成社区共识:NAVA 被视作统一音视频生成的新品类,将分离的视频与音频 pipeline 整合为端到端联合生成,6.3B 参数规模下音视频同步质量突出

  • 统一音视频同步生成,避免视频与音频 pipeline 分离拼接
  • 可控语音生成,通过 Timbre-in-Context Conditioning 将参考音色绑定到对应语音片段

可信度VerseBench Sync-C 7.79最高,WER 0.099,Apache-2.0

完整规格

规模
6.3B · 文本 512 tokens · 最大 10 秒视频 · 权重格式未知,无法估算显存
授权
Apache-2.0 · 可商用
框架
torch / diffusers
视频
文生 · 1280x704 · 最长10s · 推荐8 GPU
血统
微调自 Wan2.2-TI2V-5B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 103 → 118

观测时间线