指南 / 视频生成模型
视频生成模型
共 7 个 · 数据更新于 2026-07-08
显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。
| 模型 | 参数量 | 显存门槛 | 上下文 | 许可证 | 商用 | 语言 | 国内可达 | 部署 |
|---|---|---|---|---|---|---|---|---|
| LTX-Best-Face-ID (Alissonerdx) LoRA · 基于 LTX-2.3 | 22B (基模型) | ~13GB 4-bit | — | other | 需自查 | — | 需代理 | — |
| JoyAI-Echo (JD) | — | — | — | LTX-2 Community License (研究/非商用) | 需自查 | — | 需代理 | huggingface-cli download google/gemma-3-12b-it --local-dir checkpoints/gemma-3-12b/ && python inference.py 等 3 种 |
| NAVA-6.3B (Baidu) 微调自 Wan2.2-TI2V-5B | 6.3B | ~3.8GB 4-bit | — | Apache-2.0 | 可商用 | — | 需代理 | git clone https://github.com/ernie-research/NAVA && cd NAVA && huggingface-cli download baidu/NAVA --local-dir . 等 2 种 |
| NAVA (Baidu) 微调自 Wan2.2-TI2V-5B | 6.3B | ~3.8GB 4-bit | 文本 512 tokens · 最大 10 秒视频 | apache-2.0 | 可商用 | — | 需代理 | Gradio Web UI: bash gradio_demo/start_gradio.sh 等 2 种 |
| LTX-2.3-Workflows (RuneXX) | — | — | — | — | — | — | 需代理 | git clone https://huggingface.co/RuneXX/LTX-2.3-Workflows |
| LTX2.3-10Eros-GGUF (vantagewithai) 量化自 LTX2.3-10Eros | — | — | — | — | — | — | 需代理 | git clone https://github.com/TenStrip/10S-Comfy-nodes custom_nodes/ |
| Sulphur-2-base (SulphurAI) 量化自 LTX-2.3 原生 · GGUF | 22B | ~13GB 4-bit | — | other | — | — | 需代理 | diffusers.from_pretrained('SulphurAI/Sulphur-2-base') 等 2 种 |
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- 模型仅在近照人脸裁剪上训练,未见过人物实际衣着或身体,衣着和身体部分依赖模型猜测 —— Alissonerdx/LTX-Best-Face-ID
- 模型体积 46GB,本地部署显存门槛高 —— jdopensource/JoyAI-Echo
- 需使用独立推理仓库,尚未原生集成到 diffusers 等主流框架 —— jdopensource/JoyAI-Echo
- 基于 LTX-2 Community License,商用需注意许可证条款 —— jdopensource/JoyAI-Echo
- 峰值显存需求 80 GB,消费级显卡无法运行(来源 1) —— baidu/NAVA
- 推理前必须用内置 rewriter 将简短描述改写为长段落分镜提示词,否则效果不佳(来源 1) —— baidu/NAVA
- 工作流中使用 lcm 采样器,与官方推荐的 euler(首阶段)/ gradient_estimation(次阶段)不同,可能影响输出质量 —— RuneXX/LTX-2.3-Workflows
- 文本生视频提示词遵循度差,无法用于专业工作流 —— vantagewithai/LTX2.3-10Eros-GGUF
展开其余 7 条
- 存在严重过拟合问题,生成内容中会反复出现训练数据中的 Logo(如 TED、Washington Post 等) —— vantagewithai/LTX2.3-10Eros-GGUF
- 图像生视频功能基本不可用,LoRA 训练效果差,角色一致性无法保证 —— vantagewithai/LTX2.3-10Eros-GGUF
- ComfyUI 本地版效果不如桌面端/API 版本,存在 API 付费墙功能差异的嫌疑 —— vantagewithai/LTX2.3-10Eros-GGUF
- 512×512 分辨率单次生成需 5-8 分钟,生成速度较慢 —— SulphurAI/Sulphur-2-base
- 无审查机制导致内容安全风险,模型被指存在滥用隐患 —— SulphurAI/Sulphur-2-base
- GGUF 等量化版本会损失生成质量 —— SulphurAI/Sulphur-2-base
- 生成内容仍需遵守当地法律,不可因技术可行而忽视法律边界 —— SulphurAI/Sulphur-2-base