JoyAI-Echo (JD)
分钟级多镜头音视频长视频生成,面向研究者
许可 需自查任务 视频生成最近核对 2026-07-22
适合与不适合
独立证据与社区反馈
基于 LTX-2.3 的开源长视频生成模型,主打多镜头联合音视频生成与分钟级时长,社区关注点集中在长视频能力与 46GB 部署门槛
- 生成长达约 5 分钟的视频,远超多数开源视频模型支持的时长
- 多镜头场景下保持角色外观和声音一致,适合故事类内容
- 端到端联合生成视频与音频,无需先视频后配音的流水线
- 模型体积 46GB,本地部署显存门槛高
- 需使用独立推理仓库,尚未原生集成到 diffusers 等主流框架
- 基于 LTX-2 Community License,商用需注意许可证条款
- 独立评测JoyAI-Echo – JD's Open-Source Long-Form Audio-Video ...
- 独立评测JoyAI-Echo : Generate 5 minutes long AI video with this ...
- 社区实测JoyAI-Echo video model released on HF : r/StableDiffusion
- 转载/仓库[RFC]: Add JoyAI-Echo (LTX-2.3-derived multi-shot T2V+Audio) · Issue #4193 · vllm-project/vllm-omni · GitHub
- 官方/厂商jdopensource/JoyAI-Echo
可信度1424 下载,长视频人类评估视觉美学偏好率 63.6% vs HappyOyster 27.6%
完整规格
下载动量
30天下载 8.5k → 7.1k · likes +15