模型 / JoyAI-Echo (JD)

JoyAI-Echo (JD)

分钟级多镜头音视频长视频生成,面向研究者

作者 jdopensource

许可 需自查任务 视频生成最近核对 2026-07-22
运行时
原生 PyTorch
下载
1,424

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
开源长视频生成模型,支持5分钟多镜头视频+音频联合生成,需46GB+显存自部署,适合研究或高端用户探索一致性强、可交互的长视频生成。
对位
对位 HappyOyster (Directing) / Wan 2.6
适合
长视频多镜头故事创作(含音频) / 交互式实时视频编辑
不适合
图像到视频生成(I2V 未支持)

独立证据与社区反馈

3 个独立来源 · 另 2 官方/转载最近验证 2026-07-22

基于 LTX-2.3 的开源长视频生成模型,主打多镜头联合音视频生成与分钟级时长,社区关注点集中在长视频能力与 46GB 部署门槛

  • 生成长达约 5 分钟的视频,远超多数开源视频模型支持的时长
  • 多镜头场景下保持角色外观和声音一致,适合故事类内容
  • 端到端联合生成视频与音频,无需先视频后配音的流水线
  • 模型体积 46GB,本地部署显存门槛高
  • 需使用独立推理仓库,尚未原生集成到 diffusers 等主流框架
  • 基于 LTX-2 Community License,商用需注意许可证条款

可信度1424 下载,长视频人类评估视觉美学偏好率 63.6% vs HappyOyster 27.6%

完整规格

授权
LTX-2 Community License (研究/非商用) · 需自查
框架
原生 PyTorch
视频
文生 · 46-50GB 显存 · 最长5分钟 · 1280x736
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 8.5k → 7.1k · likes +15

观测时间线