🐌EldMans / wan2.2_14b_i2v_480p_lightning_nsfw_diffusers
输入图片和文本提示,生成视频。
收藏 187 · 4个月前更新
本页记录当日收录项目;运行状态与体验入口按当前结果更新。完整目录见 Space 体验目录。
输入图片和文本提示,生成视频。
210M参数的编码器模型,从HTML中提取主要内容,单次前向传播标记每个块为内容或模板,速度比0.6B解码器快约20倍(ROUGE-5 F1 0.862)。
运行模型 feyninc/pulpie-orange-small ↗
基于Qwen3.5骨干和Q-Former的自回归语音合成模型,支持语音克隆和文本CFG控制,使用NeMo nano编解码器将参考音频压缩为8个前缀token。
此演示输入一张图像和一个文本提示词,模型基于二者生成视频,属于文本引导的图像到视频生成任务。
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索