🎤victor / LongCat-Video-Avatar-1.5
音频驱动说话头视频生成:上传参考图像+音频+文本提示,输出5秒唇形同步视频。基于美团LongCat-Video-Avatar 1.5,INT8量化DiT,DMD2蒸馏8步LoRA,ZeroGPU xlarge运行。
运行模型 meituan-longcat/LongCat-Video-Avatar-1.5 ↗
本页记录当日收录项目;运行状态与体验入口按当前结果更新。完整目录见 Space 体验目录。
音频驱动说话头视频生成:上传参考图像+音频+文本提示,输出5秒唇形同步视频。基于美团LongCat-Video-Avatar 1.5,INT8量化DiT,DMD2蒸馏8步LoRA,ZeroGPU xlarge运行。
运行模型 meituan-longcat/LongCat-Video-Avatar-1.5 ↗
FLUX.1 [schnell] 的文本生成图像演示:12B 参数 rectified flow Transformer,经潜在对抗扩散蒸馏,1 至 4 步生成图像,Apache-2.0 许可,可商用。
运行模型 black-forest-labs/FLUX.1-schnell ↗
IllusionDiffusion 是一个图像生成 demo,用于生成高质量的幻觉/视错觉艺术图像。资料未说明具体输入方式与模型细节。
通过单条提示词生成漫画,结合大语言模型与 SDXL 模型进行图像生成,项目开源。
运行模型 HuggingFaceH4/zephyr-7b-beta ↗
Black Forest Labs 开发的 120 亿参数 rectified flow transformer 文本到图像生成模型,开源权重,非商业许可。
运行模型 black-forest-labs/FLUX.1-dev →
F5-TTS 与 E2-TTS 的非官方演示:零样本声音克隆,利用 Flow Matching 合成语音;本地需放置对应预训练检查点,相关代码与论文见 GitHub。
运行模型 SWivid/F5-TTS ↗
DeepSite 是一个 Vibe Coding 平台,利用生成式 AI 编写代码并生成应用程序;资料同时给出 DeepSeek-V3-0324 的 API 温度映射、文件上传与联网搜索提示词格式。
运行模型 deepseek-ai/DeepSeek-V3-0324 ↗
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索