🌳webml-community / bonsai-image-webgpu
基于三元权重(1.58-bit)的文本到图像扩散Transformer,在浏览器中运行,支持Apple Silicon,模型大小为1.21GB(相对FP16压缩6.4倍)。
运行模型 prism-ml/bonsai-image-ternary-4B-mlx-2bit →
本页记录当日收录项目;运行状态与体验入口按当前结果更新。完整目录见 Space 体验目录。
基于三元权重(1.58-bit)的文本到图像扩散Transformer,在浏览器中运行,支持Apple Silicon,模型大小为1.21GB(相对FP16压缩6.4倍)。
运行模型 prism-ml/bonsai-image-ternary-4B-mlx-2bit →
VGGT-Ω是前馈相机与深度重建模型:输入图像或短视频,输出3D点云及估计相机位姿,由牛津VGG组和Meta AI开发,采用FAIR非商业研究许可。
VoxCPM2语音模型的Gradio演示,基于Nano-vLLM推理引擎,提供实验性推理接口。
Open LLM 排行榜:跟踪、排名和评估开放大语言模型与聊天机器人,提供 React 前端、后端 API 与 Docker 容器化部署,用于可复现地对比模型。
阿里 HumanAIGC 的虚拟试衣 demo,输入人物照与服装图,经两阶段扩散合成对应穿着效果,支持多体型与姿态。
Facebook Research 的 AudioCraft 音频生成库,包含 MusicGen 与 AudioGen 两个模型,提供高质量音频生成、训练与推理代码,依赖 Python 3.9 和 PyTorch 2.0。
Whisper 的 JAX 实现,借助 TPU 与批处理大幅提升长音频转写吞吐,相较原版 PyTorch 推理快数十倍。
运行模型 openai/whisper-large-v3 →
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索