指南 / 图像生成模型

图像生成模型

共 22 个 · 数据更新于 2026-07-23

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

本地图像生成入门(2026-07)

18 个本地可跑的开源文生图模型,显存数据大多缺失,先看 intro 再看表。

阅读完整指南 →

模型参数量显存门槛上下文许可证商用语言国内可达部署
Mage-Flow-4B (Microsoft) 4B~2.4GB 4-bitMIT可商用需代理
M87 (mgwr)
LoRA · 基于 Krea-2-Turbo
apache-2.0可商用需代理python -c "from diffusers import DiffusionPipeline; pipe = DiffusionPipeline.from_pretrained('krea/Krea-2-Turbo'); pipe.load_lora_weights('mgwr/M87'); pipe('a cat --preview').images[0].save('out.png')"
Krea2 Turbo Style Reference LoRA (Krea)
LoRA · 基于 Krea-2-Turbo
不适用krea-2-community-license需自查需代理pipe = DiffusionPipeline.from_pretrained("krea/Krea-2-Turbo", custom_pipeline="ostris/Krea2OstrisEdit", torch_dtype=torch.bfloat16); pipe.enable_model_cpu_offload(); pipe.load_lora_weights("ostris/krea2_turbo_style_reference")
Krea-2 Depth ControlNet (Patil)
LoRA · 基于 Krea-2-Raw
862MB LoRAkrea-2-community-license需自查需代理git clone https://github.com/Tanmaypatil123/Krea-2-controlnet && cd Krea-2-controlnet && pip install -q -r requirements.txt && hf download Patil/Krea-2-depth-controlnet depth-control-lora.safetensors --local-dir . && python inference.py input.jpg -p "prompt" --lora depth-control-lora.safetensors
Sun-Direction LoRA (eric-venti-seeds)
LoRA · 基于 FLUX.2-klein-9B
9B~5.4GB 4-bit不适用Apache-2.0可商用需代理
Krea-2-Turbo (Krea)
量化自 Krea-2-Turbo
原生 · GGUF
12B~7.2GB 4-bitKrea-2-Community-License需自查需代理sglang generate --model-path krea/Krea-2-Turbo --prompt "a red fox sitting in fresh snow, golden hour, photorealistic" --num-inference-steps 8 --height 1024 --width 1024 --save-output 等 2 种
Krea2-FP8 (KREA) krea-2-license需自查需代理huggingface-cli download AlperKTS/Krea2_FP8 --local-dir ./krea2_fp8
Krea-2-Raw (Krea) 12B~7.2GB 4-bitkrea-2-community-license需自查需代理pip install git+https://github.com/sgl-project/sglang.git && sglang generate --model-path krea/Krea-2-Raw --prompt "a fox in the snow" --num-inference-steps 52 --height 1024 --width 1024 --guidance-scale 3.5 --save-output 等 2 种
ideogram_4_turbotime_lora (ostris)
LoRA · 基于 ideogram-4-fp8
未公开(LoRA)不适用ideogram-4-non-commercial需自查需代理from diffusers import DiffusionPipeline; pipe = DiffusionPipeline.from_pretrained('ideogram-ai/ideogram-4-fp8', dtype=torch.bfloat16, device_map='cuda'); pipe.load_lora_weights('ostris/ideogram_4_turbotime_lora') 等 2 种
Ideogram-4-NF4 (Ideogram) other需自查需代理python -c 'from diffusers import DiffusionPipeline; pipe = DiffusionPipeline.from_pretrained("ideogram-ai/ideogram-4-nf4", torch_dtype=torch.bfloat16); pipe.to("cuda")' 等 2 种
ideogram-4-fp8 (ideogram-ai) other需自查需代理diffusers: from_pretrained('ideogram-ai/ideogram-4-fp8')
Cosmos3-Super-Text2Image (nvidia) 64B~39GB 4-bit4k tokens (文本输入)OpenMDW1.1需自查需代理vllm serve nvidia/Cosmos3-Super-Text2Image (vLLM-Omni) 等 3 种
Bonsai Image Ternary 4B (Prism ML)
微调自 bonsai-image-ternary-4B-unpacked
4B~1.1GB ternary不适用Apache-2.0可商用需代理Python API: from backend_gpu.server import build_pipeline; pipe = build_pipeline('prism-ml/bonsai-image-ternary-4B-gemlite-2bit') 等 2 种
Bonsai-Image-4B (Prism ML)
量化自 bonsai-image-ternary-4B-unpacked
4B~1.1GB ternary不适用apache-2.0可商用需代理macOS: git clone https://github.com/PrismML-Eng/Bonsai-Image-Demo && cd Bonsai-Image-Demo && ./setup.sh && ./scripts/download_model.sh && ./scripts/generate.sh
Bonsai-Image-Binary-4B (Prism ML)
量化自 bonsai-image-binary-4B-unpacked
4B~0.6GB 1-bitapache-2.0可商用需代理MLX Python: BONSAI_VARIANT=binary ./scripts/generate.sh --prompt "..."
FLUX.1-dev (BFL) 12B~7.2GB 4-bit不适用非商业许可需自查需代理diffusers: FluxPipeline.from_pretrained('black-forest-labs/FLUX.1-dev')
PiD (NVIDIA)
微调自 PixelDiT-1300M-1024px
NVIDIA Internal SRDML (仅限研究)需自查需代理hf download nvidia/PiD --local-dir . --include 'checkpoints/*' 等 2 种
Lens (Microsoft) 3.8B~2.3GB 4-bitMIT可商用需代理git clone https://github.com/microsoft/Lens && python inference.py 等 2 种
Lens-Turbo (Microsoft) 3.8B~2.3GB 4-bitMIT可商用需代理CLI: git clone https://github.com/microsoft/Lens && python inference.py --repo_id microsoft/Lens-Turbo 等 2 种
AsymFLUX.2-klein-9B (Stanford)
微调自 FLUX.2-klein-base-9B
9B~5.4GB 4-bitflux-non-commercial-license需代理Python: pip install lakonlab 后用 PixelFlux2KleinPipeline 加载适配器
Juggernaut-Z-Image (RunDiffusion)
量化自 Z-Image
cc-by-nc-4.0不可商用需代理diffusers: from_pretrained('RunDiffusion/Juggernaut-Z-Image')
Z-Anime (SeeSee21)
量化自 Z-Image
4B~4.4GB FP8apache-2.0可商用需代理from diffusers import StableDiffusionPipeline; pipe = StableDiffusionPipeline.from_pretrained('SeeSee21/Z-Anime') 等 2 种

常见坑

  • 需要自行准备 20-50 张图片的数据集来训练 LoRA,上手门槛较高 —— ostris/krea2_turbo_style_reference
  • 训练步数需找到收敛甜点(社区经验约 3000 步),否则效果不稳定 —— ostris/krea2_turbo_style_reference
  • 社区曾对其是否已发布/可用存在疑问 —— Patil/Krea-2-depth-controlnet
  • 仅针对室外场景训练,室内或非外景图像效果无法保证 —— eric-venti-seeds/Sun-Direction-Lora-Flux2Klein9B
  • 真实感/照片级渲染不如 Z-Image Turbo —— krea/Krea-2-Turbo
  • 复杂提示词下可靠性偏低 —— krea/Krea-2-Turbo
  • 团队承认模型未针对真实感调优,后续版本拟改善 —— krea/Krea-2-Turbo
  • 超过 50 人团队需购买企业许可,非完全免费商用 —— krea/Krea-2-Raw
展开其余 30 条
  • 所有用户必须实施技术安全措施以防止生成非法内容 —— krea/Krea-2-Raw
  • 并非传统意义上的开源,而是自定义许可证下的开放权重 —— krea/Krea-2-Raw
  • 降低步数存在画质取舍,证据中未完整描述具体损失 —— ostris/ideogram_4_turbotime_lora
  • 生成速度较慢:2MP 图像 20 步约需 2 分钟(4080+64GB 内存),1MP 12 步约 30 秒 —— ideogram-ai/ideogram-4-nf4
  • 需要 JSON 提示才能发挥最佳效果,自然语言提示表现不如结构化 JSON —— ideogram-ai/ideogram-4-nf4
  • 社区生态仍处早期阶段:尚无社区微调、LoRA 和优化工作流,自定义节点极少 —— ideogram-ai/ideogram-4-nf4
  • 人体某些部位渲染仍较粗糙,属于模型本身的训练限制 —— ideogram-ai/ideogram-4-nf4
  • FP8 量化版本质量下降明显,尤其是文字渲染 —— ideogram-ai/ideogram-4-fp8
  • 自然语言提示效果不如 JSON 结构化提示 —— ideogram-ai/ideogram-4-fp8
  • 模型定位为机器人与自动驾驶AI训练的世界模型,非消费级图像生成产品,与 Seedance 等消费级产品不构成直接竞争 —— nvidia/Cosmos3-Super-Text2Image
  • 图像生成质量/准确度不佳 —— prism-ml/bonsai-image-ternary-4B-gemlite-2bit
  • 文字生成结果差 —— prism-ml/bonsai-image-ternary-4B-mlx-2bit
  • 整体准确度不佳 —— prism-ml/bonsai-image-ternary-4B-mlx-2bit
  • 生成准确性不佳,输出质量不够理想 —— prism-ml/bonsai-image-binary-4B-mlx-1bit
  • FLUX.1-dev 使用非商业许可,不能用于商业用途或商业服务 —— black-forest-labs/FLUX.1-dev
  • 部分社区模型将 dev 与 Schnell 合并后以 Apache 等商业友好许可分发,存在法律风险 —— black-forest-labs/FLUX.1-dev
  • 生成速度比同系列的 Schnell 慢约 4 倍 —— black-forest-labs/FLUX.1-dev
  • 约需 20 步推理才能产出高质量图像,对低配硬件仍有算力压力 —— black-forest-labs/FLUX.1-dev
  • 社区 LoRA 与衍生模型(如 Krea-dev)的兼容性不保证,迁移需实测验证 —— black-forest-labs/FLUX.1-dev
  • 目前社区仅有 Python 脚本形式的简易封装,尚无 ComfyUI 工作流节点 —— nvidia/PiD
  • 人体解剖结构渲染不够稳定,手部/姿态容易出错 —— microsoft/Lens
  • 冷门/小众题材生成质量下降明显 —— microsoft/Lens
  • 需使用ComfyUI nightly版本,稳定版(≤0.22.0)不兼容 —— microsoft/Lens
  • 文本编码器体积达 20B,加载和推理开销较大 —— microsoft/Lens-Turbo
  • 不支持图像编辑/inpainting 等能力,功能较单一 —— microsoft/Lens-Turbo
  • 16GB 显存能否流畅运行存在疑问 —— microsoft/Lens-Turbo
  • 多数 prompt 下输出质量不佳,效果很不稳定 —— Lakonik/AsymFLUX.2-klein-9B
  • 数据策管不足,可能影响特定场景输出 —— Lakonik/AsymFLUX.2-klein-9B
  • 样本预览画质受到社区质疑,认为不够好 —— SeeSee21/Z-Anime
  • 社区实测反馈极少,缺乏大规模对比验证 —— SeeSee21/Z-Anime

收藏本页,或 订阅 RSS 追踪每日更新。