指南 / 图像生成模型

图像生成模型

共 30 个 · 数据更新于 2026-09-11

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

本地图像生成入门

面向想在自己电脑上出图的人:先分清哪些能本地跑、哪些只是在线试用,再看授权;显存资料几乎都缺,本站不替你猜。

阅读完整指南 →

  • 6B文生图与编辑模型,含4步Turbo版

    参数量
    6B
    商用
    可商用

    当前运行配置 inclusionAI/LLaDA-Image

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    魔搭可用
  • ComfyUI 角色表生成,多参考图 360° 一致角色

    商用
    需自查

    当前运行配置 PoopMan333/H3_Character_Sheet_Generator

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    缺少可用的显存依据
    许可证
    minimax-h3-community-license (EU/UK/韩国/美国除外)
    国内可达
    需代理
  • 动漫/插画文本生图模型,面向二次元创作者

    参数量
    2.9B
    商用
    需自查

    当前运行配置 Gazingstars123/Anima-2.9B

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    CircleStone Labs Non-Commercial License
    国内可达
    需代理
  • 将角色图片转为三视图、四视图及动态角色设定表的 LoRA 集合

    商用
    需自查

    当前运行配置 Alissonerdx/CharacterSheet

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    缺少可用的显存依据
    许可证
    Civitai 模型许可
    上下文
    不适用
    国内可达
    需代理
  • Kroma (lodestones)

    LoRA · 基于 Krea-2

    Krea 2 的 LoRA 适配器,ComfyUI 直接加载

    商用
    可商用

    当前运行配置 lodestones/Kroma

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    缺少可用的显存依据
    许可证
    MIT
    国内可达
    需代理
  • Qwen-Image-Flash (NVIDIA)

    微调自 Qwen-Image

    四步DMD2蒸馏,快速文本生成图像,开发者评估

    参数量
    20.43B
    商用
    需自查

    当前运行配置 nvidia/Qwen-Image-Flash

    显存
    暂无估算
    查看详情
    查看运行方式
    sglang generate --model-path nvidia/Qwen-Image-Flash --prompt "A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus, soft bokeh" --width 1024 --height 1024 --num-inference-steps 4 --guidance-scale 1.0 --true-cfg-scale 1.0 --seed 42 --save-output --output-file-path qwen-image-flash-sglang.png
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    NVIDIA Open Model Agreement
    国内可达
    需代理
  • 4步蒸馏的4B文本到图像模型,适用快速出图

    参数量
    4B
    商用
    可商用

    当前运行配置 microsoft/Mage-Flow-Turbo

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    上下文
    不适用
    国内可达
    需代理
  • 4B 指令式图像编辑 Turbo 模型,4 步蒸馏推理

    参数量
    4B
    商用
    可商用

    当前运行配置 microsoft/Mage-Flow-Edit-Turbo

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • 紧凑4B原生分辨率文本图像生成与编辑模型

    参数量
    4B
    商用
    可商用

    当前运行配置 microsoft/Mage-Flow

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • M87 (mgwr)

    LoRA · 基于 Krea-2-Turbo

    Krea-2 Turbo 风格化 LoRA,电影感氛围增强

    商用
    可商用

    当前运行配置 mgwr/M87

    显存
    暂无估算
    查看详情
    查看运行方式
    python -c "from diffusers import DiffusionPipeline; pipe = DiffusionPipeline.from_pretrained('krea/Krea-2-Turbo'); pipe.load_lora_weights('mgwr/M87'); pipe('a cat --preview').images[0].save('out.png')"
    为何暂无估算
    缺少可用的显存依据
    许可证
    apache-2.0
    国内可达
    需代理
  • Krea2 Turbo Style Reference LoRA (Krea)

    LoRA · 基于 Krea-2-Turbo

    风格参考 LoRA,将参考图风格注入 Krea2 Turbo 生成

    商用
    需自查

    当前运行配置 ostris/krea2_turbo_style_reference

    显存
    暂无估算
    查看详情
    查看运行方式
    pipe = DiffusionPipeline.from_pretrained("krea/Krea-2-Turbo", custom_pipeline="ostris/Krea2OstrisEdit", torch_dtype=torch.bfloat16); pipe.enable_model_cpu_offload(); pipe.load_lora_weights("ostris/krea2_turbo_style_reference")
    为何暂无估算
    缺少可用的显存依据
    许可证
    krea-2-community-license
    上下文
    不适用
    国内可达
    需代理
  • Krea-2 Depth ControlNet (Patil)

    LoRA · 基于 Krea-2-Raw

    深度条件图像生成,保持输入图像3D结构,用于风格迁移与内容变换

    参数量
    862MB LoRA
    商用
    需自查

    当前运行配置 Patil/Krea-2-depth-controlnet

    显存
    暂无估算
    查看详情
    查看运行方式
    git clone https://github.com/Tanmaypatil123/Krea-2-controlnet && cd Krea-2-controlnet && pip install -q -r requirements.txt && hf download Patil/Krea-2-depth-controlnet depth-control-lora.safetensors --local-dir . && python inference.py input.jpg -p "prompt" --lora depth-control-lora.safetensors
    为何暂无估算
    缺少可用的显存依据
    许可证
    krea-2-community-license
    国内可达
    需代理
  • Sun-Direction LoRA (eric-venti-seeds)

    LoRA · 基于 FLUX.2-klein-9B

    为Flux.2 Klein 9B图像指定阳光方向,球体参考工作流

    参数量
    9B
    商用
    可商用

    当前运行配置 eric-venti-seeds/Sun-Direction-Lora-Flux2Klein9B

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    不适用
    国内可达
    需代理
  • Krea-2-Turbo (Krea)

    量化自 Krea-2-Turbo

    12B 文本到图像扩散模型,GGUF 量化版,用于本地生成

    参数量
    12B
    商用
    需自查

    当前运行配置 krea/Krea-2-Turbo

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    sglang generate --model-path krea/Krea-2-Turbo --prompt "a red fox sitting in fresh snow, golden hour, photorealistic" --num-inference-steps 8 --height 1024 --width 1024 --save-output

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Krea-2-Community-License
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • Krea 2 Turbo 的 FP8 量化版,16GB 显存可用

    商用
    需自查

    当前运行配置 AlperKTS/Krea2_FP8

    显存
    暂无估算
    查看详情
    查看运行方式
    huggingface-cli download AlperKTS/Krea2_FP8 --local-dir ./krea2_fp8
    为何暂无估算
    缺少可用的显存依据
    许可证
    krea-2-license
    国内可达
    需代理
  • 12B 图像生成基座,用于 LoRA 微调训练

    参数量
    12B
    商用
    需自查

    当前运行配置 krea/Krea-2-Raw

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    pip install git+https://github.com/sgl-project/sglang.git && sglang generate --model-path krea/Krea-2-Raw --prompt "a fox in the snow" --num-inference-steps 52 --height 1024 --width 1024 --guidance-scale 3.5 --save-output

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    krea-2-community-license
    国内可达
    需代理
  • ideogram_4_turbotime_lora (ostris)

    LoRA · 基于 ideogram-4-fp8

    Ideogram 4 加速 LoRA,2 步出图,无需 CFG

    参数量
    未公开(LoRA)
    商用
    需自查

    当前运行配置 ostris/ideogram_4_turbotime_lora

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    from diffusers import DiffusionPipeline; pipe = DiffusionPipeline.from_pretrained('ideogram-ai/ideogram-4-fp8', dtype=torch.bfloat16, device_map='cuda'); pipe.load_lora_weights('ostris/ideogram_4_turbotime_lora')

    其它 1 种运行方式见详情页

    为何暂无估算
    缺少可用的显存依据
    许可证
    ideogram-4-non-commercial
    上下文
    不适用
    国内可达
    需代理
  • Ideogram 4 官方 NF4 量化,低显存本地出图

    商用
    需自查

    当前运行配置 ideogram-ai/ideogram-4-nf4

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    python -c 'from diffusers import DiffusionPipeline; pipe = DiffusionPipeline.from_pretrained("ideogram-ai/ideogram-4-nf4", torch_dtype=torch.bfloat16); pipe.to("cuda")'

    其它 1 种运行方式见详情页

    为何暂无估算
    缺少可用的显存依据
    许可证
    other
    国内可达
    需代理
  • 文本到图像生成模型,Ideogram 4 的 FP8 量化版本

    商用
    需自查

    当前运行配置 ideogram-ai/ideogram-4-fp8

    显存
    暂无估算
    查看详情
    查看运行方式
    diffusers: from_pretrained('ideogram-ai/ideogram-4-fp8')
    为何暂无估算
    缺少可用的显存依据
    许可证
    other
    国内可达
    需代理
  • 文本生成高保真图像,面向物理AI与创作

    参数量
    64B
    商用
    需自查

    当前运行配置 nvidia/Cosmos3-Super-Text2Image

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    vllm serve nvidia/Cosmos3-Super-Text2Image (vLLM-Omni)

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    OpenMDW1.1
    上下文
    4k tokens (文本输入)
    国内可达
    需代理
  • Bonsai Image Ternary 4B (Prism ML)

    微调自 bonsai-image-ternary-4B-unpacked

    1.21GB三元文生图模型,4步采样,本地GPU运行

    参数量
    4B
    商用
    可商用

    当前运行配置 prism-ml/bonsai-image-ternary-4B-gemlite-2bit

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    Python API: from backend_gpu.server import build_pipeline; pipe = build_pipeline('prism-ml/bonsai-image-ternary-4B-gemlite-2bit')

    其它 1 种运行方式见详情页

    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    Apache-2.0
    上下文
    不适用
    国内可达
    需代理
  • Bonsai-Image-4B (Prism ML)

    量化自 bonsai-image-ternary-4B-unpacked

    1.21GB 三元文生图扩散模型,苹果芯片本地运行

    参数量
    4B
    商用
    可商用

    当前运行配置 prism-ml/bonsai-image-ternary-4B-mlx-2bit

    显存
    暂无估算
    查看详情
    查看运行方式
    macOS: git clone https://github.com/PrismML-Eng/Bonsai-Image-Demo && cd Bonsai-Image-Demo && ./setup.sh && ./scripts/download_model.sh && ./scripts/generate.sh
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    apache-2.0
    上下文
    不适用
    国内可达
    需代理
  • Bonsai-Image-Binary-4B (Prism ML)

    量化自 bonsai-image-binary-4B-unpacked

    1-bit量化文生图模型,专为Apple Silicon本地运行

    参数量
    4B
    商用
    可商用

    当前运行配置 prism-ml/bonsai-image-binary-4B-mlx-1bit

    显存
    ~0.6GB 1-bit(估算)
    查看详情
    查看运行方式
    MLX Python: BONSAI_VARIANT=binary ./scripts/generate.sh --prompt "..."
    许可证
    apache-2.0
    国内可达
    需代理
  • 文本到图像生成,用于开发者与创作者的视觉内容创建

    参数量
    12B
    商用
    需自查

    当前运行配置 black-forest-labs/FLUX.1-dev

    显存
    暂无估算
    查看详情
    查看运行方式
    diffusers: FluxPipeline.from_pretrained('black-forest-labs/FLUX.1-dev')
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    非商业许可
    上下文
    不适用
    国内可达
    需代理
  • PiD (NVIDIA)

    微调自 PixelDiT-1300M-1024px

    像素扩散解码器,将潜在表征一步超分至2K/4K图像

    商用
    需自查

    当前运行配置 nvidia/PiD

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    hf download nvidia/PiD --local-dir . --include 'checkpoints/*'

    其它 1 种运行方式见详情页

    为何暂无估算
    缺少可用的显存依据
    许可证
    NVIDIA Internal SRDML (仅限研究)
    国内可达
    需代理
  • 3.8B文本生成图像基础模型,高效训练与高分辨率生成

    参数量
    3.8B
    商用
    可商用

    当前运行配置 microsoft/Lens

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    git clone https://github.com/microsoft/Lens && python inference.py

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • 3.8B 高效文生图,4 步蒸馏,为开发者与创作者快速生成

    参数量
    3.8B
    商用
    可商用

    当前运行配置 microsoft/Lens-Turbo

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    CLI: git clone https://github.com/microsoft/Lens && python inference.py --repo_id microsoft/Lens-Turbo

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • AsymFLUX.2-klein-9B (Stanford)

    微调自 FLUX.2-klein-base-9B

    像素空间文生图模型,基于AsymFlow,适合文字渲染与细节生成

    参数量
    9B

    当前运行配置 Lakonik/AsymFLUX.2-klein-9B

    显存
    暂无估算
    查看详情
    查看运行方式
    Python: pip install lakonlab 后用 PixelFlux2KleinPipeline 加载适配器
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    flux-non-commercial-license
    国内可达
    需代理
  • 文本到图像扩散模型,面向 AI 应用构建者

    商用
    不可商用

    当前运行配置 RunDiffusion/Juggernaut-Z-Image

    显存
    暂无估算
    查看详情
    查看运行方式
    diffusers: from_pretrained('RunDiffusion/Juggernaut-Z-Image')
    为何暂无估算
    缺少可用的显存依据
    许可证
    cc-by-nc-4.0
    国内可达
    需代理
  • Z-Anime (SeeSee21)

    量化自 Z-Image

    动漫风格图像生成,面向二次元AI应用开发者

    参数量
    4B
    商用
    可商用

    当前运行配置 SeeSee21/Z-Anime

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    from diffusers import StableDiffusionPipeline; pipe = StableDiffusionPipeline.from_pretrained('SeeSee21/Z-Anime')

    其它 1 种运行方式见详情页

    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理

常见坑

  • 结构化文本(信息图、图表)在所有变体上均失败 —— microsoft/Mage-Flow-Turbo
  • 微软已从HuggingFace下架模型,社区获取困难 —— microsoft/Mage-Flow-Turbo
  • 编辑推理比生成慢,Base/RL编辑在RTX 4090上约12秒 —— microsoft/Mage-Flow-Turbo
  • 仍需约17-18.5GB VRAM,需中高端显卡才能运行 —— microsoft/Mage-Flow-Turbo
  • 局部编辑细节(如衣物纹理)可能不够精细 —— microsoft/Mage-Flow-Turbo
  • 1 兆像素图像在 8GB VRAM 上生成耗时约 185 秒,速度较慢 —— ostris/krea2_turbo_style_reference
  • Identity Edit LoRA 是社区非官方微调,非 Krea 官方产品 —— ostris/krea2_turbo_style_reference
  • 使用 Turbo 时需将 CFG 设为 1,与常规用法不同 —— ostris/krea2_turbo_style_reference
展开其余 50 条
  • 社区曾对其是否已发布/可用存在疑问 —— Patil/Krea-2-depth-controlnet
  • bfloat16 推理需 16GB 以上显存,低显存需用量化版 —— krea/Krea-2-Turbo
  • 许可证限制使用场景,不得用于移除安全措施、水印等 —— krea/Krea-2-Turbo
  • GGUF Q8 模型的效果优于 FP8 量化版 —— AlperKTS/Krea2_FP8
  • FP8 是显存不足时的折中方案,非最优画质选择 —— AlperKTS/Krea2_FP8
  • 在小细节上容易出错,精细度不足 —— krea/Krea-2-Raw
  • 缺乏后训练对齐和 RLHF,开箱即用的提示词生图效果不佳 —— krea/Krea-2-Raw
  • 降低步数存在画质取舍,证据中未完整描述具体损失 —— ostris/ideogram_4_turbotime_lora
  • NF4 量化版在低于 24GB 显存的 GPU 上仍可能 OOM —— ideogram-ai/ideogram-4-nf4
  • JSON 结构化提示词学习曲线高,手写几乎不可行,依赖工具链 —— ideogram-ai/ideogram-4-nf4
  • 发布时 ComfyUI 模板存在多处错误,上手体验不佳 —— ideogram-ai/ideogram-4-nf4
  • 对简单肖像/风景图的生成效率不如 ZIT、Anima 等工具 —— ideogram-ai/ideogram-4-nf4
  • 生成速度极慢,单张图可能耗时13分钟 —— ideogram-ai/ideogram-4-fp8
  • FP8量化在3090等显卡上文字质量下降明显 —— ideogram-ai/ideogram-4-fp8
  • 学习曲线陡峭,几乎必须依赖第三方工具和区域提示才能出好图 —— ideogram-ai/ideogram-4-fp8
  • 首发ComfyUI工作流有误,社区初体验差 —— ideogram-ai/ideogram-4-fp8
  • 若不需文字渲染或区域提示,有更快的替代方案 —— ideogram-ai/ideogram-4-fp8
  • 本地部署需要 128GB+ 显存,单张 H100 80GB 都无法运行,本地部署基本不可行 —— nvidia/Cosmos3-Super-Text2Image
  • NVIDIA 官方 API 仍在推进中,尚未正式上线 —— nvidia/Cosmos3-Super-Text2Image
  • 被社区指出只是 FLUX.2 Klein 4B 的量压缩(经后训练恢复性能),而非全新模型。 —— prism-ml/bonsai-image-ternary-4B-gemlite-2bit
  • 官方未在 Prism-ML 的 HF Web demo 页、HF 模型页与 GitHub 上提及 FLUX 团队或原始模型,招致批评。 —— prism-ml/bonsai-image-ternary-4B-gemlite-2bit
  • 底层模型是 Qwen,模型本身并非自研架构 —— prism-ml/bonsai-image-ternary-4B-mlx-2bit
  • 压缩技术/编码效率是核心创新,模型本身并非全新架构 [3] —— prism-ml/bonsai-image-binary-4B-mlx-1bit
  • FP16下几乎占用RTX 3090/5090全部24GB显存 —— black-forest-labs/FLUX.1-dev
  • 需NF4量化才能在12GB显存上舒适运行 —— black-forest-labs/FLUX.1-dev
  • 持续生成时功耗达440W,散热不佳的机箱热点温度可超85°C —— black-forest-labs/FLUX.1-dev
  • 安全过滤器比SDXL更严格,会误拦合法的医学或艺术史类prompt —— black-forest-labs/FLUX.1-dev
  • 仅限非商业研究和开发用途 —— black-forest-labs/FLUX.1-dev
  • 部分社区用户认为效果差,不如SD1.5配合loras/controlnet/adetailer —— black-forest-labs/FLUX.1-dev
  • 相比SDXL缺少抽象关键词触发意外好结果的创造性和混沌感 —— black-forest-labs/FLUX.1-dev
  • 容易破坏小细节,尤其在图像细节丰富的区域 —— nvidia/PiD
  • 使用 Euler 采样器时会产生粗糙断边和噪点背景 —— nvidia/PiD
  • 官方推荐使用 SDE 采样器加噪声注入和固定 sigma 曲线,对采样参数要求严格 —— nvidia/PiD
  • 社区对 PiD 与已有方案的区别存在混淆 —— nvidia/PiD
  • 已从应用商店下架,不再提供下载 —— microsoft/Lens
  • 官方引导用户迁移至OneDrive/OneNote扫描,工作流变复杂 —— microsoft/Lens
  • 本地直接保存功能随应用下架不可用 —— microsoft/Lens
  • 20B 文本编码器体量偏大,部署门槛不低 —— microsoft/Lens-Turbo
  • 不支持图像编辑能力 —— microsoft/Lens-Turbo
  • 非 Turbo 版在 4090 上 50 步约需 40 秒,速度仍偏慢 —— microsoft/Lens-Turbo
  • 细节偶尔与 prompt 偏离——食物摄影示例中部分细节未按提示生成 —— microsoft/Lens-Turbo
  • 非 Turbo 版在 4090 上仅约 1.2it/s,对硬件要求高 —— microsoft/Lens-Turbo
  • 对提示词措辞和采样参数非常敏感,需要反复调试 —— Lakonik/AsymFLUX.2-klein-9B
  • 不同设置下出图风格差异大,可复现性偏弱 —— Lakonik/AsymFLUX.2-klein-9B
  • Juggernaut X 在部分用户的批量测试中表现逊于 v9 —— RunDiffusion/Juggernaut-Z-Image
  • 基于 Juggernaut Z 制作的 LoRA 与 Base Z Image 的兼容性不确定 —— RunDiffusion/Juggernaut-Z-Image
  • 模型自 V6 起合并了闭源的 RunDiffusion Photo Model —— RunDiffusion/Juggernaut-Z-Image
  • 标签式(tags)提示词效果不如 Anima —— SeeSee21/Z-Anime
  • 有用户认为 Anima 综合表现远优于 Z-Anime —— SeeSee21/Z-Anime
  • 已有更轻量的动漫专用模型抢先发布 —— SeeSee21/Z-Anime

收藏本页,或 订阅 RSS 追踪每日更新。