模型 / Gemma-4-12B-it-SHQ6 (wepiqx)

Gemma-4-12B-it-SHQ6 (wepiqx)

混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成

作者 wepiqx

仓库标识wepiqx/gemma-4-12B-it-SHQ6-GGUF

显存未知许可 可商用任务 文本生成最近核对 2026-08-05
运行内存
格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
运行时
LLAMA-SERVER
下载
1,420

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf wepiqx/gemma-4-12B-it-SHQ6-GGUF:gemma-4-12b-it-SHQ6-IQ4_XS.gguf --jinja --flash-attn on -c 55555 -ngl 99

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Gemma 4 12B的4-bit混合量化版,GGUF格式可用llama.cpp/Ollama在8GB显卡本地跑,适合低显存用户部署,但仅作者自测无第三方验证。
对位
对位Unsloth UD-Q4_K_XL量化版及同类12B量化模型
适合
8GB显存本地代码生成 / 混合量化高效率推理
不适合
需全精度BF16或16GB+显存场景

独立证据与社区反馈

12 个独立来源 · 另 2 官方/转载最近验证 2026-08-05

Gemma 4 12B 在 12B 参数规模下实现接近 26B MoE 的性能,能跑在 16GB 消费级设备上是最大亮点;但编码能力社区评价两极分化——有人称其为「最好的本地编码模型」,也有人认为 Qwen 在编程尤其是 agentic coding 上远优于它。实际体验高度依赖量化版本与推理框架,量化质量差时会出现严重循环和工具调用失败。

  • 可在 16GB 内存笔记本或 8GB 显存 GPU 上本地运行,无需高端硬件
  • 性能接近 Gemma 4 26B MoE,内存占用不到一半
  • 对话和推理体验比 Qwen 3.5 更自然流畅
  • SHQ6 混合量化在 8GB 显存 GPU 上困惑度和编码质量均优于官方 Q4 量化
  • 支持 MTP(多头预测)使推理速度翻倍至 40-45 tok/s
  • 视觉任务上优于同尺寸竞品如 Llama 3.2-11B
  • Python bug hunting benchmark 中表现良好(Unsloth Dynamic Q5 量化下)
  • 量化质量参差不齐,早期 Unsloth 量化存在严重循环和低质量问题
  • 编码能力社区争议大,多名用户认为 Qwen 在编程尤其是 agentic coding 上远优于 Gemma
  • 与 opencode 等工具的兼容性存在问题,工具调用和文件写入不可靠
  • Q4 量化下质量明显下降,几乎所有任务都出错
  • 难度较高的技术问题上不如 Qwen 3.5
  • 多语言尤其是亚洲语言覆盖不如 Qwen2.5-14B
  • 早期 Unsloth 量化需要约 4 小时调试才能正常工作

可信度自报Wikitext-2 PPL 489.69,低于Unsloth UD-Q4_K_XL (513.11),1420下载

完整规格

规模
12B · 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 416 → 482

观测时间线