模型 / Gemma-4-12B-it-LWQ6 (wepiqx)

Gemma-4-12B-it-LWQ6 (wepiqx)

混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成

作者 wepiqx

~13GB 8-bit许可 可商用任务 文本生成最近核对 2026-07-22
格式
8-bit
文件
~11GB
运行内存
~13GB–17GB
运行时
llama.cpp
下载
1,420

Hugging Face 源仓库 ↗

适合与不适合

入选理由
Gemma 4 12B的4-bit混合量化版,GGUF格式可用llama.cpp/Ollama在8GB显卡本地跑,适合低显存用户部署,但仅作者自测无第三方验证。
对位
对位Unsloth UD-Q4_K_XL量化版及同类12B量化模型
适合
8GB显存本地代码生成 / 混合量化高效率推理
不适合
需全精度BF16或16GB+显存场景

独立证据与社区反馈

7 个独立来源 · 另 1 官方/转载最近验证 2026-07-22

社区普遍认为 Gemma 4 12B 是同尺寸中性价比最高的开源多模态模型之一:在消费级 GPU(8-16GB VRAM)上即可流畅运行,性能接近 2 倍大的 26B 版本,编程能力尤其亮眼,但加载工具的默认配置(如 LM Studio 的推理 token 模板)会严重影响实际表现,需要手动调整才能发挥应有水平。

  • 量化后仅需约 6.6GB VRAM(Q4_K_M),可塞进 8GB 显存显卡,16GB 显存有充足余量
  • 在 MMLU Pro 上得分 77.2%,超越上一代 Gemma 3 27B 的 67.6%,逼近 26B 版本
  • 原生多模态:无需独立视觉/音频编码器即可处理文本、图像、音频和视频输入
  • Apache 2.0 协议,商用无限制
  • 一条命令 ollama run gemma4:12b 即可本地部署
  • 在 Python 代码调试中能自动将慢速循环重写为 BallTree 算法等优化方案
  • 可在 GTX 1070 等 8 年老旧 GPU 上运行,且 SHQ6 量化在困惑度和代码质量上均优于 Unsloth 官方 UD-Q4_K_XL
  • 在 16GB 内存的笔记本上即可推理,大幅降低本地 AI 硬件门槛
  • LM Studio 默认模板会错误匹配 Qwen 的推理 token,导致模型推理能力被关闭,需手动在 Jinja 模板首行添加 {%- set enable_thinking = true %} 并修改起止 token
  • 使用官方推荐的采样参数(temperature=1.0, top_p=0.95, top_k=64)才能获得最佳推理质量,降低温度反而有损表现
  • 12B 参数规模存在硬上限:在 Python bug 挖掘测试中仅找到 6 个 bug,而 Qwen 35B 找到 14 个
  • LM Studio 等工具的开箱配置目前对 Gemma 4 不友好,需要用户了解推理 token 机制才能正确配置

可信度自报Wikitext-2 PPL 489.69,低于Unsloth UD-Q4_K_XL (513.11),1420下载

完整规格

规模
12B · 下载 ~11GB · 显存最低 ~13GB · 推荐 ~17GB · 8-bit(估算)
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 3.7k → 453

观测时间线