Gemma-4-12B-it-LWQ6 (wepiqx)
混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成
~13GB 8-bit许可 可商用任务 文本生成最近核对 2026-07-22
- 格式
- 8-bit
- 文件
- ~11GB
- 运行内存
- ~13GB–17GB
- 运行时
- llama.cpp
- 下载
- 1,420
适合与不适合
独立证据与社区反馈
社区普遍认为 Gemma 4 12B 是同尺寸中性价比最高的开源多模态模型之一:在消费级 GPU(8-16GB VRAM)上即可流畅运行,性能接近 2 倍大的 26B 版本,编程能力尤其亮眼,但加载工具的默认配置(如 LM Studio 的推理 token 模板)会严重影响实际表现,需要手动调整才能发挥应有水平。
- 量化后仅需约 6.6GB VRAM(Q4_K_M),可塞进 8GB 显存显卡,16GB 显存有充足余量
- 在 MMLU Pro 上得分 77.2%,超越上一代 Gemma 3 27B 的 67.6%,逼近 26B 版本
- 原生多模态:无需独立视觉/音频编码器即可处理文本、图像、音频和视频输入
- Apache 2.0 协议,商用无限制
- 一条命令 ollama run gemma4:12b 即可本地部署
- 在 Python 代码调试中能自动将慢速循环重写为 BallTree 算法等优化方案
- 可在 GTX 1070 等 8 年老旧 GPU 上运行,且 SHQ6 量化在困惑度和代码质量上均优于 Unsloth 官方 UD-Q4_K_XL
- 在 16GB 内存的笔记本上即可推理,大幅降低本地 AI 硬件门槛
- LM Studio 默认模板会错误匹配 Qwen 的推理 token,导致模型推理能力被关闭,需手动在 Jinja 模板首行添加 {%- set enable_thinking = true %} 并修改起止 token
- 使用官方推荐的采样参数(temperature=1.0, top_p=0.95, top_k=64)才能获得最佳推理质量,降低温度反而有损表现
- 12B 参数规模存在硬上限:在 Python bug 挖掘测试中仅找到 6 个 bug,而 Qwen 35B 找到 14 个
- LM Studio 等工具的开箱配置目前对 Gemma 4 不友好,需要用户了解推理 token 机制才能正确配置
- 独立评测Gemma 4 12B Is INCREDIBLE! BEST Local AI Coding Model! IS POWERFUL! (Fully Tested)
- 独立评测Gemma 4 12B : Run Locally, Fine-Tune, Benchmark Performance
- 独立评测Google Gemma 4-12B: A Laptop-Runnable Open Model That Matches Gemma 4-26B | MindStudio
- 独立评测Gemma 4 12B: Benchmarks, VRAM & How to Run It | TECHSY
- 社区实测Benchmark & Reality Check on Gemma 4 12B: Great model, but your ...
- 独立评测Gemma 4 12B: Specs, Benchmarks & How to Run It Locally
- 独立评测Google Gemma 4 12B nearly matches 26B benchmarks
- 官方/厂商wepiqx/gemma-4-12B-it-SHQ6-GGUF · Hugging Face
可信度自报Wikitext-2 PPL 489.69,低于Unsloth UD-Q4_K_XL (513.11),1420下载
完整规格
下载动量
30天下载 3.7k → 453