Gemma-4-12B GGUF 合集 (rahul7star)
Gemma 4 12B/3B GGUF 量化集合,供本地聊天与代码任务
仓库标识rahul7star/gemma-gguf
显存未知许可 需自查最近核对 2026-08-05
链接指向的配置 不在本页收录的形态里,已显示默认形态(GGUF)。
- 运行内存
- 权重格式未知,无法估算显存
- 运行时
- LLAMA-CLI
- 下载
- 54,549
快速上手示例
llama-cli -hf rahul7star/gemma-gguf -m model-i-gemma-e4-12b-quality.gguf 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
Gemma 4 12B 在消费级硬件上推理速度出色(Q4_K_M 可达 72 tok/s),多模态能力在 12B 规模中属于第一梯队,但代码生成质量参差不齐,Q4 量化下部分用户反馈几乎不可用,整体更适合需要本地多模态推理而非重度编程的场景。
- 可在 16GB 内存笔记本上本地运行多模态模型,无需专用编码器
- Q4_K_M 量化在 16GB 显存(RTX 4080 Super)上生成速度达 72.3 tok/s,体验流畅
- QAT 量化版本在节省 3 倍内存的同时保持接近 BF16 的质量
- 在 DocVQA、BBEH、GPQA Diamond 等基准上超越参数规模两倍的 Gemma 3 27B
- 原生支持文本、图像、音频、视频多模态输入,不依赖外部编码器
- 作为免费开源模型,可替代 GPT-4o Mini / Claude Haiku 等付费 API 完成本地推理任务
- 相比 Gemma 3 安全对齐更弱,消除拒答更简单,且不再出现大规模激活值问题
- 支持 120K–250K 上下文窗口,适合长文档和视频理解
- Q4 量化下代码生成质量极差,有用户反馈「几乎所有任务都出错,无法正确写文件和代码」
- Q8_0 量化推理速度骤降至 25.2 tok/s,约为 Q4_K_M 的三分之一
- 多令牌预测(MTP)支持仍在开发中,尚未可用
- 综合推理能力和成熟度低于 Qwen 3.6 35B 等更大模型,后者「明显更聪明、更快、更全面」
- 在 BBH(53% vs 87.5%)、MRCRv2(43.4% vs 93.6%)等复杂推理基准上与顶尖模型差距显著
- 社区实测Gemma 4 12B: A unified, encoder-free multimodal model | Hacker News
- 社区实测Gemma 4 E4B + E2B Uncensored (Aggressive) — GGUF + ...
- 社区实测Gemma 4 12 b , very bad quality , quant 4 version ? : r/LocalLLM
- 独立评测Gemma 4 12B Is INCREDIBLE! BEST Local AI Coding Model! IS POWERFUL! (Fully Tested)
- 独立评测Gemma 4 12B : Run Locally, Fine-Tune, Benchmark Performance
- 独立评测Gemma 4 12B vs GPT-4o Mini vs Claude Haiku [2026 Benchmark]
- 独立评测Gemma 4 12B Benchmarks & Context (July 2026) | BenchLM.ai
- 官方/厂商Introducing Gemma 4 12B: a unified, encoder-free multimodal model
可信度近 3 月 54k+ 下载,由活跃社区贡献者维护并持续更新 GGUF 量化包
完整规格
下载动量
30天下载 127.7k → 130.4k
观测时间线
模型家族
- gemma-4-E2B-it
- 量化 Gemma-4-12B GGUF 合集 (rahul7star)
- 量化 gemma-4-E2B-it-GGUF (LM Studio)