模型 / Gemma-4-12B GGUF 合集 (rahul7star)

Gemma-4-12B GGUF 合集 (rahul7star)

Gemma 4 12B/3B GGUF 量化集合,供本地聊天与代码任务

作者 rahul7star

仓库标识rahul7star/gemma-gguf

显存未知许可 需自查最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
LLAMA-CLI
下载
54,549

Hugging Face 源仓库 ↗

快速上手示例

llama-cli -hf rahul7star/gemma-gguf -m model-i-gemma-e4-12b-quality.gguf

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
提供Gemma-4-12B的GGUF量化版,有在线Space可直接试用,适合需要本地部署或快速体验的开发者。
对位
对位 Mistral-Nemo-12B / Llama-3.1-8B
适合
本机聊天与文本生成 / 代码补全与 Python 代理任务
不适合
文本以外的多模态任务

独立证据与社区反馈

7 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

Gemma 4 12B 在消费级硬件上推理速度出色(Q4_K_M 可达 72 tok/s),多模态能力在 12B 规模中属于第一梯队,但代码生成质量参差不齐,Q4 量化下部分用户反馈几乎不可用,整体更适合需要本地多模态推理而非重度编程的场景。

  • 可在 16GB 内存笔记本上本地运行多模态模型,无需专用编码器
  • Q4_K_M 量化在 16GB 显存(RTX 4080 Super)上生成速度达 72.3 tok/s,体验流畅
  • QAT 量化版本在节省 3 倍内存的同时保持接近 BF16 的质量
  • 在 DocVQA、BBEH、GPQA Diamond 等基准上超越参数规模两倍的 Gemma 3 27B
  • 原生支持文本、图像、音频、视频多模态输入,不依赖外部编码器
  • 作为免费开源模型,可替代 GPT-4o Mini / Claude Haiku 等付费 API 完成本地推理任务
  • 相比 Gemma 3 安全对齐更弱,消除拒答更简单,且不再出现大规模激活值问题
  • 支持 120K–250K 上下文窗口,适合长文档和视频理解
  • Q4 量化下代码生成质量极差,有用户反馈「几乎所有任务都出错,无法正确写文件和代码」
  • Q8_0 量化推理速度骤降至 25.2 tok/s,约为 Q4_K_M 的三分之一
  • 多令牌预测(MTP)支持仍在开发中,尚未可用
  • 综合推理能力和成熟度低于 Qwen 3.6 35B 等更大模型,后者「明显更聪明、更快、更全面」
  • 在 BBH(53% vs 87.5%)、MRCRv2(43.4% vs 93.6%)等复杂推理基准上与顶尖模型差距显著

可信度近 3 月 54k+ 下载,由活跃社区贡献者维护并持续更新 GGUF 量化包

完整规格

规模
12B (以及 3B) · 262k · 权重格式未知,无法估算显存
商用
需自查
框架
llama.cpp / ollama
血统
量化自 gemma-4-E2B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 127.7k → 130.4k

观测时间线

模型家族

查看全部家族 →