gemma-4-12B-it (Google)
12B 多模态模型,支持图文音频输入,本地 GGUF 量化部署
~7.2GB 4-bit许可 可商用任务 视觉理解最近核对 2026-06-21
- 格式
- 4-bit
- 文件
- ~6.3GB
- 运行内存
- ~7.2GB–9.4GB
- 运行时
- llama.cpp
- 下载
- 124
- 格式
- 4-bit
- 文件
- ~6.3GB
- 运行内存
- ~7.2GB–9.4GB
- 运行时
- OLLAMA
快速上手示例
ollama create gemma4:12b -f Modelfile && ollama run gemma4:12b 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
社区整体认为 Gemma 4 12B GGUF 是本地编程场景中一款即开即用的多模态模型,Q4/Q5 量化下速度不错,但部分用户觉得综合体验不如 Qwen,量化越低代码质量下降越明显。
- 仅需 8GB 内存即可本地运行
- Q4_K_M 量化在 4080 Super 上生成速度约 72 t/s
- 通过 llama.cpp 和 mmproj 已支持视觉与音频多模态输入
- QAT 量化可降低约 72% 显存占用且性能接近原版
- 2-bit 量化仅占 4.66 GB 磁盘空间
- Q5_K_XL 量化在本地编程中多数任务可一次通过
- 即插即用,配置缓存和上下文长度后即可接入 PI 框架
- 在 Lua 脚本(Cyberpunk 2077 mod)场景中表现良好
- 有用户打出 4/10 评分并转回使用 Qwen
- 低量化版本可能产生大量语法错误,曾有文件需手动修改 23 处
- Q8_0 量化生成速度骤降至约 25 t/s
- assistant 模型尚无 GGUF 量化版本
- MTP 支持在 llama.cpp 中仍处于开发中
- 30GB 活跃权重的模型推测仅约 10 t/s,交互体验很慢
- 社区实测Gemma 4 12B is out now! : r/unsloth - Reddit
- 社区实测Gemma 4 12B is my new main squeeze : r/LocalLLaMA
- 社区实测Gemma 4 12B GGUF now with vision & audio! : r/unsloth
- 社区实测2-bit Gemma 4 12B GGUF is amazing! (4.66 GB on disk) : r/unsloth
- 独立评测Gemma 4 QAT | Unsloth Documentation
- 社区实测Gemma 4 12B: A unified, encoder-free multimodal model
可信度Google DeepMind 发布,Apache 2.0,78 社区点赞,Unsloth Dynamic 2.0 量化
完整规格
下载动量
30天下载 232.7k → 198.4k · likes +3
观测时间线
模型家族
- gemma-4-12B-it
- 微调 Gemma-4-12B Agentic v2 (yuxinlu1)
- 量化 gemma-4-12B-it (Google)
- 量化 Gemma-4-12B-OBLITERATED (OBLITERATUS)
- 量化 Gemma4-12B-Coder (yuxinlu1)
- 量化 Gemma4-12B-Uncensored (HauhauCS)
- 微调 Grug-12B (kai-os)