模型 / gemma-4-12B-it (Google)

gemma-4-12B-it (Google)

12B 多模态模型,支持图文音频输入,本地 GGUF 量化部署

作者 lmstudio-community

~7.2GB 4-bit许可 可商用任务 视觉理解最近核对 2026-06-21
格式
4-bit
文件
~6.3GB
运行内存
~7.2GB–9.4GB
运行时
llama.cpp
下载
124

Hugging Face 源仓库 ↗

适合与不适合

入选理由
Google 最新多模态模型,GGUF格式即下即用。
对位
对位 Qwen2.5-VL-7B / Pixtral 12B
适合
本地多模态聊天 / OCR 与文档理解
不适合
资源受限移动设备

独立证据与社区反馈

6 个独立来源最近验证 2026-06-21

社区整体认为 Gemma 4 12B GGUF 是本地编程场景中一款即开即用的多模态模型,Q4/Q5 量化下速度不错,但部分用户觉得综合体验不如 Qwen,量化越低代码质量下降越明显。

  • 仅需 8GB 内存即可本地运行
  • Q4_K_M 量化在 4080 Super 上生成速度约 72 t/s
  • 通过 llama.cpp 和 mmproj 已支持视觉与音频多模态输入
  • QAT 量化可降低约 72% 显存占用且性能接近原版
  • 2-bit 量化仅占 4.66 GB 磁盘空间
  • Q5_K_XL 量化在本地编程中多数任务可一次通过
  • 即插即用,配置缓存和上下文长度后即可接入 PI 框架
  • 在 Lua 脚本(Cyberpunk 2077 mod)场景中表现良好
  • 有用户打出 4/10 评分并转回使用 Qwen
  • 低量化版本可能产生大量语法错误,曾有文件需手动修改 23 处
  • Q8_0 量化生成速度骤降至约 25 t/s
  • assistant 模型尚无 GGUF 量化版本
  • MTP 支持在 llama.cpp 中仍处于开发中
  • 30GB 活跃权重的模型推测仅约 10 t/s,交互体验很慢

可信度Google DeepMind 发布,Apache 2.0,78 社区点赞,Unsloth Dynamic 2.0 量化

完整规格

规模
12B · 256k · 下载 ~6.3GB · 显存最低 ~7.2GB · 推荐 ~9.4GB · 4-bit(估算)
授权
Apache 2.0 · 可商用
框架
llama.cpp / ollama / transformers
血统
量化自 gemma-4-12B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 232.7k → 198.4k · likes +3

观测时间线

模型家族

查看全部家族 →