模型 / Gemma-4-31B-QAT-GGUF (unsloth)

Gemma-4-31B-QAT-GGUF (unsloth)

Gemma 4 31B 量化图文模型,支持工具调用,本地部署

作者 unsloth

~19GB 4-bit许可 可商用任务 视觉理解最近核对 2026-07-22
格式
4-bit
文件
~16GB
运行内存
~19GB–24GB
运行时
LLAMA-SERVER
下载
64,518

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 4 -ngl 999

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Gemma 4 31B 的 QAT GGUF 版,可直接在 llama.cpp 运行,支持多模态与 256K 长上下文,推理能力强,适合本地部署。
对位
对位 Qwen2.5-VL-32B 与 Llama 4 Scout
适合
多模态图文理解与工具调用 / 256K 长上下文推理
不适合
低延迟纯文本对话(小模型更佳)

独立证据与社区反馈

5 个独立来源最近验证 2026-07-22

31B QAT 量化版内存减半(17GB vs 32GB Q8)且推理速度翻倍,但社区实测质量波动大:长文档与数学表现明显弱于 K-quant,且存在忽略系统提示词问题;整体性价比有吸引力,但生产场景仍有风险。

  • 内存减半,17GB vs 32GB(Q8),带宽受限硬件上生成速度翻倍
  • QAT 量化相比原始模型约降低 72% 内存占用,接近原始性能
  • 更低内存占用允许使用更长的上下文窗口
  • 可在 16GB 显存的消费级 GPU 上本地运行较大模型
  • Unsloth 的 UD-Q4_K_XL 格式针对 q4_0 精度下降问题做了改进
  • Unsloth 自测 top-1 准确率达 96.67% vs BF16
  • 社区实测中标准 Q4_0 的 top-1 准确率比 QAT Q4_0 高约 13%(以 Q8_0 为参照)
  • 长文档场景下 QAT Q4_0 top-1 准确率仅 28.57% vs Q8_0,远低于 Q4_K_M 的 77%
  • Q4_K_M 在所有指标上均优于 QAT Q4_0
  • 数学能力明显弱于 Q8 版本
  • 存在忽略系统提示词的问题
  • 31B 的 MTP assistant 模型效果不佳,接受率偏低
  • 社区基准测试的非对等比较使 QAT 实际质量难以定论

可信度下载量 64k+,基于 Google 官方 QAT 量化,Unsloth 社区维护

完整规格

规模
31B · 256k · 下载 ~16GB · 显存最低 ~19GB · 推荐 ~24GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp
血统
量化自 gemma-4-31B-it-qat-q4_0-unquantized
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 298.6k → 283.8k · likes +49

观测时间线