Gemma-4-31B-QAT-GGUF (unsloth)
Gemma 4 31B 量化图文模型,支持工具调用,本地部署
~19GB 4-bit许可 可商用任务 视觉理解最近核对 2026-07-22
- 格式
- 4-bit
- 文件
- ~16GB
- 运行内存
- ~19GB–24GB
- 运行时
- LLAMA-SERVER
- 下载
- 64,518
快速上手示例
llama-server -hf unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 4 -ngl 999 依赖版本和硬件参数请以源仓库说明为准。
- 格式
- 4-bit
- 文件
- ~16GB
- 运行内存
- ~19GB–24GB
- 运行时
- llama.cpp
- 下载
- 45,613
- 格式
- 4-bit
- 文件
- ~16GB
- 运行内存
- ~19GB–24GB
- 运行时
- llama.cpp
- 下载
- 7,171
适合与不适合
独立证据与社区反馈
31B QAT 量化版内存减半(17GB vs 32GB Q8)且推理速度翻倍,但社区实测质量波动大:长文档与数学表现明显弱于 K-quant,且存在忽略系统提示词问题;整体性价比有吸引力,但生产场景仍有风险。
- 内存减半,17GB vs 32GB(Q8),带宽受限硬件上生成速度翻倍
- QAT 量化相比原始模型约降低 72% 内存占用,接近原始性能
- 更低内存占用允许使用更长的上下文窗口
- 可在 16GB 显存的消费级 GPU 上本地运行较大模型
- Unsloth 的 UD-Q4_K_XL 格式针对 q4_0 精度下降问题做了改进
- Unsloth 自测 top-1 准确率达 96.67% vs BF16
- 社区实测中标准 Q4_0 的 top-1 准确率比 QAT Q4_0 高约 13%(以 Q8_0 为参照)
- 长文档场景下 QAT Q4_0 top-1 准确率仅 28.57% vs Q8_0,远低于 Q4_K_M 的 77%
- Q4_K_M 在所有指标上均优于 QAT Q4_0
- 数学能力明显弱于 Q8 版本
- 存在忽略系统提示词的问题
- 31B 的 MTP assistant 模型效果不佳,接受率偏低
- 社区基准测试的非对等比较使 QAT 实际质量难以定论
- 社区实测Gemma 4 31B QAT Q4 vs standard Q4 — Top1 KLD benchmark results have me confused
- 社区实测Unsloth just dropped MTP GGUF weights for Gemma 4!
- 独立评测Gemma 4 QAT
- 社区实测Gemma 4 QAT GGUFs from Unsloth
- 社区实测Unsloth Gemma 4 QAT MTP assistant models now available
可信度下载量 64k+,基于 Google 官方 QAT 量化,Unsloth 社区维护
完整规格
下载动量
30天下载 298.6k → 283.8k · likes +49