Gemma-4-26B-A4B-QAT-GGUF (Unsloth)
Gemma 4 26B MoE 量化版,用于本地图像与文本推理
~15GB 4-bit许可 可商用任务 视觉理解最近核对 2026-06-21
- 格式
- 4-bit
- 文件
- ~13GB
- 运行内存
- ~15GB–20GB
- 运行时
- OLLAMA
- 下载
- 60,001
快速上手示例
ollama run unsloth/gemma-4-26B-A4B-it-qat-GGUF 依赖版本和硬件参数请以源仓库说明为准。
- 格式
- 4-bit
- 文件
- ~14GB
- 运行内存
- ~16GB–20GB
- 运行时
- llama.cpp
- 下载
- 8,334
适合与不适合
独立证据与社区反馈
QAT 版本大幅降低显存占用(约 72%),让 26B-A4B 可在 16GB 消费级 GPU 上本地运行且保持接近原始性能,Unsloth 的 GGUF 量化在 mean KL divergence 全部 22 个尺寸上排名第一。但编程场景默认参数下口碑两极分化,有用户报告大量低级错误,需降低 temperature 使用。
- 显存占用降低约 72%,使 26B-A4B 可在 16GB 消费级 GPU 上本地运行
- 推理速度比全精度快 40-60%,适合消费级/边缘部署
- Unsloth GGUF 量化在全部 22 个模型尺寸的 mean KL divergence 上排名第一,达到 SOTA
- 在接近原始性能的前提下实现约 3 倍内存节省
- 支持文本+图像多模态输入
- 可在 Unsloth Studio 中免费运行和训练
- 提供 MTP assistant models 辅助推理加速
- 支持 llama.cpp、vLLM、SGLang、Transformers 等多种推理框架
- 编程任务在默认 temperature=1.0 下输出充满低级错误,需降至 0.3 或更低
- 有用户称其为'最差的模型',在代码分析任务中给出大量错误建议
- QAT 技术来自 Google,Unsloth 仅做格式转换,非独立改进
- 非 QAT 版 Unsloth Q4_K_XL 中大量 tensor 使用了 q5/q6/q8 精度,可能影响量化一致性
- 社区实测Google releases new Gemma 4 QAT models! : r/unsloth - Reddit
- 独立评测Gemma 4 QAT | Unsloth Documentation
- 社区实测Gemma 4 QAT GGUFs from Unsloth : r/LocalLLaMA - Reddit
- 社区实测QAT variant of Gemma4 26B A4B is not working well for me - Reddit
- 社区实测Unsloth Gemma 4 QAT MTP assistant models now available - Reddit
- 社区实测Gemma-4-26B-A4B-it-UD-Q4_K_M.gguf : IMHO worst model ever ...
- 社区实测Gemma 4 26b-a4b GGUF Performance Benchmarks : r/unsloth
- 社区实测We benchmarked Gemma 4 26B-A4B GGUFs to identify the best ...
- 社区实测Gemma 4 26B-A4B GGUFs: Unsloth Achieves SOTA on Mean KL ...
- 独立评测gemma-4-26B-A4B-it-GGUF: Image-to-Text model - AIModels.fyi
- 官方/厂商unsloth/gemma-4-26B-A4B-it-qat-GGUF · Hugging Face
可信度下载 60k+,基于 Google 官方 QAT 检查点,Unsloth 动态量化
完整规格
下载动量
30天下载 672.5k → 493.3k · likes +116