模型 / Gemma-4-26B-A4B-QAT-GGUF (Unsloth)

Gemma-4-26B-A4B-QAT-GGUF (Unsloth)

Gemma 4 26B MoE 量化版,用于本地图像与文本推理

作者 unsloth

仓库标识unsloth/gemma-4-26B-A4B-it-qat-GGUF

显存未知许可 可商用任务 视觉理解最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
OLLAMA
下载
60,001

Hugging Face 源仓库 ↗

快速上手示例

ollama run unsloth/gemma-4-26B-A4B-it-qat-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Google Gemma 4 26B A4B 的 4bit QAT 量化版,MoE 激活仅 3.8B 参数,支持图像/文本输入和 256K 长上下文,GGUF 格式可直接用 llama.cpp/Ollama 运行,适合多模态推理和中文场景。
对位
替代 Gemma 3 27B,活跃参数仅 3.8B
适合
多模态文本/图像推理 / 256K 长上下文代码与代理
不适合
音频处理及低显存设备

独立证据与社区反馈

11 个独立来源 · 另 1 官方/转载最近验证 2026-08-09

社区整体把它当作「高性价比的全能本地模型」:仅约 3.8B 激活参数却带来接近 31B 级别的质量(12),是同代开源权重里生成/预填充速度最快的之一(4),对比 12B 还快约 1.7 倍(13);语言学习、科学问答和写作创意上口碑很好(1)(5)。但编程输出常被批过于简单粗糙、缺关键细节(2),推理速度也不适合在线实时场景(8),因此更被推荐用于本地部署与原型验证。

  • 语言学习与科学问题问答被用户评为「体验最好的模型」(1)
  • 写作与创意类任务明显更强,社区常把它与「负责编程」的 Qwen 搭配分工(5)
  • 超长上下文稳定:在 245283/262144(94%)的上下文下仍完全可用(0)
  • 消费级 GPU/工作站部署:仅 3.8B 激活参数、近 31B 级质量,计算成本低(12)(15)
  • 同代开源权重中 TG/PP 速度最佳,llama.cpp 下单并发可持续 51.57 t/s(4)(14)
  • 快速原型验证:1.63s TTFT、46.7 t/s 足以在投入生产前验证模型行为(8)
  • 易与本地工具链集成,可经 ACP 接入 Opencode/Zed 做代码审查和小型前端片段(6)
  • 原生函数调用与 system prompt 支持,适合智能体/agentic 任务(15)
  • 编程输出简单粗暴:常给出非常基础、缺失小细节的代码,问题会随时间累积放大,即使给很具体的指令也一样(2)
  • 在线实时场景速度不够:1.63s TTFT 与 46.7 t/s 对 live、面向用户的应用没有竞争力,更偏原型用途(8)
  • 48k 有效上下文在一些后端支持仍较粗糙(4)
  • vLLM 明显慢于 llama.cpp:约 30 t/s 对 51.57 t/s,选对推理后端很重要(14)
  • 内存不足的机器(如低配 M3 Max)无法把上下文扩到实用程度(6)
  • 智能/编程/智能体榜单排名中游:整体智能 #112/393、编程 #60/157、智能体 #139/300(10)
  • 量化版本口碑两极:有用户在特定 Q4_K_M 上体验极差并称「最差模型」,社区建议换用 Bartowski 的量化(1)(3)
  • 共享 GPU 环境下并发扩展的实际效率必然低于理想线性扩展(11)

可信度下载 60k+,基于 Google 官方 QAT 检查点,Unsloth 动态量化

完整规格

规模
25.2B (3.8B active) · 256K · 权重格式未知,无法估算显存
授权
Apache-2.0 (Gemma) · 可商用
框架
llama.cpp / ollama / unsloth
血统
量化自 gemma-4-26B-A4B-it-qat-q4_0-unquantized
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 698.8k → 683.9k · likes +40

观测时间线