模型 / gemma-4-26B-A4B-it (Google)

gemma-4-26B-A4B-it (Google)

26B总参/4B活跃的MoE指令模型,面向本地推理

作者 lmstudio-community

~16GB 4-bit许可 可商用最近核对 2026-07-22
格式
4-bit
文件
~14GB
运行内存
~16GB–20GB
运行时
llama.cpp
下载
321,432

Hugging Face 源仓库 ↗

适合与不适合

入选理由
GGUF量化版可直接本地运行;无新能力,仅格式转换。
对位
对位 Llama-3.1-8B、Qwen2.5-7B
适合
本地聊天与指令跟随 / 资源受限环境文本生成
不适合
高精度复杂推理

独立证据与社区反馈

7 个独立来源最近验证 2026-07-22

Gemma 4 26B-A4B 在同体量模型中速度极快,当正常工作时输出质量可媲美 31B 密集版,但社区口碑两极分化严重——部分用户认为它在语言学习和科学问答上表现亮眼,另一部分用户则因代码生成频繁出错和可靠性问题而感到失望。整体来看这是一款上限高但一致性不足的模型,正确的量化版本和部署配置对体验影响极大。

  • 推理速度极快,被社区用户评价为本地尝试过的最快模型之一
  • 语言学习场景表现突出,有用户称为尝试过的最佳语言学习模型
  • 科学问答表现优异,在部分用户实测中未被 Qwen 3.5/3.6 超越
  • 一次性代码生成(one-shot coding)能力强劲,在部分基准测试中得分接近 GPT 5.2 和 Gemini 3 Pro Preview
  • 当正常工作时,盲评得分与 31B 密集版几乎一致(同为 8.82 平均分)
  • 支持完全离线运行,无需网络连接
  • 采用 Apache 2.0 开源协议发布
  • 适合 24GB 显存 GPU 部署,26B 中间型号被推荐为 24GB 显卡的甜点选择
  • 代码生成场景容易出现大量拼写和低级错误,有用户反馈每 2-3KB 文件出现 4-5 个 typo 错误
  • 可靠性不足,在 30 题盲评中 26B-A4B 有 2 题完全报错
  • 工具调用/代码编写场景表现弱于一次性生成,在需要自定义 harness 写代码时性能下降
  • 社区感受分歧明显,有用户直言对该模型有「非常复杂的感受」
  • 选错量化版本或型号会导致体验极差,被评价为「会让你以为模型坏了」
  • 部署体验对设置敏感,存在多个可区分「惊艳」和「为什么这么慢」的配置陷阱
  • 在推理和分析类任务上明显落后于 Qwen 3.5 27B
  • 盲评胜率仅有 13.3%,远低于 Qwen 3.5 27B 的 46.7%

可信度Hugging Face 下载量32.1万,社区点赞24,基于 Google 官方模型GGUF量化

完整规格

规模
26B (4B活跃) · 128k · 下载 ~14GB · 显存最低 ~16GB · 推荐 ~20GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio
血统
量化自 gemma-4-26B-A4B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 66.1k → 52.4k · likes +2

观测时间线

模型家族

查看全部家族 →