模型 / gemma-4-E2B-it-GGUF (LM Studio)

gemma-4-E2B-it-GGUF (LM Studio)

谷歌 Gemma 4 指令模型 GGUF 量化版,本地高效部署

作者 lmstudio-community

仓库标识lmstudio-community/gemma-4-E2B-it-GGUF

显存未知许可 可商用最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
llama.cpp
下载
267,289

Hugging Face 源仓库 ↗

适合与不适合

入选理由
GGUF格式可直接在LM Studio/Ollama使用,下载量26万,社区认可度高;但仅是量化重打包,无新能力。
对位
对位 Qwen2.5-3B、Llama-3.2-3B
适合
本地代码生成与补全 / 轻量级聊天机器人原型开发
不适合
高精度复杂推理任务

独立证据与社区反馈

12 个独立来源 · 另 1 官方/转载最近验证 2026-08-09

Gemma 4 E2B 是小体量模型中的黑马,在手机和笔记本上能以可观速度运行,推理链短于同量级竞品,一次性编程能力亮眼。GGUF 版本在 LM Studio 中兼容良好,但默认设置和量化选择对实际体验影响很大。

  • E2B 体积紧凑,适合手机和笔记本端本地部署
  • 推理速度快,在 RTX 3060 上约 40 tokens/s
  • GGUF 版本在 LM Studio 中可直接加载使用
  • 推理时间明显短于同体量 Qwen3.5-4B,而质量不输甚至更好
  • 一次性编程(one-shot coding)表现接近 GPT-5.2 和 Gemini 3 Pro
  • 翻译能力(非中文方向)在 Google 系列模型中一贯出色
  • E2B/E4B 版本审查极宽松,几乎无安全限制
  • MTP 支持使本地编程代理实际速度提升明显
  • LM Studio 默认设置会关闭推理链(reasoning/thinking),需手动开启
  • MLX 版本在 LM Studio 中不进入 thinking 阶段,仅 GGUF 版本正常
  • q6_k 量化下视觉质量不优于 e2b,音频则完全不可用
  • 代码生成偶有低级语法错误,如多余括号、用逗号分隔函数定义
  • 在 agentic coding 和非编程基准测试中表现不佳
  • 同硬件下速度略慢于 Qwen3.5
  • E2B/E4B 上下文窗口仅 128K,小于高配版本的 256K
  • Unsloth 版 GGUF 偶有加载失败,lmstudio-community 版更稳定

可信度HuggingFace 下载量超 26 万,谷歌官方模型,LM Studio 团队量化

完整规格

规模
权重格式未知,无法估算显存
授权
apache-2.0 · 可商用
框架
llama.cpp / LM Studio / ollama
血统
量化自 gemma-4-E2B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 136.9k → 118.2k

观测时间线

模型家族

查看全部家族 →