模型 / Gemma-4-E2B-it (Google)

Gemma-4-E2B-it (Google)

Gemma 4 2B 指令 GGUF,本地推理

作者 lmstudio-community

仓库标识lmstudio-community/gemma-4-E2B-it-QAT-GGUF

显存未知许可 可商用最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
llama.cpp
下载
314

Hugging Face 源仓库 ↗

适合与不适合

入选理由
这个模型是 Google Gemma 4 的 GGUF 量化版,可直接在 LM Studio 或 llama.cpp 本地运行,适合低资源部署,无需自写推理代码。
对位
替代 Gemma 2 2B / Llama 3.2 3B
适合
本地指令跟随 / 移动/边缘设备推理
不适合
长上下文任务

独立证据与社区反馈

6 个独立来源最近验证 2026-08-05

Gemma 4 E2B 是一款 2B 参数的小模型,在 8GB 手机端即可本地运行,部署门槛低(Ollama/LiteRT-LM 一行命令),对齐强度明显弱于 Gemma 3、更容易去审查;但工具调用/搜索极懒、对 system prompt 非常敏感且回答偏短,不要期望其能力超过 7B 级别。

  • 2B 参数即可在 8GB 安卓手机端本地运行,适合移动设备与笔记本
  • 通过 Ollama `ollama pull gemma4:e2b` 或 `uvx litert-lm run` 一行命令即可快速部署
  • 支持文本、图像、音频多模态输入
  • 相比 Gemma 3 对齐强度明显降低,去审查/消除拒答几乎不需要额外处理
  • 不再出现 Gemma 3 的 massive activation 问题,去审查时不再需要 Winsorization 等 hack
  • 支持 JSON 结构化输出
  • 提供 GGUF 格式及 K_P 量化,方便本地推理
  • 可用 ARA(Arbitrary-Rank Ablation)方法进一步去除安全对齐
  • 工具调用/网页搜索方面非常懒惰,默认不搜索,即使显式要求也仅做单次搜索、扫一眼摘要就停止
  • 对 system prompt 极其敏感,需严格逐字指导,否则会按字面理解而缺乏意图推断
  • 回答偏短,在需要详细回复的场景下可能不充分
  • 作为 2B 模型,不要期望其性能超过 7B 级别
  • 去审查版本在长上下文场景下未经充分手动测试,可能存在边缘情况

可信度Google 发布,Apache-2.0 许可证

完整规格

规模
2B · 权重格式未知,无法估算显存
授权
apache-2.0 · 可商用
框架
llama.cpp / LM Studio
血统
量化自 gemma-4-E2B-it-qat-q4_0-unquantized
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 2.9k → 2.8k · likes +1

观测时间线