模型 / gemma-4-E4B-it (Google)

gemma-4-E4B-it (Google)

Gemma4-4B-it 量化版, 本地轻量推理

作者 lmstudio-community

~2.4GB 4-bit许可 可商用最近核对 2026-07-22
格式
4-bit
文件
~2.1GB
运行内存
~2.4GB–3.1GB
运行时
llama.cpp
下载
1,229,116

Hugging Face 源仓库 ↗

适合与不适合

入选理由
GGUF格式可直接运行;下载量超百万;量化版本无新能力
对位
对位 Llama-3.2-3B、Phi-3-mini
适合
本地轻量指令跟随与聊天 / 消费级 GPU/CPU 推理
不适合
复杂推理与多语言长文本

独立证据与社区反馈

5 个独立来源 · 另 2 官方/转载最近验证 2026-07-22

社区普遍认为 Gemma 4 的实际体验远超基准分数表现,尤其复杂指令遵循能力出色,能避免常规 AI 模型的冗余废话输出,在小尺寸模型中可靠性突出。

  • 复杂指令遵循:能精确执行多步骤指令而不产生冗余废话(Reddit 社区日常使用一周验证)
  • 边缘/手机端部署:E4B 采用跨层 KV 共享机制,将缓存压缩 83%,专为移动设备低 DRAM 环境设计
  • 本地推理加速:MTP drafter 支持最高 3 倍推理加速,已接入 llama.cpp 和 Ollama
  • 原生音频理解:E4B 小模型原生支持音频输入,扩展了多模态应用场景
  • 商业友好许可:Apache 2.0 协议,可自由商用、微调与分发
  • 本地硬件可运行:从 Android 手机到笔记本 GPU 均可部署,无需云端
  • 128K 上下文窗口:小模型即支持长上下文处理
  • 原生系统提示词支持:新增 system 角色,便于构建结构化对话与可控交互
  • 边缘模型性能换内存:跨层 KV 共享虽大幅降低缓存占用,但引入了额外的 MLP 计算开销
  • 4.5B 有效参数量:相比 31B/26B 大模型在基准测试上有明显差距,复杂任务能力有限
  • E4B 缺乏独立基准数据:多数公开基准得分(如 MMLU 87.1%、Chatbot Arena 排名)均来自 31B/26B 大模型,E4B 实际表现缺乏量化参考

可信度下载 122 万, Google 官方权重, llama.cpp 量化

完整规格

规模
4B · 下载 ~2.1GB · 显存最低 ~2.4GB · 推荐 ~3.1GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp / LM Studio
血统
量化自 gemma-4-E4B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 830.2k → 748.9k · likes +8

观测时间线

模型家族

查看全部家族 →