Gemma-4-E2B-Heretic (DuoNeural)
Gemma 4 视觉模型 abliteration 版 GGUF 量化
仓库标识mradermacher/Gemma-4-E2B-Heretic-i1-GGUF
显存未知许可 限制商用最近核对 2026-08-09
链接指向的配置 不在本页收录的形态里,已显示默认形态(GGUF)。
- 运行内存
- 权重格式未知,无法估算显存
- 运行时
- llama.cpp
- 下载
- 1,990
适合与不适合
独立证据与社区反馈
社区整体把 Gemma 4 E2B 当低配设备上的高性价比日常主力:速度快、吃显存少(约 2B 权重即可跑满速,其余层留在 SSD 几乎不影响速度),老电脑与端侧都能跑;也因此 13 个去审查变体、9 位作者的 Heretic/abliterated 生态很热闹,DuoNeural 正是其中作者之一。口碑分歧主要在工具调用被 Qwen3.5 4B 比下去,以及去审查处理被不少人认为在许多场景反而损伤表现。
- 只需约 2B 权重驻留显存即可跑满速,其余层留在 SSD 也几乎不影响速度,显存门槛极低
- 在配置很差的电脑上也被认为是'真的不错'的小尺寸选项
- 速度是核心卖点:笔记本级 RTX 5090 上 Q8 量化可超过 77 tokens/s
- 原生会拒答的题目,经 ARA 矩阵优化压制后可以正常回答
- Per-Layer Embeddings 等优化专为移动/边缘设备设计,适合手机、笔记本与本地应用
- 支持 128K 上下文
- 开源、免费,可完全本地部署
- 同规格去审查变体多达 13 个、出自 9 位作者,选型空间大
- Heretic/abliterated 处理在许多情况下会损伤表现,社区建议多数场景先靠提示词规避
- 原生 E2B 会以'无法访问实时数据'为由拒绝回答某些问题,这是此类变体存在的原因
- 工具调用可靠性被多用户吐槽,有人因此改用 Qwen3.5 4B
- 比 E4B 更省内存,但 E4B 速度快不了多少却更可靠、能扛更多任务
- 长上下文要拉满需降低量化或把层 offload 到系统内存,速度会明显下降
- 有用户整体观感偏'懒',会直接拒答、不配合
- 社区实测13 个去审查变体评测(含 DuoNeural 与多位 Heretic 作者)
- 社区实测Heretic 新 ARA 方法压制 Gemma 4 拒答
- 社区实测E2B 在老电脑上很好用,还有哪些小尺寸可选
- 社区实测E2B 实测:速度是卖点,E4B 更稳
- 社区实测E2B 太懒还是我太较真(吐槽贴)
- 社区实测去审查变体损伤表现的讨论
- 独立评测E2B 实测速度(Q8 超 77 t/s)
- 独立评测E 系列设计取向与长上下文性能取舍
- 独立评测E2B/E4B 的 128K 上下文说明
- 社区实测E2B 仅需 2B 权重在显存即可满速
- 独立评测E2B 面向最紧内存预算,E4B 换更好质量
- 社区实测开源免费、最小的 E2B/E4B 讨论
可信度提供 imatrix 量化,涵盖 IQ1_S 至 Q6_K,Q4_K_M 仅 3.5GB
完整规格
下载动量
30天下载 155 → 659