Gemma-4-E2B-Heretic (DuoNeural)
Gemma 4 视觉模型 abliteration 版 GGUF 量化
~1.2GB 4-bit许可 限制商用最近核对 2026-06-21
- 格式
- 4-bit
- 文件
- ~1GB
- 运行内存
- ~1.2GB–1.6GB
- 运行时
- llama.cpp
- 下载
- 1,990
适合与不适合
独立证据与社区反馈
Gemma 4 E2B 在 2B 级别里能力突出,原生多模态与函数调用在边缘设备上可用,但官方版安全过滤极激进,社区普遍认为 Heretic/abliterated 变体才是实际可用的版本;abliteration 能有效去除拒答且对基准能力影响不大,E2B 适合极致轻量场景,日常使用推荐上 E4B。
- 原生多模态(文本、图像、视频、音频)集成在单个 2B 模型中,GGUF 量化版附带 mmproj 文件可直接用于视觉/音频推理
- 在树莓派 5 上以 Q4/Q8 运行,非思考模式可达约 5.5 tok/s,文本推理正确率高于同级的 Qwen 3.5 2B
- Heretic ARA/LoRA 消融可有效去除安全拒答,DuoNeural 版 comply rate 达 85%(17/20),13 个 abliterated 变体将 HarmBench ASR 从 32.2% 提升至 82%–100%
- 部分 abliterated 变体在 GSM8K 数学基准上反超官方基础模型
- 函数调用与网页搜索在 2B 规模上可用,且能中途自我纠错
- 发布首日即获 llama.cpp、Ollama、LM Studio、Hugging Face Transformers 等主流工具链支持
- GGUF K_P 量化版已由社区发布,可直接在 llama.cpp/LM Studio 中加载
- 官方版安全过滤极其激进,对急救、生存类基础问题也拒绝回答,被社区评价为“功能上不可用”
- Ollama 加载社区 GGUF 可能需要用户自行调整配置
- 有社区成员质疑 2B 规模是否真正完整支持宣传的“原生多模态(文本、图像、视频、音频)”
- ARA 消融方法仍处于实验阶段,尚未进入 Heretic 的 PyPI 正式版
- E2B 是系列中的轻量型号,多数评测认为 E4B 才是性价比与能力的甜点区
- 社区实测Gemma 4's defenses shredded by Heretic's new ARA method 90 ...
- 社区实测[Appreciation Post] Gemma 4 E2B. My New Daily Driver - Reddit
- 社区实测Benchmarked Gemma 4 E2B vs Qwen 3.5 2B on a Raspberry Pi 5 (Ollama, Q4/Q8, text + vision + thinking mode)
- 社区实测Gemma 4 E4B + E2B Uncensored (Aggressive) — GGUF + K_P ...
- 社区实测13 abliterated Gemma 4 E2B variants, 44 GPU hours, Benchmark ...
- 社区实测Gemma 4 E4B + E2B Uncensored (Aggressive) — GGUF + K_P ...
- 社区实测Gemma-4-E2B's safety filters make it unusable for emergencies
- 独立评测Gemma 4 E2B vs E4B: Which Small Model Should You Pick? | Blog
- 独立评测Gemma 4 E2B vs E4B: The Edge Models That Run Audio and Vision ...
- 转载/仓库DuoNeural/Gemma-4-E2B-Heretic - Hugging Face
- 官方/厂商Gemma 4: Byte for byte, the most capable open models - Google Blog
可信度提供 imatrix 量化,涵盖 IQ1_S 至 Q6_K,Q4_K_M 仅 3.5GB
完整规格
下载动量
30天下载 607 → 364