模型 / Gemma4-Gutenberg-31B-Heretic-mlx-8Bit (ailexleon)

Gemma4-Gutenberg-31B-Heretic-mlx-8Bit (ailexleon)

MLX 8-bit 量化英文创意写作模型,适合故事小说生成

作者 ailexleon

~34GB 8-bit许可 可商用任务 文本生成最近核对 2026-07-05
格式
8-bit
文件
~29GB
运行内存
~34GB–44GB
运行时
MLX_LM
下载
311

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

mlx_lm.generate --model ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit --prompt 'hello'

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Gemma4 文学创作模型的 MLX 8bit 量化版,Apple Silicon 用户可用 mlx-lm 直接运行创作任务,示例清晰。
对位
对位 Qwen2.5-32B 同级参数规模
适合
英文小说/创意写作生成 / 文学风格对话与叙事
不适合
事实性问答或精确指令遵循

独立证据与社区反馈

8 个独立来源 · 另 3 官方/转载最近验证 2026-07-05

Gemma 4 31B 基准表现强劲,以 31B 参数规模匹敌大数十倍的模型,但社区部署反馈两极:推理速度明显慢于 Qwen 3.5,KV 缓存占用大导致同等显存下可用的上下文长度远不及竞品;Heretic 去审查版本在创意写作场景受认可,但 8-bit 量化质量可能不如 4-bit。Apache 2.0 许可被社区视为比跑分更重要的企业友好信号。

  • Heretic 版本通过 ARA 方法移除了 Gemma 4 的安全对齐,实现去审查输出
  • 社区反馈 Gemma 4 在创意写作方面表现更好,Heretic 版本进一步降低了拒绝率
  • Apache 2.0 许可证消除了企业对 Google 使用政策单方面变更的依赖风险
  • 31B 参数规模即可在 Arena AI Elo 上匹敌 600B 级模型,大幅降低了本地运行门槛
  • AIME 数学基准从 Gemma 3 的约 20-29% 跃升至 80% 以上,代际提升显著
  • 已有面向 Apple Silicon 的 MLX 8-bit 量化版本,可在 Mac 上本地运行
  • SWA 机制一定程度上缓解了 KV 缓存膨胀问题
  • 8-bit 量化质量存疑:有测试显示 4-bit 得分与 16-bit 持平(21/23),而 8-bit 反而更低(20/23)
  • 推理速度远慢于 Qwen 3.5:同硬件下仅 11 t/s,Qwen 3.5 可达 60 t/s
  • KV 缓存占用巨大:完整 260K 上下文 fp16 需约 22GB 显存,远不如 Qwen 3.5 紧凑
  • 同等显存下可用上下文远少于 Qwen 3.5(约 20K vs 190K)
  • Google AI Studio 托管的 Gemma 4 版本被社区评价为体验很差
  • 有用户认为 Gemma 4 在非编程任务上完全无用

可信度基于 nbeerbower/Gemma4-Gutenberg-31B-Heretic,Apache 2.0,mlx-lm 0.31.2 转换

完整规格

规模
31B · 下载 ~29GB · 显存最低 ~34GB · 推荐 ~44GB · 8-bit(估算)
授权
apache-2.0 · 可商用
框架
mlx
血统
量化自 Gemma4-Gutenberg-31B-Heretic
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 707 → 632

观测时间线