模型 / Bonsai-8B-mlx-1bit (PrismML)

Bonsai-8B-mlx-1bit (PrismML)

Apple Silicon 的 1-bit LLM,端侧极低内存推理

作者 prism-ml

~1.2GB 1-bit许可 可商用任务 文本生成最近核对 2026-07-22
格式
1-bit
文件
~1GB
运行内存
~1.2GB–1.6GB
运行时
mlx
下载
15,022

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
提供Colab在线试用和MLX格式,5分钟可运行;下载量高;端到端1-bit量化,显著降低内存,核心创新。
对位
对位 Qwen3-8B、Llama 3.1 8B 等全精度模型
适合
iPhone/Mac 本地隐私推理 / 移动端及边缘低功耗部署
不适合
需全精度浮点的高敏感任务

独立证据与社区反馈

3 个独立来源 · 另 1 官方/转载最近验证 2026-07-22

社区评价两极分化:部分用户认为这是首个脱离纯研究阶段、实际可用的 1-bit 模型,但也有用户实测认为其回答质量明显不如同体量的常规小模型。

  • 内存占用远低于同尺寸 FP16 模型,可在 Mac/iPhone/iPad 等终端设备上以可用速度本地运行
  • 首个脱离纯研究阶段、实际可用的 1-bit 模型系列,远优于此前微软 BitNet 等仅限研究的方案
  • 在语法约束解码(GBNF grammar)下,工具调用准确率可达 92%,超过同场景下 Granite-4.1-3B、Qwen 等模型
  • 需要 PrismML 维护的 llama.cpp 分支才能加载,不兼容上游 llama.cpp,且该分支版本滞后于上游
  • 无语法约束时工具调用完全不可用,原始输出通过率为 0%
  • 有用户实测认为其回答质量远不如 Gemma-4-E2B(Bonsai 仅比 Gemma 小 29%),且三元版本表现更差

可信度下载量 15k+,平均分 70.5 接近全精度 8B,内存仅 1.28 GB

完整规格

规模
8B · 65k · 下载 ~1GB · 显存最低 ~1.2GB · 推荐 ~1.6GB · 1-bit(估算)
授权
Apache-2.0 · 可商用
框架
mlx / llama.cpp / mlx-swift
血统
量化自 Bonsai-8B-unpacked
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 6.7k → 15.5k · likes +7

观测时间线