模型 / Bonsai-8B-mlx-1bit (PrismML)

Bonsai-8B-mlx-1bit (PrismML)

Apple Silicon 的 1-bit LLM,端侧极低内存推理

作者 prism-ml

仓库标识prism-ml/Bonsai-8B-mlx-1bit

~1.2GB 1-bit许可 可商用任务 文本生成最近核对 2026-08-05
格式
1-bit
文件
~1GB
运行内存
~1.2GB–1.6GB
运行时
mlx
下载
15,022

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
提供Colab在线试用和MLX格式,5分钟可运行;下载量高;端到端1-bit量化,显著降低内存,核心创新。
对位
对位 Qwen3-8B、Llama 3.1 8B 等全精度模型
适合
iPhone/Mac 本地隐私推理 / 移动端及边缘低功耗部署
不适合
需全精度浮点的高敏感任务

独立证据与社区反馈

4 个独立来源最近验证 2026-08-05

社区对 Bonsai 8B 评价两极分化:部分用户认可其在小体积下的实际可用性,另一部分用户认为其回答质量远不如传统 8B 模型,存在过度宣传之嫌。

  • 内存占用远低于同尺寸模型,可在消费级 Mac 上流畅运行聊天、文档摘要、工具调用等场景
  • 相比此前仅具研究价值的 MSFT BitNet 模型,Bonsai 具备实际可用性,非纯学术玩具
  • 1.15 GB 的极小体积使其可部署到手机等移动设备
  • 部分用户实测认为其回答质量明显不如 Gemma-4-E2B 等传统精度的 8B 模型
  • MLX 版本的每权重实际比特数为 1.25 bits,高于官方宣称的 1.125 bits,存在额外打包开销
  • 官方声称的「end-to-end 1-bit,无高精度 escape hatch」表述容易引起误解

可信度下载量 15k+,平均分 70.5 接近全精度 8B,内存仅 1.28 GB

完整规格

规模
8B · 65k · 下载 ~1GB · 显存最低 ~1.2GB · 推荐 ~1.6GB · 1-bit(估算)
授权
Apache-2.0 · 可商用
框架
mlx / llama.cpp / mlx-swift
血统
量化自 Bonsai-8B-unpacked
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 10.6k → 9.9k · likes +2

观测时间线