模型 / Ternary-Bonsai-8B (Prism ML)

Ternary-Bonsai-8B (Prism ML)

三元1.58-bit量化8B模型,苹果芯片本地推理

作者 prism-ml

~2.2GB ternary许可 可商用任务 文本生成最近核对 2026-07-22
格式
ternary
文件
~1.9GB
运行内存
~2.2GB–2.8GB
运行时
MLX-LM
下载
16,415

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

mlx-lm generate --model prism-ml/Ternary-Bonsai-8B-mlx-2bit

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
极低比特量化模型,在Apple设备上性能优异且体积极小,但仅支持MLX,非Mac用户不可用。
对位
全精度8B模型(Qwen3-8B等)
适合
苹果设备本地AI助手 / 离线文本生成与隐私保护
不适合
非苹果设备或服务器端部署

独立证据与社区反馈

4 个独立来源最近验证 2026-07-22

社区意见两极分化:一方认为这是首个可用的 1-bit 模型系列,另一方实测后认为实际生成质量不敌同规模的常规小模型,存在「宣传大于实效」的争议。

  • 显著降低内存占用,8B 模型仅需约 1.75 GB,约为 16-bit 模型 1/9(来源 1)
  • 远优于此前仅具研究价值的 MSFT BitNet 等 1-bit 模型,首次做到实际可用(来源 2)
  • 在资源受限的本地设备上提供了可运行的大参数模型选项(来源 2)
  • 需使用 PrismML 的 llama.cpp 分支,无法直接通过官方 llama.cpp 加载(来源 2)
  • 实际生成质量不如同参数规模的常规模型,有用户反馈 Bonsai-8B「比 Gemma-4-E2B 笨得多」(来源 0)
  • 仍依赖 GPU,并未真正实现 1-bit 模型「去除 GPU 瓶颈」的目标(来源 4)
  • Ternary 版本在部分实测中表现反而不如 1-bit 版本(来源 0)

可信度下载16k+,评测均分75.5,白皮书,iPhone 27 tok/s

完整规格

规模
8B · 65k · 下载 ~1.9GB · 显存最低 ~2.2GB · 推荐 ~2.8GB · ternary(估算)
授权
Apache-2.0 · 可商用
框架
mlx / mlx-swift
血统
量化自 Ternary-Bonsai-8B-unpacked
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 7.9k → 16.7k · likes +10

观测时间线