模型 / Bonsai-27B-mlx-1bit (Prism ML)

Bonsai-27B-mlx-1bit (Prism ML)

1-bit 27B 模型, 可在手机和笔记本本地运行推理

作者 prism-ml

仓库标识prism-ml/Bonsai-27B-mlx-1bit

~4.1GB 1-bit许可 可商用任务 文本生成最近核对 2026-08-05
格式
1-bit
文件
~3.5GB
运行内存
~4.1GB–5.3GB
运行时
MLX_LM
下载
23

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

mlx_lm.generate --model prism-ml/Bonsai-27B-mlx-1bit

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
首个手机可运行的27B推理模型,1-bit量化保留90%性能,适合隐私离线场景,需Apple Silicon或CUDA。
对位
对位 Qwen3.6-27B 及 Gemma-4-31B 的低比特量化版
适合
手机端本地27B推理 / 262K长上下文处理
不适合
复杂智能体编程任务

独立证据与社区反馈

3 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

以 Qwen 为底模的极致压缩方案,首次让 27B 级模型在手机上跑起来,但速度偏慢,创新在压缩效率而非模型本身

  • 将 27B 级模型压缩至 3.9 GB,可在 iPhone 上运行
  • 无损投机解码,验证步骤保证生成结果与标准解码分布一致
  • 手机端实际运行速度偏慢
  • 底模是 Qwen,核心创新在压缩效率而非模型本身
  • 三元版本在质量对比中不敌同体量传统量化 Q2_K_XL

可信度公布15项思维模式基准平均76.11分,保留FP16的89.5%,含详细部署说明

完整规格

规模
27B · 262K · 下载 ~3.5GB · 显存最低 ~4.1GB · 推荐 ~5.3GB · 1-bit(估算)
授权
apache-2.0 · 可商用
框架
mlx / llama.cpp / mlx-swift
血统
量化自 Qwen3.6-27B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1343.1k → 1057.3k · likes +24

观测时间线

模型家族

查看全部家族 →