模型 / BitCPM-CANN-8B (OpenBMB)

BitCPM-CANN-8B (OpenBMB)

昇腾原生1.58-bit三元LLM,推理内存降6x,保持95.7%性能

作者 openbmb

~2.2GB ternary许可 可商用任务 文本生成最近核对 2026-06-21
格式
ternary
文件
~1.9GB
运行内存
~2.2GB–2.8GB
运行时
transformers
下载
1,202

Hugging Face 源仓库 ↗

适合与不适合

入选理由
支持GGUF和Transformers快速部署,首个昇腾NPU原生1.58-bit训练模型,性能保留超95%。
对位
对位 MiniCPM4 8B 全精度版
适合
昇腾NPU上低内存推理 / 1.58-bit 三元量化研究
不适合
需BF16全精度的场景

独立证据与社区反馈

1 个独立来源 · 另 2 官方/转载最近验证 2026-06-21

独立来源不足,尚未形成社区共识:首个原生 1.58-bit 训练的 Ascend NPU 大模型,社区实测反馈尚少,官方宣称支持端侧部署且兼容标准推理框架

  • 端侧部署:8B 模型可在手机、PC、车载设备上运行
  • 兼容标准推理框架:pseudo-quantized 格式可直接像全精度模型一样使用 Transformers/vLLM/SGLang
  • 社区反馈 safetensors 格式变体尚未提供
  • 模型卡缺少 base_model 元数据标注

可信度11项基准平均保留95.7%全精度性能,推理内存减至1/6,QAT仅多5%训练开销,有GGUF

完整规格

规模
8B · 下载 ~1.9GB · 显存最低 ~2.2GB · 推荐 ~2.8GB · ternary(估算)
授权
apache-2.0 · 可商用
框架
transformers / llama.cpp / ollama
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 2.7k → 1.5k

观测时间线