模型 / Meta-Llama-3-8B-Instruct-4bit (mlx-community)

Meta-Llama-3-8B-Instruct-4bit (mlx-community)

Llama-3-8B 4-bit版,M系列芯片本地推理

作者 mlx-community

仓库标识mlx-community/Meta-Llama-3-8B-Instruct-4bit

~4.8GB 4-bit许可 限制商用任务 文本生成最近核对 2026-08-09
格式
4-bit
文件
~4.2GB
运行内存
~4.8GB–6.2GB
运行时
PIP
下载
10,500

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

pip install mlx-lm && mlx_lm.generate --model mlx-community/Meta-Llama-3-8B-Instruct-4bit --prompt "hello"

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Llama 3 8B的4bit量化版,可用mlx-lm快速运行,但无新能力,适合苹果用户部署。
对位
对位原始Llama-3-8B-Instruct,适配Mac本地推理
适合
Mac本地聊天与文本生成 / 离线隐私敏感场景
不适合
非Apple Silicon设备(需MLX)

独立证据与社区反馈

6 个独立来源最近验证 2026-08-09

Llama 3 8B 在发布时是性能亮眼的 8B 开源模型,MMLU 上超越 Mistral 7B 与 Llama 2 70B;mlx-community 的 4bit 量化版在 Apple Silicon 上通过 MLX 后端获得显著速度优势,推理快于 llama.cpp,是本地部署的性价比之选。

  • 8B 模型在 MMLU 上超越 Mistral 7B、Gemma 7B 及 Llama 2 70B 等更大模型 (13)
  • MLX 后端在 Apple Silicon 上推理速度比 llama.cpp 快 20-87%(14B 以下模型)(9)
  • MLX 4bit 量化在 token 处理与生成上分别比 llama.cpp Q4_K_M 快约 1.14x 和 1.12x (2)
  • 4bit 量化为 Apple Silicon 上的质量与体积平衡甜点,量化质量损失仅约 3.3% (9)
  • Llama 3 系列像「海绵」一样易于微调训练,吸收能力好 (5)
  • MLX 原生运行在 Apple Silicon 统一内存上,无需翻译层,吞吐量优于或持平 llama.cpp (10)
  • LM Studio 的 MLX 后端在反复加载/卸载模型后可能出现性能下降,需重启解决 (1)
  • LM Studio 的 MLX 后端偶有生成时进入无限循环的问题 (1)

可信度HuggingFace 10.5k下载,81点赞,mlx-community官方转换

完整规格

规模
8B · 8k · 下载 ~4.2GB · 显存最低 ~4.8GB · 推荐 ~6.2GB · 4-bit(估算)
授权
llama3 · 限制商用
框架
mlx-lm
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 3.9k → 3.2k

观测时间线