模型 / Meta-Llama-3-8B-Instruct-4bit (mlx-community)

Meta-Llama-3-8B-Instruct-4bit (mlx-community)

Llama-3-8B 4-bit版,M系列芯片本地推理

作者 mlx-community

~4.8GB 4-bit许可 限制商用任务 文本生成最近核对 2026-06-21
格式
4-bit
文件
~4.2GB
运行内存
~4.8GB–6.2GB
运行时
PIP
下载
10,500

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

pip install mlx-lm && mlx_lm.generate --model mlx-community/Meta-Llama-3-8B-Instruct-4bit --prompt "hello"

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Llama 3 8B的4bit量化版,可用mlx-lm快速运行,但无新能力,适合苹果用户部署。
对位
对位原始Llama-3-8B-Instruct,适配Mac本地推理
适合
Mac本地聊天与文本生成 / 离线隐私敏感场景
不适合
非Apple Silicon设备(需MLX)

独立证据与社区反馈

4 个独立来源 · 另 2 官方/转载最近验证 2026-06-21

社区普遍认为 MLX 4bit 版 Llama 3 8B 是 Apple Silicon Mac 上最便捷的本地部署方案之一,几行代码即可加载运行;在 MMLU Pro 上质量与 GGUF q4_K_M 基本持平,8GB 内存的 M2 mini 即可跑到约 18.5 tok/s;首次加载内存占用比 GGUF q4_K_M 减少约 30%,适合轻量日常使用和快速原型验证。

  • 在 8GB 统一内存的 M2 mini 上即可流畅运行,部署门槛极低
  • 通过 mlx_lm 库两行代码即可加载和生成,上手简单
  • MLX 4bit 量化在 MMLU Pro 上的质量与 GGUF q4_K_M 基本持平
  • 首次加载时内存占用比 GGUF q4_K_M 减少约 30%
  • 已被 Xinference 收录为内置模型,支持一键部署
  • 基于 Meta 官方 Llama 3 Instruct 直接转换,对话优化表现稳定
  • 在相同硬件上吞吐量低于 gemma-2-9b,尽管参数量更少
  • MMLU Pro 评测结果存在一定的随机波动,单次跑分需谨慎解读

可信度HuggingFace 10.5k下载,81点赞,mlx-community官方转换

完整规格

规模
8B · 8k · 下载 ~4.2GB · 显存最低 ~4.8GB · 推荐 ~6.2GB · 4-bit(估算)
授权
llama3 · 限制商用
框架
mlx-lm
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 4.1k → 4.6k · likes +1

观测时间线