Llama-2-7b-chat-mlx (mlx-community)
Apple芯片上本地运行的Llama2 7B对话模型
~4.2GB 4-bit许可 限制商用任务 文本生成最近核对 2026-06-28
- 格式
- 4-bit
- 文件
- ~3.7GB
- 运行内存
- ~4.2GB–5.5GB
- 运行时
- mlx
- 下载
- 4,057
适合与不适合
独立证据与社区反馈
MLX 在 Apple Silicon 上的稳态解码速度确实优于 llama.cpp,Ollama 的切换也验证了这条路线;但社区生态(模板维护、模型转换覆盖)明显不如 GGUF 活跃,实际使用中速度宣传有时被夸大,且存在稳定性坑。
- 在 Apple Silicon 上稳态解码速度优于 llama.cpp
- 利用统一内存架构实现 CPU/GPU 零拷贝张量操作
- SSD 缓存比 llama.cpp 更稳定
- 4-bit 量化版本可直接通过 MLX Python API 加载运行
- Ollama 已切换至 MLX 后端,验证了该路线的可行性
- MLX 社区不如 GGUF 活跃,模板修复和量化改进滞后
- 实际使用可能出现崩溃、prompt 缓存缺失、内存压力问题
- 宣传的 token 速度在实际场景中可能被夸大
- mlx-community 模型集合维护不足,部分模型系列只有少量转换
- 权重从 bfloat16 转为 float16 存储,numpy 兼容性受限
- 社区实测Whats up with MLX? : r/LocalLLaMA
- 社区实测Pursuit of performance Llama.cpp to MLX : r/LocalLLaMA - Reddit
- 独立评测Apple MLX vs llama.cpp: Which is Really Faster? (4 Runtimes - Ollama Included)
- 独立评测Apple's MLX Runs Local LLMs 3x Faster Than llama.cpp — Until ...
- 独立评测MLX vs llama.cpp on Apple Silicon: Benchmarks, M5 Neural Accelerators, and Why Ollama Switched
- 官方/厂商mlx-community/Llama-2-7b-chat-4-bit · Hugging Face
可信度HuggingFace下载4057,点赞85,Meta Llama2官方权重转换
完整规格
下载动量
30天下载 3.6k → 3.4k