oMLX
Apple Silicon 上的 LLM 推理服务器,两级 KV 缓存 + 菜单栏管理
oMLX 是专为 Apple Silicon 设计的本地 LLM 推理服务器,基于 Apple MLX 框架。核心机制是两级 KV 缓存:热层在内存、冷层落 SSD (safetensors 格式),前缀命中时从磁盘恢复而非重算,使编码 agent 跨轮次保持低延迟。支持 continuous batching 并发处理请求。通过 OpenAI 和 Anthropic 兼容 API 对外暴露,可直连 Claude Code、OpenClaw、Cursor 等工具。内置 Web 管理面板提供模型下载、聊天和实时监控。提供原生 SwiftUI 菜单栏应用,含应用内自动更新。项目始于 vllm-mlx v0.1.0,在此基础上增加了多模型服务、两级 KV 缓存、VLM 支持、管理面板和菜单栏应用。
社区实测
社区认为 oMLX 在 Apple Silicon 上潜力很大,SSD 持久化 KV cache 是核心亮点,但当前版本仍有许多粗糙边缘和性能取舍。
- SSD 持久化 KV cache 使后续请求的首 token 延迟从 30-90 秒降至 1-3 秒
- prompt 解码缓存使超 100K token 的长上下文保持连贯和快速
- 复用 LM Studio 的模型目录,无需重新下载模型
- token 生成速度比 llama.cpp 的 Metal 后端慢 3-7 倍
- agentic 工作流中 65K 上下文窗口容易被快速耗尽
- spec prefill 和 dflash 功能会破坏 Qwen 3.x 模型的 turboquant 缓存
- dflash-mlx 在 32K 上下文时性能急剧下降,从最快变为几乎不可用
- 无法关闭 prompt caching 功能
- M1 Max 上缺少推荐模型的信息
I've jumped over to oMLX. A ton of rough edges but I think it's the future.Show HN: oMLX – SSD-backed KV cache cuts coding agent TTFT from 90s to 1s on MacI need to see these proper harnesses I tried oMLX and OpenCode a few weeks ago a...MLX engine comparison… and oMLX is the top choice.r/oMLX Gaining more and more traction!!!
截至 2026-07-22
brew tap jundot/omlx https://github.com/jundot/omlx && brew install omlx git clone https://github.com/jundot/omlx && cd omlx && pip install -e .