工具 / oMLX

oMLX

  • cli
  • app

Apple Silicon 上的 LLM 推理服务器,两级 KV 缓存 + 菜单栏管理

oMLX 是专为 Apple Silicon 设计的本地 LLM 推理服务器,基于 Apple MLX 框架。核心机制是两级 KV 缓存:热层在内存、冷层落 SSD (safetensors 格式),前缀命中时从磁盘恢复而非重算,使编码 agent 跨轮次保持低延迟。支持 continuous batching 并发处理请求。通过 OpenAI 和 Anthropic 兼容 API 对外暴露,可直连 Claude Code、OpenClaw、Cursor 等工具。内置 Web 管理面板提供模型下载、聊天和实时监控。提供原生 SwiftUI 菜单栏应用,含应用内自动更新。项目始于 vllm-mlx v0.1.0,在此基础上增加了多模型服务、两级 KV 缓存、VLM 支持、管理面板和菜单栏应用。

社区实测

社区认为 oMLX 在 Apple Silicon 上潜力很大,SSD 持久化 KV cache 是核心亮点,但当前版本仍有许多粗糙边缘和性能取舍。

  • SSD 持久化 KV cache 使后续请求的首 token 延迟从 30-90 秒降至 1-3 秒
  • prompt 解码缓存使超 100K token 的长上下文保持连贯和快速
  • 复用 LM Studio 的模型目录,无需重新下载模型
  • token 生成速度比 llama.cpp 的 Metal 后端慢 3-7 倍
  • agentic 工作流中 65K 上下文窗口容易被快速耗尽
  • spec prefill 和 dflash 功能会破坏 Qwen 3.x 模型的 turboquant 缓存
  • dflash-mlx 在 32K 上下文时性能急剧下降,从最快变为几乎不可用
  • 无法关闭 prompt caching 功能
  • M1 Max 上缺少推荐模型的信息

截至 2026-07-22

brew tap jundot/omlx https://github.com/jundot/omlx && brew install omlx

← 返回工具库