工具 / oMLX

oMLX

  • cli
  • app

Apple Silicon 上的 LLM 推理服务器,两级 KV 缓存 + 菜单栏管理

oMLX 是专为 Apple Silicon 设计的本地 LLM 推理服务器,基于 Apple MLX 框架。核心机制是两级 KV 缓存:热层在内存、冷层落 SSD (safetensors 格式),前缀命中时从磁盘恢复而非重算,使编码 agent 跨轮次保持低延迟。支持 continuous batching 并发处理请求。通过 OpenAI 和 Anthropic 兼容 API 对外暴露,可直连 Claude Code、OpenClaw、Cursor 等工具。内置 Web 管理面板提供模型下载、聊天和实时监控。提供原生 SwiftUI 菜单栏应用,含应用内自动更新。项目始于 vllm-mlx v0.1.0,在此基础上增加了多模型服务、两级 KV 缓存、VLM 支持、管理面板和菜单栏应用。

社区实测

社区普遍认为 oMLX 是 Apple Silicon 上最快的 MLX 推理引擎之一,SSD 缓存是核心差异化优势。

  • 在 Apple Silicon Mac 上提供高吞吐 MLX 推理(M4 Pro 上 Qwen 3.5 ~9B 跑出 60 t/s)
  • 通过 paged SSD 缓存支持超出内存的大模型加载
  • spec prefill 和 dflash 在 qwen 3.x 系列上会破坏 turboquant 缓存
  • 模型家族工具调用支持不如 vllm-mlx 广泛

截至 2026-08-23

brew tap jundot/omlx https://github.com/jundot/omlx && brew install omlx

← 返回工具库