Qwen3.6-27B-MTPLX (Youssofal)
Qwen3.6-27B 的 MLX 推理加速版供苹果芯片
~16GB 4-bit许可 可商用任务 文本生成最近核对 2026-06-21
- 格式
- 4-bit
- 文件
- ~14GB
- 运行内存
- ~16GB–21GB
- 运行时
- MTPLX
- 下载
- 44,544
仅 safetensors · 无 pickle 加载风险
快速上手示例
mtplx serve --model Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
Qwen3.6-27B 被社区公认为同规模中编码能力最强的密集模型,SWE-bench 甚至超过自家 35B MoE;MTPLX 在 Apple Silicon 上实现 2×+ 解码加速且无损质量,使其成为首个让用户愿意用于实际工作的本地模型。但长上下文 OOM 和部分场景下输出质量波动仍是短板。
- 旗舰级编码能力可本地运行:SWE-bench 77.2%,超过 35B-A3B 的 73.4%
- 无 MoE 的 VRAM 开销,Q4_K_M 约 15.7 GB 即可装入 24GB 显存
- MTPLX 在 Apple Silicon 上实现 2.24× 解码加速,无外部 drafter、无额外 RAM、无质量损失
- MTPLX 提供一键式部署:自动检测硬件、推荐模型、下载、配置环境
- 适合作为本地编码代理,用户反馈 OpenClaw 配合使用效果良好
- 同时提供 Optimized-Speed (4-bit) 和 Optimized-Quality (8-bit) 两种版本
- 原生支持 262k 上下文,可经 YaRN 扩展至 1,010,000 tokens
- 上下文超过约 65k 时出现 OOM
- MTP 模式下代码质量可能不如使用独立 draft model (Qwen3.5-0.8B)
- SVG 生成效果不佳,与 GLM 5.1 相比明显偏弱
- 数学能力弱于 35B-A3B (AIME 87.8 vs 92.7)
- MTPLX v0.1.0-preview 仅支持 Qwen3-Next-MTP,兼容范围有限
- 即使是 4-bit 量化仍需约 20GB 内存,对 16GB 设备仍有门槛
- 社区实测Qwen3.6-27B: MTP + Optimized KV cache? : r/oMLX - Reddit
- 社区实测Qwen3.6 27B really good? : r/LocalLLaMA - Reddit
- 社区实测MTPLX V1: The Swift App For Running & Creating MLX MTP Models ...
- 社区实测Wow, Qwen3.6-27B is good : r/LocalLLM - Reddit
- 社区实测Qwen3.6-27B Community Variants — The Definitive Guide ... - Reddit
- 社区实测Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model | Hacker News
- 社区实测Qwen3.6-27B MTP inferior to draft-model 3.5-0.8B? - Reddit
- 社区实测Youssof Altoukhi (@Youssofal_) on X
- 独立评测MTPLX Is 2.04× Faster Than MLX — But Is It Really Usable?
- 独立评测Run Qwen3.6 27B 2x Faster on M5 Max — Native MTP ...
- 官方/厂商GitHub - youssofal/MTPLX: 2.24x decode TPS increase On Qwen 3.6 27B @ temp 0.6 | Native MTP Speculative Decoding On Apple Silicon With No External Drafter. · GitHub
- 官方/厂商Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed - Hugging Face
- 官方/厂商Youssofal/Qwen3.6-27B-MTPLX-Optimized-Quality · Hugging Face
可信度HF下载量44k+,M5 Max 上 temp=0.6 实测 63 tok/s
完整规格
下载动量
30天下载 20.1k → 18.1k · likes +9