Qwen3.6-27B-MTPLX (Youssofal)
Qwen3.6-27B 的 MLX 推理加速版供苹果芯片
仓库标识Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed
~16GB 4-bit许可 可商用任务 文本生成最近核对 2026-08-09
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
- 格式
- 4-bit
- 文件
- ~14GB
- 运行内存
- ~16GB–21GB
- 运行时
- MTPLX
- 下载
- 44,544
仅 safetensors · 无 pickle 加载风险
快速上手示例
mtplx serve --model Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
Qwen3.6-27B 被社区普遍视为本地开发/部署的甜点位,而 Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed 是 Apple Silicon 上跑它的主流选择:在 oMLX 下载器中下载量和星数都最高,基线 24.7 t/s,比 LMStudio 下 mlx-community 的 4bit 版本快约 29%,M3 Ultra 上 v2 Optimized Speed 更被实测到 82.8 t/s。编程能力被反复验证能压过 397B 的 MoE 旗舰(SWE-bench Verified 77.2%),同时 Q4_K_M 只要 16-18GB 显存就能跑,性价比突出;不做推理时的社区口碑是「qwen 27b 就是最好的」,但也有「探索代码库/制定计划偏弱、比 Claude 更较劲」的明确差评。
- Apple Silicon 上最快的 Qwen3.6-27B 跑法之一:基线 24.7 t/s,比 LMStudio 下 mlx-community 4bit(17.5 t/s)快约 29%、比其另一档(15.4 t/s)快约 37%
- M 系列 MacBook 上可达 63 tok/s,MLX 原生 MTP 运行时,是 27B 独有的强 MLX 支持
- M3 Ultra + MTPLX v2 Optimized Speed 上被实测到 82.8 t/s
- 低显存门槛:Q4_K_M 只需 16.88GB VRAM,官方宣传也能跑在 18GB VRAM 上
- 密集架构使 MTP 头开销仅约 1GB,实现与部署比 MoE 简单
- 量化取舍成熟:Q4_K_M 保留约 96% 精度、2.3x 速度、一半内存,量化收益明显
- 旗舰级编程表现:SWE-bench Verified 77.2% 超过 397B MoE,Terminal-Bench 匹配 Claude 4.5 Opus
- 在 oMLX 下载器里下载量与星数领先,是社区默认推荐而不是需要解释的选择
- 受 llama.cpp MTP 机制限制:不支持 -np > 1 并行,不支持 --mmproj
- 依赖 llama.cpp PR #22673,对推理框架版本有硬性要求
- agentic 编码强但探索/理解整个代码库、制定计划偏弱,这类任务需要搭配能吞下全上下文的模型
- 使用体验比 Claude 更「较劲」,需要逐步人工引导才出彩
- 多模态与 grounded 任务排名靠后:34 个候选模型里排第 24,54.1/100
- IQ4_XS 量化有已知坑:此前 llama.cpp 的 bug 让 IQ4_XS 量化体积偏大,16GB 显存场景建议用 llama-quantize 默认参数、不要加 --pure
- 社区实测r/oMLX on Reddit: What qwen3.6-mtp model should we use?
- 社区实测r/hermesagent on Reddit: Qwen3.6-27B Community Variants — The Definitive Guide for Limited Hardware
- 社区实测r/LocalLLaMA on Reddit: MTPLX | 2.24x faster TPS | The native MTP inference engine for Apple Silicon
- 社区实测r/LocalLLaMA on Reddit: next best jump from qwen 3.6 27b
- 社区实测It's pretty close already. Check qwen3.6 27b if you haven't already. People are ... | Hacker News
- 独立评测Qwen3.6 27B is the sweet spot for local development - Quesma Blog
- 独立评测Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model
- 独立评测Qwen 3.6 27B Benchmark Deep Dive: The Measured Numbers
- 独立评测Qwen3.6 27B MTPLX Optimized — Hardware Requirements & Compatibility | llmrun
- 独立评测Qwen3.6-27B: 27B Model Beats 397B on Coding (2026)
- 独立评测Evaluating Qwen 3.6 27B: A Complete Benchmarking Case Study
- 独立评测Qwen3.6-27B Benchmarks & Speed (August 2026) | BenchLM.ai
- 社区实测r/LocalLLaMA on Reddit: Qwen3.6-27B Quantization Benchmark
可信度HF下载量44k+,M5 Max 上 temp=0.6 实测 63 tok/s
完整规格
下载动量
30天下载 4.9k → 3.2k · likes +1