模型 / Qwen3.6-27B-MTPLX (Youssofal)

Qwen3.6-27B-MTPLX (Youssofal)

Qwen3.6-27B 的 MLX 推理加速版供苹果芯片

作者 Youssofal

~16GB 4-bit许可 可商用任务 文本生成最近核对 2026-06-21
格式
4-bit
文件
~14GB
运行内存
~16GB–21GB
运行时
MTPLX
下载
44,544

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

mtplx serve --model Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Qwen3.6-27B的MLX 4-bit量化版,专为Apple Silicon优化,通过MTPLX实现推测解码加速(2.24x),提供命令行和兼容API,适合在苹果M系列设备上快速部署。
对位
替代 Qwen3.6-27B 传统 MLX 推理
适合
Apple Silicon 本地代码生成 / 低延迟对话应用
不适合
非苹果芯片设备

独立证据与社区反馈

10 个独立来源 · 另 3 官方/转载最近验证 2026-06-21

Qwen3.6-27B 被社区公认为同规模中编码能力最强的密集模型,SWE-bench 甚至超过自家 35B MoE;MTPLX 在 Apple Silicon 上实现 2×+ 解码加速且无损质量,使其成为首个让用户愿意用于实际工作的本地模型。但长上下文 OOM 和部分场景下输出质量波动仍是短板。

  • 旗舰级编码能力可本地运行:SWE-bench 77.2%,超过 35B-A3B 的 73.4%
  • 无 MoE 的 VRAM 开销,Q4_K_M 约 15.7 GB 即可装入 24GB 显存
  • MTPLX 在 Apple Silicon 上实现 2.24× 解码加速,无外部 drafter、无额外 RAM、无质量损失
  • MTPLX 提供一键式部署:自动检测硬件、推荐模型、下载、配置环境
  • 适合作为本地编码代理,用户反馈 OpenClaw 配合使用效果良好
  • 同时提供 Optimized-Speed (4-bit) 和 Optimized-Quality (8-bit) 两种版本
  • 原生支持 262k 上下文,可经 YaRN 扩展至 1,010,000 tokens
  • 上下文超过约 65k 时出现 OOM
  • MTP 模式下代码质量可能不如使用独立 draft model (Qwen3.5-0.8B)
  • SVG 生成效果不佳,与 GLM 5.1 相比明显偏弱
  • 数学能力弱于 35B-A3B (AIME 87.8 vs 92.7)
  • MTPLX v0.1.0-preview 仅支持 Qwen3-Next-MTP,兼容范围有限
  • 即使是 4-bit 量化仍需约 20GB 内存,对 16GB 设备仍有门槛

可信度HF下载量44k+,M5 Max 上 temp=0.6 实测 63 tok/s

完整规格

规模
27B · 下载 ~14GB · 显存最低 ~16GB · 推荐 ~21GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
mlx / mtplx
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 20.1k → 18.1k · likes +9

观测时间线