模型 / Qwen3.6-27B-OptiQ-4bit (mlx-community)

Qwen3.6-27B-OptiQ-4bit (mlx-community)

Apple Silicon的Qwen3.6-27B 4bit混合量化版

作者 mlx-community

~30GB 8-bit许可 可商用任务 文本生成最近核对 2026-06-21
格式
8-bit
文件
~26GB
运行内存
~30GB–38GB
运行时
OPTIQ
下载
16,228

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

optiq serve --model mlx-community/Qwen3.6-27B-OptiQ-4bit --mtp

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
基于Qwen3.6-27B的混合精度4-bit量化版,对Apple Silicon优化,性能略优于均匀4bit,提供OpenAI兼容接口,适合Mac用户本地部署。
对位
均匀4-bit量化版Qwen3.6-27B
适合
Apple Silicon本地推理 / 代码/工具调用/Agent
不适合
非Apple Silicon设备

独立证据与社区反馈

6 个独立来源 · 另 1 官方/转载最近验证 2026-06-21

OptiQ 混合精度量化在几乎不增加体积的前提下全面优于统一 4-bit,是 Mac 上跑 Qwen3.6-27B 的优选方案;模型在 Apple Silicon 上仅需约 17–20 GB 内存即可运行,本地编程能力被社区认为可对标 Claude Code。但 mlx-optiq 框架的开发者身份不透明,部分用户对其可信度存疑。

  • OptiQ 混合精度在各项基准上均优于统一 4-bit,磁盘体积仅增加约 5%
  • 在 M4 (10核) 32GB Mac 上 1k 上下文可达 5.8 tok/s,峰值内存仅 17 GB
  • Qwen3.6-27B 的本地编程能力被多位用户认为可对标 Claude Code
  • MLX 的上下文缓存机制使长对话中响应近乎即时
  • 敏感层自动上浮至 8-bit、鲁棒层保持 4-bit,无需手动调参
  • MLX 格式在编程等重度上下文任务中显著优于 GGUF
  • 模型仅需约 20 GB 内存,在消费级 Mac 上即可运行
  • mlx-optiq 量化框架的开发者身份不明,社区对其可信度存在疑虑
  • MLX 在 LM Studio 中的提示缓存当前已损坏,与量化来源无关
  • GGUF 格式在高上下文窗口下即使在 M5 上仍可能导致系统冻结
  • 32 GB 统一内存是流畅运行的最低要求
  • SVG/图像生成质量不稳定,某些场景下不如 GLM 5.1 等竞品
  • OptiQ 虽开源但代码仅通过 PyPI 分发,仓库和开发过程不透明

可信度下载量16k+,赞27,六项基准超越均匀4-bit,含MTP加速

完整规格

规模
27B · 下载 ~26GB · 显存最低 ~30GB · 推荐 ~38GB · 8-bit(估算)
授权
Apache-2.0 · 可商用
框架
mlx-lm / mlx-optiq
血统
量化自 Qwen3.6-27B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 13.4k → 12.5k · likes +22

观测时间线

模型家族

查看全部家族 →