Qwen3.6-27B-OptiQ-4bit (mlx-community)
Apple Silicon的Qwen3.6-27B 4bit混合量化版
仓库标识mlx-community/Qwen3.6-27B-OptiQ-4bit
显存未知许可 可商用任务 文本生成最近核对 2026-08-09
链接指向的配置 不在本页收录的形态里,已显示默认形态(4bit)。
- 运行内存
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 运行时
- OPTIQ
- 下载
- 16,228
仅 safetensors · 无 pickle 加载风险
快速上手示例
optiq serve --model mlx-community/Qwen3.6-27B-OptiQ-4bit --mtp 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
OptiQ-4bit 是 mlx-community 针对 Qwen3.6-27B 的混合精度量化(部分层保留 8bit、部分 4bit),官方称在相同磁盘体积下全面优于均匀 4bit,社区量化讨论中也常把它列为优先尝试对象。底层 Qwen3.6-27B 口碑普遍认可:27B 密集模型被视为本地旗舰,编程/agentic 编码能力超过前代 397B MoE,SWE-bench Verified 77.2%,约 20GB 内存即可部署,被认为是本地开发的甜点位。速度在 Apple silicon 上约 17-18 token/s(M1 Ultra)或接近 30 token/s,llama.cpp 在部分场景反而更快,整体性价比突出,但约 20GB 的内存门槛与配套工具稳定性仍需留意。
- 本地跑旗舰级编码模型:27B 密集模型仅需约 20GB 内存,32GB 的机器即可流畅运行
- 同体积下量化质量优于均匀 4bit:混合精度让部分层保持 8bit,官方六指标能力评分全面胜出
- 离线 agentic 编程:SWE-bench Verified 77.2%,超过前代 397B MoE,Terminal-Bench 可对标 Claude 4.5 Opus
- Apple silicon 上直接走 MLX 生态:mlx_lm 一键加载,免去手动换算量化格式
- 预算有限的本地部署:$800 消费级 GPU 也能跑起来
- 生成速度可用:约 30 token/s 已接近前沿 API 的水平
- 量化选型无需转 GGUF:类似 unsloth 的混合精度思路,但原生兼容 MLX
- OptiQ 系列有实测背书:有用户实测称 OptiQ 量化“极其好”
- 内存门槛约 20GB 起步,并非任意配置都能跑;双 16GB 卡也不一定够
- MLX 不总是最快的推理后端,llama.cpp 在部分场景反而更快
- 密集 27B 生成速度明显低于稀疏 35B-A3B(约 17-18 vs 52 token/s),速度敏感者应选 MoE 形态
- 配套的 oMLX 客户端 UI 在下载或改设置时容易崩溃
- 想用 MTP 功能时需转 llama.cpp/GGUF,MLX 侧缺 16bit 支持
- 针对 Qwen3.6-27B-OptiQ-4bit 的独立第三方基准仍偏少,口碑多来自相邻量化与官方数据
- 社区实测r/LocalLLM on Reddit: M4 Pro 48GB: Qwen3.6-35B-A3B-OptiQ-4bit on top any other options?
- 社区实测r/LocalLLaMA on Reddit: Is mlx-optiq legit? Has anyone tested the new quants for Gemma4/qwen3.6 yet?
- 社区实测r/LocalLLaMA on Reddit: Whats the best Qwen 27B Q8 quant?
- 社区实测Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model | Hacker News
- 社区实测r/LocalLLM on Reddit: Best Qwen3-27B variant for coding? Fine-tunes, LoRAs & config recommendations
- 社区实测r/LocalLLaMA on Reddit: Qwen3.6-27B Quantization Benchmark
- 社区实测r/oMLX on Reddit: What qwen3.6-mtp model should we use?
- 社区实测r/LocalLLM on Reddit: Benchmarks for latest Qwen3.6 models on M1/2 Ultra?
- 独立评测Qwen3.6 27B is the sweet spot for local development - Quesma Blog
- 独立评测Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model
- 独立评测Qwen3.6-27B: 27B Model Beats 397B on Coding (2026)
- 独立评测We ran Qwen3.6-27B on $800 of consumer GPUs, day one. Here's how llama.cpp and vLLM compared, and what each token actually costs. - LLMKube Blog
- 官方/厂商mlx-community/Qwen3.6-27B-OptiQ-4bit · Hugging Face
- 官方/厂商mlx-community/Qwen3.5-27B-OptiQ-4bit · Hugging Face
可信度下载量16k+,赞27,六项基准超越均匀4-bit,含MTP加速
完整规格
下载动量
30天下载 3.7k → 2.8k
观测时间线
模型家族
- Qwen3.6-27B
- LoRA BTL-3 (Bad Theory Labs)
- 量化 Bonsai-27B-mlx-1bit (Prism ML)
- 量化 Qwen3.6-27B (OBLITERATUS)
- 量化 Qwen3.6-27B-GGUF (unsloth)
- 量化 Qwen3.6-27B-MTP-pi-tune (bytkim)
- 量化 Qwen3.6-27B-OptiQ-4bit (mlx-community)
- 量化 Qwen3.6-27B-Uncensored-Aggressive (HauhauCS)
- LoRA Qwen3.6-27b-Fable5 (hotdogs)
- 量化 Qwopus3.6-27B-Fusion (KyleHessling1)
- LoRA Qwopus3.6-27B-v2-MTP-GGUF (Jackrong)
- 量化 Ternary-Bonsai-27B (Prism ML)
- 微调 grug-27b (ProCreations)