Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)
Apple Silicon 4-bit MLX混精量化+MTP投机解码
仓库标识mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit
显存未知许可 可商用任务 文本生成最近核对 2026-08-09
链接指向的配置 不在本页收录的形态里,已显示默认形态(4bit)。
- 运行内存
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 运行时
- OPTIQ
- 下载
- 9,077
仅 safetensors · 无 pickle 加载风险
快速上手示例
optiq serve --model mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit --mtp 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
社区口碑分化明显:35B-A3B 以 MoE 架构领跑本地编码基准、在 Apple Silicon 上推理速度突出,OptiQ-4bit 在六指标能力分上全面优于标准均匀 4-bit;但多人反馈它相对 27B 是「更快但质量降级」,在不熟悉的代码上易出低级错误,少数人还遇到死循环/逻辑异常。
- Apple Silicon 上推理速度突出:同一台 M1 Ultra 上 35B 生成约 52 tok/s,27B 只有约 17-18 tok/s,有人实测 35B-A3B 比 27B 快约 3 倍
- 内存门槛低:4-bit 量化体积不到 18GB,32GB 设备即可运行,24GB Mac 也能跑起来
- 低显存也能用:有人在仅 4GB VRAM 的 RTX 2050 上把 35B-A3B 跑了起来,并称「surprisingly fast」
- 本地编码表现领先:SWE-bench Verified 得分 73.4%,社区一度认为它是当前最好的本地编码选择
- OptiQ-4bit 量化质量有据可依:在六指标能力分上全面击败标准均匀 4-bit,同类做法在上一代 35B-A3B 上也同样成立
- 长上下文可用:5090 上 Q6_K + Q4_0 KV 在 123K context 下仍稳定 50 tok/s,双 5060 Ti 在 90K context 下约 21.7 tok/s
- 生态易用:Ollama 上直接用 mlx 优化版,有用户反馈「works really well」
- 不熟悉的代码上容易出低级错误,有用户称 A3B 能在 3-4 次调用内搞坏企业代码库
- 相对 27B 是质量降级:更快、世界知识更多,但质量「a step down」,多人明确表示更偏好 27B
- 4-bit MLX 版有死循环/逻辑异常问题,有用户因此换回更小的 qwen3.5-9b(8bit)反而更顺手
- 基准上知识/技能类指标明显偏弱,虽然社区实际感受与基准常有出入
- 有用户抱怨 35B 干活耗时太久(「why it does code for so long」),体感偏慢
- 消费级 NVIDIA 显存上需要激进量化才能跑,或需多卡并加 --cpu-moe 之类配置
- 社区实测r/LocalLLM on Reddit: M4 Pro 48GB: Qwen3.6-35B-A3B-OptiQ-4bit on top any other options?
- 社区实测r/LocalLLaMA on Reddit: Qwen3.6-35B-A3B-Abliterated-Heretic-MLX-4bit
- 社区实测r/LocalLLM on Reddit: 4bit vs 8bit
- 独立评测Qwen3.6 27B is the sweet spot for local development - Quesma Blog
- 社区实测r/LocalLLaMA on Reddit: Qwen3.6-35b-a3b seems like the best coding model rn
- 社区实测r/LocalLLM on Reddit: Benchmarks for latest Qwen3.6 models on M1/2 Ultra?
- 社区实测r/LocalLLM on Reddit: Is Qwen3.6 still the best for coding and are newer, better versions coming out soon?
- 社区实测r/LocalLLaMA on Reddit: Qwen3.5 family comparison on shared benchmarks
- 社区实测r/LocalLLM on Reddit: Benchmark of Qwen3.6-35B-A3B (BF16) on different NVIDIA Hardware
- 独立评测Qwen 3.6-35B-A3B on Mac: The New #1 Local LLM for Coding — LLMCheck
- 官方/厂商mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit · Hugging Face
- 官方/厂商mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit · Hugging Face
- 转载/仓库Qwen/Qwen3.6-35B-A3B · Is it really better in real world task?
可信度6项基准均分76.78, 超uniform-4bit 1.12, MTP加速1.4×
完整规格
下载动量
30天下载 8.5k → 6.1k · likes +7
观测时间线
模型家族
- Qwen3.6-35B-A3B
- 微调 Macaron-V1-Tall (MindLab)
- 量化 Qwen3.6-35B-A3B (AutomatosX)
- 量化 Qwen3.6-35B-A3B (Qwen)
- 量化 Qwen3.6-35B-A3B (andreaborio)
- 量化 Qwen3.6-35B-A3B-Escha-W2 (EschaLabs)
- 量化 Qwen3.6-35B-A3B-GGUF (Unsloth)
- 量化 Qwen3.6-35B-A3B-NVFP4 (NVIDIA)
- 量化 Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)
- 量化 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 量化 Qwen3.6-35B-A3B-VQ (aquaman164)
- 量化 Qwen3.6-35B-A3B-VQ-3.4bpw (TheDrainFlorist)
- 量化 Qwen3.6-35B-A3B-VQ-3.8bpw (TheDrainFlorist)
- 量化 Qwen3.6-35B-A3B-VQ-4.6bpw (TheDrainFlorist)
- 量化 Qwen3.6-35B-A3B-VQ-5.4bpw (TheDrainFlorist)
- 微调 XYZ-Aquila-mini (XYZAILab)