模型 / Qwen3.6-35B-A3B-VQ (aquaman164)

Qwen3.6-35B-A3B-VQ (aquaman164)

MLX VQ量化35B MoE,适合Apple Silicon本地推理

作者 aquaman164

仓库标识aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw

显存未知许可 可商用任务 文本生成最近核对 2026-08-05
运行内存
格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
运行时
mlx
下载
524

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
Qwen3.6-35B-A3B的向量量化版,同尺寸下PPL优于标量量化;需在Apple Silicon上运行自定义Metal内核,提供OpenAI兼容API,适合Mac用户自部署.
对位
对位3B级密集模型
适合
本地日常对话与文本生成 / 资源受限的Apple设备推理
不适合
云端大规模部署或高精度任务

独立证据与社区反馈

10 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

社区普遍认为这是一款当前最强的本地编程模型之一,SWE-bench 73.4% 在同等激活参数量级碾压 Gemma 4,但 chat_template 配置极为敏感,配置错误则 reasoning/tool calling 全面翻车;量化版在困难任务上质量损失明显,且部分用户在 HumanEval 上测得不及上代 Qwen3.5。性价比极高、部署门槛低,进取代正确的配置后是日常编码工作的可靠选择。

  • agentic coding 能力突出,SWE-bench Verified 73.4%,远超 Gemma 4-31B 的 52.0%
  • MCP 工具调用/函数集成能力是 Gemma 4 的两倍以上,MCPMark 37.0% vs 18.1%
  • 部署门槛极低,16GB Mac Mini 即可运行,quantized 后 24GB VRAM 内可装 IQ4XS + Q8 KV cache 加 262K 上下文
  • 多模态能力实用,OmniDocBench 89.9%、VideoMMMU 83.7%,下载 unsloth 的 mmproj 文件即可启用 vision
  • 完全免费开源,模型权重可直接下载,无任何使用成本
  • 日常工作任务可落地,社区用户反馈「get real work done」「no better smaller model」
  • 配置正确(默认 chat_template)时表现顶级,在 opencode 和 pi coding agent 等 harness 中击败 Gemma 4 26B A4B
  • 量化版在困难任务上质量退化严重,Q4_K_M 级别会暴露明显局限,不适合生产环境
  • chat_template 配置极为敏感,沿用 Qwen3.5 的模板会出现 timeout、thinking 失效等大量错误,须用默认配置
  • 部分自测显示 HumanEval / HumanEval+ 得分不及 Qwen3.5,Gemma 4 31B 和 26B-A4B 在该基准上反而更高
  • 低量化版本(q5)在 opencode 中会无限重复输出,基本不可用
  • 量化版 kv cache 在某些配置下性能极差,即使全部可放入 VRAM 也会强制走 CPU 处理
  • 视觉 benchmark 对比数据为厂商自报,第三方独立评测尚未复现,RealWorldQA 差距可疑
  • 上下文增长后推理速度明显变慢
  • 偶有循环输出,需手动停止并重新提示才能继续

可信度首个Apple Silicon上trained-codebook VQ模型,11.53GB,实测66 tok/s

完整规格

规模
35B (3B激活) · 128k · 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
授权
Apache-2.0 · 可商用
框架
mlx
血统
量化自 Qwen3.6-35B-A3B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 126 → 90

观测时间线

模型家族

查看全部家族 →