模型 / Qwen3.6-35B-A3B (Qwen)

Qwen3.6-35B-A3B (Qwen)

三元专家量化版,9.4 GB 全量跑在 16 GB Mac 上

作者 manjunathshiva

~7.7GB ternary许可 可商用任务 文本生成最近核对 2026-07-08
格式
ternary
文件
~6.7GB
运行内存
~7.7GB–10GB
运行时
PIP
下载
414

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

pip install 'turboquant-mlx-full>=0.12.3' && python -m turboquant_mlx.generate --model manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
将35B MoE压缩至9.4GB,可全量驻留16GB Mac并实测10.4 tok/s;创新1.58bit专家量化配合3bit注意力,适合本地聊天、代码生成与文档摘要。
对位
Qwen2.5-3B / Llama-3.2-3B 等 3B 激活模型
适合
本地聊天与问答 / 一次性代码生成与摘要
不适合
Agent 工具链循环与多步代码修复

独立证据与社区反馈

12 个独立来源 · 另 1 官方/转载最近验证 2026-07-08

社区普遍认为 Qwen3.6-35B-A3B 是当前性价比极高的本地编码模型,3B 激活参数跑出接近云端模型的编码效果,在消费级硬件上速度快且 Apache 2.0 开源,但对量化精度和推理参数极其敏感,部分密集小模型在特定任务上反而更强,实际表现因场景波动较大。

  • 在消费级笔记本/MacBook/迷你PC上运行本地大模型编码——MoE 架构专为此类通用硬件设计
  • 配合合适的 agent 脚手架后,本地编码能力可达到与云端模型竞争的水平(Polyglot 78.7%,进入公开前十)
  • 在 RTX 4090 上达到 120+ tokens/s 的高速推理,本地体验流畅
  • SVG 生成质量在笔记本本地运行即可超过 Claude Opus 4.7 云端版本
  • Apache 2.0 开源许可,社区可自由使用、量化和部署
  • SWE-bench Verified 得分 73.4%,在编码基准上大幅领先同量级开源模型
  • 编码基准上以 21 分优势击败 Google Gemma 4 26B A4B
  • 被多位开发者列为日常本地编码首选模型
  • 对量化精度和推理参数极其敏感,参数不对时表现明显下降
  • MoE 的专家激活机制并不像社区预期那样能「解锁」更多模型能力
  • Power Ranking 编码任务仅比上代 Qwen 3.5 同尺寸略好(11/98 vs 10/98),提升有限
  • 在编码任务上被 Qwen 3.5 27B 密集模型大幅超越(26/98 vs 11/98),不属同一级别
  • 知识和技能类基准表现明显弱于其他维度,存在「刷榜」嫌疑
  • SVG 生成在物理合理性/遵循约束方面不如 Claude Opus 4.7
  • 表现不稳定,属于「碰对了参数就很好用」的类型

可信度MMLU-Redux 80.1% (thinking),6 项探针测试全部通过

完整规格

规模
35B (3B 激活) · 下载 ~6.7GB · 显存最低 ~7.7GB · 推荐 ~10GB · ternary(估算)
授权
Apache-2.0 · 可商用
框架
mlx
血统
量化自 Qwen3.6-35B-A3B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1.3k → 2k

观测时间线

模型家族

查看全部家族 →