Qwen3.6-35B-A3B-GGUF (Unsloth)
35B MoE仅3B激活的GGUF量化版,适合本地中文开发
仓库标识unsloth/Qwen3.6-35B-A3B-GGUF
显存未知许可 可商用任务 视觉理解最近核对 2026-08-09
链接指向的配置 不在本页收录的形态里,已显示默认形态(GGUF·unsloth)。
- 运行内存
- 权重格式未知,无法估算显存
- 运行时
- OLLAMA
- 下载
- 2,569,052
快速上手示例
ollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF 依赖版本和硬件参数请以源仓库说明为准。
- 运行内存
- 权重格式未知,无法估算显存
- 运行时
- llama.cpp
- 下载
- 525,946
- 运行内存
- 权重格式未知,无法估算显存
- 运行时
- LLAMA-SERVER
- 下载
- 237,613
快速上手示例
llama-server -hf unsloth/Qwen3.6-35B-A3B-MTP-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 6 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
本地社区整体口碑正面但看法分层:Qwen3.6-35B-A3B 的 Unsloth GGUF 能在 24GB 消费级显卡(3090 Ti/5090)上流畅跑代码任务,配上 MTP 速度可达 ~50 tok/s,量化质量也被认为明显优于前代 Qwen3.5;但同时存在反复被吐槽的点——thinking 模式接代码解释器时经常只写代码不输出、Q8 档在基准上反而不如 Qwen3.5,且同一显存下速度弱于部分第三方量化,不同厂商的量化之间差异不小。
- 本地代码任务在 24GB 显存(3090 Ti、5070 Ti 等)上即可流畅运行,体验接近云端旗舰
- MTP 带来明显提速,单机即可从 ~27 tok/s 提到 ~50 tok/s,低比特量化也能获得 1.4 倍以上加速
- 2-bit 这类低比特量化仍保持可用,有人用 2-bit 量化连续成功完成 30+ 次工具调用
- 量化质量优于前代 Qwen3.5 35B A3B,压缩损失更小
- 支持 Developer Role,可直接用于 Codex、OpenCode 等
- 可跑到约 200k 上下文,Q5 档位被不少用户视为性价比甜点位
- 在只有 64GB 内存、无大显存的机器上也能以 9.5-10 tok/s 运行
- 多档量化可选,Q4 在部分基准实测中观感质量最高
- thinking 模式下配合代码解释器时经常只写完代码就停止、不出最终输出(非 thinking 模式正常)
- Q8_K_XL 档在基准上表现令人失望:解出的测试更少、报错更多,反不如 Qwen3.5
- Q3 档位被用户认为不够可靠
- 同硬件下速度弱于部分第三方量化(实测 23 TK/sec vs 30 TK/sec)
- 推理速度仍明显慢于 Claude Sonnet 4.6
- 知识储备不如更大的 Qwen3 Next 80B,做离线知识库时差距明显
- 不同厂商量化的质量/速度差异大,ByteShape 声称其量化更快更小且保留更多基准分
- 在相同设置下不同量化的失败表现各不相同,质量以观感为准
- 社区实测r/LocalLLaMA on Reddit: unsloth/Qwen3.6-35B-A3B-GGUF has worked very well on my 24GB 3090 Ti for coding. Any recommendations for other models? Also, my perspective as an experienced coder just trying this stuff out now
- 社区实测r/LocalLLaMA on Reddit: Qwen3.6-35B-A3B tool calling benchmark: ByteShape vs. Unsloth GGUFs, KV cache quants & long context performance
- 社区实测r/unsloth on Reddit: 2-bit Qwen3.6-35B-A3B GGUF is amazing! Made 30+ successful tool calls
- 社区实测r/LocalLLaMA on Reddit: Are Unsloth models as good as I read?
- 社区实测r/unsloth on Reddit: Qwen3.6-35B-A3B GGUF Performance Benchmarks.
- 社区实测r/LocalLLM on Reddit: Is Qwen3.6 still the best for coding and are newer, better versions coming out soon?
- 社区实测r/LocalLLaMA on Reddit: Uploaded Unsloth Qwen3.6-35B-A3B UD XL models with MTP grafted, here are the results
- 社区实测r/LocalLLaMA on Reddit: unsloth Qwen3.6-27B-GGUF
- 独立评测Qwen3.6 - How to Run Locally | Unsloth Documentation
- 独立评测Qwen 3.6 35B A3B GGUF Quality Benchmark: unsloth, bartowski, lmstudio-community, ggml-org, mudler, AesSedai compared
- 官方/厂商unsloth/Qwen3.6-35B-A3B-GGUF · Qwen3.6 GGUF Benchmarks
- 官方/厂商unsloth/Qwen3.6-35B-A3B-GGUF · Hugging Face
可信度HuggingFace下载52.5万次,Qwen官方训练,LM Studio量化发布
完整规格
下载动量
30天下载 1284.1k → 1268.1k · likes +63
观测时间线
模型家族
- Qwen3.6-35B-A3B
- 微调 Macaron-V1-Tall (MindLab)
- 量化 Qwen3.6-35B-A3B (AutomatosX)
- 量化 Qwen3.6-35B-A3B (Qwen)
- 量化 Qwen3.6-35B-A3B (andreaborio)
- 量化 Qwen3.6-35B-A3B-Escha-W2 (EschaLabs)
- 量化 Qwen3.6-35B-A3B-GGUF (Unsloth)
- 量化 Qwen3.6-35B-A3B-NVFP4 (NVIDIA)
- 量化 Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)
- 量化 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 量化 Qwen3.6-35B-A3B-VQ (aquaman164)
- 量化 Qwen3.6-35B-A3B-VQ-3.4bpw (TheDrainFlorist)
- 量化 Qwen3.6-35B-A3B-VQ-3.8bpw (TheDrainFlorist)
- 量化 Qwen3.6-35B-A3B-VQ-4.6bpw (TheDrainFlorist)
- 量化 Qwen3.6-35B-A3B-VQ-5.4bpw (TheDrainFlorist)
- 微调 XYZ-Aquila-mini (XYZAILab)