模型 / Qwen3.6-35B-A3B-GGUF (Unsloth)

Qwen3.6-35B-A3B-GGUF (Unsloth)

35B MoE仅3B激活的GGUF量化版,适合本地中文开发

作者 unsloth

~21GB 4-bit许可 可商用任务 视觉理解最近核对 2026-07-22
格式
4-bit
文件
~18GB
运行内存
~21GB–27GB
运行时
OLLAMA
下载
2,569,052

Hugging Face 源仓库 ↗

快速上手示例

ollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
GGUF格式可直接用LM Studio/Ollama运行,下载量超50万表明社区认可,但仅为量化重打包,非新模型。
对位
对位 Mixtral-8x7B 与 Llama-3-70B 混合专家模型
适合
本地中文对话与代码补全 / 低内存占用(3B激活)的MoE推理
不适合
复杂数学或长链逻辑推理

独立证据与社区反馈

8 个独立来源 · 另 2 官方/转载最近验证 2026-07-22

Unsloth 的量化在同类中排名第一(22 个尺寸中 21 个 KL 散度最优),2-bit 量化仅需 13GB 内存即可运行复杂 agentic 任务,工具调用能力在低比特量化下依然可靠,性价比极高;但 CPU-only 推理速度比同类 GGUF 慢约 30%,且 followup 响应延迟明显更长。

  • 极低硬件门槛:2-bit 量化仅需 13GB RAM 即可运行并完成完整 repo bug 追踪(证据、复现、修复、测试、PR 撰写)
  • 复杂 agentic 工具调用:单次任务完成 30+ 次工具调用、搜索 20 个网站、执行 Python 代码
  • 量化质量 SOTA:Unsloth 量化在 22 个尺寸中的 21 个上以 mean KL divergence 排名第一
  • SVG 生成质量突出:在笔记本上生成的鹈鹕骑自行车 SVG 优于 Claude Opus 4.7
  • 1-bit 量化仍可用的工具调用:即使 1-bit GGUF 下工具调用表现依然很好
  • 大上下文支持:Q4 量化在单张 L4 上支持完整 265k 上下文,峰值 71t/s、150k tokens 后仍保持 35t/s
  • 多框架兼容:支持 llama.cpp、vLLM、SGLang、Transformers、Unsloth Studio、Docker Model Runner 等
  • 优于前代 Qwen3.5:在开放式搜索任务中展现更好的新发现能力
  • CPU-only 推理速度慢约 30%:Unsloth GGUF 在纯 CPU 环境下比同类量化同行的 t/s 低约 30%
  • CPU-only 下 followup 响应延迟高:首次后续响应延迟 25-29 秒,而同类替代方案仅为 14-20 秒
  • CUDA 13.2 兼容性问题:已知在 CUDA 13.2 环境下产生乱码输出

可信度HuggingFace下载52.5万次,Qwen官方训练,LM Studio量化发布

完整规格

规模
35B (3B 激活) · 262k (可扩展至1M) · 下载 ~18GB · 显存最低 ~21GB · 推荐 ~27GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio
血统
量化自 Qwen3.6-35B-A3B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 843.1k → 761.9k · likes +125

观测时间线

模型家族

查看全部家族 →