模型 / Qwen3.5-9B-MTP-GGUF (unsloth)

Qwen3.5-9B-MTP-GGUF (unsloth)

Qwen3.5-9B 多模态模型,MTP 投机解码,本地快速运行

作者 unsloth

~5.4GB 4-bit许可 可商用任务 视觉理解最近核对 2026-06-21
格式
4-bit
文件
~4.7GB
运行内存
~5.4GB–7GB
运行时
CMD
下载
53,048

Hugging Face 源仓库 ↗

快速上手示例

./llama.cpp/build/bin/llama-server -hf unsloth/Qwen3.5-9B-MTP-GGUF:UD-Q4_K_XL -ngl 99 -fa on --spec-type draft-mtp

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
GGUF直接可用但需编译llama.cpp;下载量5万+;仅为量化重打包,基础模型虽新但本仓库未增新能力。
对位
官方 Qwen3.5-9B Transformers 版本
适合
多模态图像理解与文档分析 / 本地 Agent 工具调用场景
不适合
多进程推理或 mmproj 场景

独立证据与社区反馈

5 个独立来源 · 另 1 官方/转载最近验证 2026-06-21

Unsloth 的 Qwen3.5-9B GGUF 量化版本相比官方版本推理速度更快,12GB 显存即可流畅运行且延迟良好;量化鲁棒性强,TQ1_0 等低比特量化几乎无损保留原始精度,但 MMLU Pro 等世界知识类基准上仍有明显退化。

  • 12GB 显存即可部署,延迟表现良好
  • Unsloth 版本推理速度优于 lm-studio 及官方版本
  • TQ1_0 量化几乎无损保留原始模型精度
  • 工具调用和编程性能较此前版本有改进
  • 兼容 llama.cpp、vLLM、SGLang、Unsloth Studio 等多种推理引擎
  • Dynamic 2.0 量化方法进一步降低内存占用
  • MMLU Pro 上退化最明显,世界知识有所损失
  • 量化后模型与原始 16 位版本不完全等同

可信度53048次下载,46点赞,MTP解码提速1.5-2倍,Unsloth Dynamic 2.0量化

完整规格

规模
9B · 262k (可扩展至1M) · 下载 ~4.7GB · 显存最低 ~5.4GB · 推荐 ~7GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp / unsloth
血统
量化自 Qwen3.5-9B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 108.1k → 95.7k · likes +42

观测时间线

模型家族

查看全部家族 →