Qwen3.5-9B-MTP-GGUF (unsloth)
Qwen3.5-9B 多模态模型,MTP 投机解码,本地快速运行
仓库标识unsloth/Qwen3.5-9B-MTP-GGUF
显存未知许可 可商用任务 视觉理解最近核对 2026-08-09
链接指向的配置 不在本页收录的形态里,已显示默认形态(GGUF)。
- 运行内存
- 权重格式未知,无法估算显存
- 运行时
- CMD
- 下载
- 53,048
快速上手示例
./llama.cpp/build/bin/llama-server -hf unsloth/Qwen3.5-9B-MTP-GGUF:UD-Q4_K_XL -ngl 99 -fa on --spec-type draft-mtp 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
Unsloth 的 Qwen3.5-9B MTP GGUF 在低显存部署(Q4_K_L 仅约 6GB)和结构化输出加速上性价比突出,是 MTP 尝鲜的便捷选择;但 9B 及以下尺寸存在多轮对话后输出乱码的可靠性问题,速度上比 Bartowski 量化「笨」但推理更快,q8_0 是社区公认的免费午餐级量化。
- MTP 对结构化输出(编程、JSON、HTML)加速效果显著,优于通用叙事对话
- UD-Q4_K_L / Q4_K_L 量化仅需约 6GB 显存,性能接近原始模型
- Unsloth GGUF 推理速度比 lm-studio 等方案更快
- Unsloth 量化在 KL 散度指标上排名靠前,量化精度有保障
- 可在 Unsloth Studio 中直接加载使用,上手门槛低
- q8_0 量化是社区公认的「免费午餐」级选择,质量损失极小
- 0.8B–9B 尺寸模型在 2–3 轮对话后输出乱码,可靠性存疑
- MTP 对通用叙事/闲聊对话的加速效果不明显
- Unsloth GGUF 比同类量化慢约 30%,且后续回复处理时间更长
- Unsloth Studio 更新后可能导致 MTP 功能突然失效
- Bartowski 量化在输出质量/「聪明程度」上优于 Unsloth 量化
- q4_0 量化质量较差,不推荐使用
- 长上下文会显著降低工具调用性能
- 未启用 MTP 的旧版 GGUF/MLX 中 MTP 层闲置浪费 VRAM
- MLX 模型质量明显不如 GGUF,不推荐使用
- Imatrix 量化虽降低 KLD/PPL,但推理速度会降低 5–10%
- 社区实测r/LocalLLaMA: MTP on Unsloth
- 社区实测r/unsloth: MTP with Gemma-4-12b or Qwen3.5-9b
- 社区实测r/LocalLLaMA: Qwen3.5-9B Unsloth vs lm-studio vs official
- 社区实测r/unsloth: 4-bit Qwen3.6 MTP GGUF cited 70+ websites
- 社区实测r/unsloth: 2-bit Qwen3.6-35B-A3B GGUF is amazing
- 独立评测Qwen3.5 GGUF Benchmarks | Unsloth Documentation
- 社区实测r/unsloth: Qwen3.5 9B GGUF Benchmarks
- 社区实测r/unsloth: Qwen3.6-35B-A3B GGUF Performance Benchmarks
- 社区实测r/LocalLLaMA: Qwen3.6-35B-A3B GGUF from Unsloth is quite a bit slower
- 社区实测r/LocalLLaMA: Qwen3.6-35B-A3B tool calling benchmark
可信度53048次下载,46点赞,MTP解码提速1.5-2倍,Unsloth Dynamic 2.0量化
完整规格
下载动量
30天下载 76.7k → 71.2k · likes +12
观测时间线
模型家族
- Qwen3.5-9B
- 量化 MaralGPT-Mythos-9B (MaralGPT)
- 量化 Qwen3.5-9B (Qwen)
- LoRA Qwen3.5-9B-Atlassian-Q4-mlx (LeanZero)
- 量化 Qwen3.5-9B-MTP-GGUF (unsloth)
- 量化 Qwen3.5-9B-OptiQ-4bit (mlx-community)
- 微调 Qwen3.8-9B (Empero)
- 微调 Qwen3.8-9B-Distill (Empero)
- 微调 Qwythos-9B (Empero)
- 微调 WeMM-Embedding-9B (Tencent)