Qwen3.6-35B-A3B-NVFP4 (NVIDIA)
Qwen3.6-35B-A3B FP4量化版,面向vLLM高效推理
仓库标识nvidia/Qwen3.6-35B-A3B-NVFP4
显存未知许可 可商用任务 文本生成最近核对 2026-08-09
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
- 运行内存
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 运行时
- VLLM
- 下载
- 67,020
仅 safetensors · 无 pickle 加载风险
快速上手示例
vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --quantization modelopt 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
社区整体把它当作 Qwen3.6-35B-A3B 的官方 NVFP4 量化:权重从约 67GB 压到 21.9GB,单张 Blackwell GPU 即可运行,配合 Unsloth 的优化量化在 32GB 显存上提速约 1.7 倍,官方基准显示多项指标接近 BF16。但口碑两极:有人认为本地跑编码已接近 Claude,也有人指出 4-bit 相比 FP8 有明显质量损失,且 35B-A3B 本体被反馈指令跟随偏弱,社区对 27B 的整体口碑反而更好。
- 把约 67GB 的权重压缩到 21.9GB,单张 Blackwell GPU 即可运行,显著降低硬件门槛
- 减少 GPU 显存与磁盘占用,可直接配合 vLLM 部署,官方基准多项指标接近 BF16
- Unsloth 的优化 NVFP4 量化让 35B-A3B 在 32GB 显存上提速约 1.7 倍(27B 约 2.5 倍),缓解该模型偏慢的痛点
- FP8 KV cache 校准把可用上下文长度提升到两倍,适合长上下文任务
- 本地高配机型(M5 Max 128GB)上可流畅跑 35B-A3B 配合 64K 上下文做编码 agent,有用户反馈体验接近 Claude(8-bit 量化)
- 面向 agentic 编码、仓库级推理与前端工作流,思考模式可开关,并可在多轮对话中保留思考痕迹
- 4-bit NVFP4 相对官方 FP8 质量下降明显,用户提醒不要仅凭 NVFP4 量化表现下结论,至少 27B 建议跑 FP8
- 35B-A3B 被部分用户反馈指令跟随弱、容易忘记指令,社区对 27B 的整体口碑更好
- 有用户认为 35B 及其衍生模型(Nex N2、Ornith 1.0)质量达不到其工作需求
- 35B 基础模型本身偏慢,是该用户眼中的主要问题
- 基准与部署存在坑:需要 nightly vLLM 和特定后端,会碰到报错与崩溃,有人花了三天排错
- 编码场景仍被多数人认为明显不如 Opus 4.7;122B 更接近但速度太慢
- 低显存机型可能遇到内存不足(如 M4 Max 64GB)
- 在翻译、法语文案、新闻深度分析等质量敏感负载上,同系列 27B 被认为更强
- 社区实测2.5x faster Qwen3.6 NVFP4 Unsloth quants
- 独立评测Best Q4 / NVFP4 model for quality Qwen3.5-27B or alternatives? - DGX Spark / GB10 - NVIDIA Developer Forums
- 社区实测r/LocalLLaMA on Reddit: Qwen3.6-27B vs 35B, I prefer 35B but more people here post about 27B...
- 社区实测r/LocalLLaMA on Reddit: nvidia/Qwen3.6-27B-NVFP4 just dropped
- 社区实测r/LocalLLaMA on Reddit: I'm running qwen3.6-35b-a3b with 8 bit quant and 64k context thru OpenCode on my mbp m5 max 128gb and it's as good as claude
- 社区实测r/LocalLLM on Reddit: I ran Qwen 3.6 locally for 45 days, here are the results
- 独立评测Qwen3.6 - How to Run Locally | Unsloth Documentation
- 独立评测Benchmark Report: unsloth/Qwen3.6-35B-A3B-NVFP4-Fast vs nvidia/Qwen3.6-35B-A3B-NVFP4 - DGX Spark / GB10 Projects - NVIDIA Developer Forums
- 独立评测NVIDIA Qwen3.6-35B-A3B-NVFP4 Guide: FP4 Quantization and vLLM Deployment
- 独立评测Complete Beginner's Guide: How to Benchmark the Qwen3.6-35B-A3B-NVFP4 Model on NVIDIA DGX Spark, Jetson Thor, and Blackwell 6000 Pro...
- 独立评测Qwen3.6-35B-A3B Benchmarks — Compare GPU Performance | Millstone AI
- 转载/仓库sakamakismile/Qwen3.6-35B-A3B-NVFP4 · Hugging Face
可信度67020下载,46赞;FP4量化MMLU Pro 85.0,比BF16仅降0.6
完整规格
下载动量
30天下载 10100k → 8739.1k · likes +63
观测时间线
模型家族
- Qwen3.6-35B-A3B
- 微调 Macaron-V1-Tall (MindLab)
- 量化 Qwen3.6-35B-A3B (AutomatosX)
- 量化 Qwen3.6-35B-A3B (Qwen)
- 量化 Qwen3.6-35B-A3B (andreaborio)
- 量化 Qwen3.6-35B-A3B-Escha-W2 (EschaLabs)
- 量化 Qwen3.6-35B-A3B-GGUF (Unsloth)
- 量化 Qwen3.6-35B-A3B-NVFP4 (NVIDIA)
- 量化 Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)
- 量化 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 量化 Qwen3.6-35B-A3B-VQ (aquaman164)
- 量化 Qwen3.6-35B-A3B-VQ-3.4bpw (TheDrainFlorist)
- 量化 Qwen3.6-35B-A3B-VQ-3.8bpw (TheDrainFlorist)
- 量化 Qwen3.6-35B-A3B-VQ-4.6bpw (TheDrainFlorist)
- 量化 Qwen3.6-35B-A3B-VQ-5.4bpw (TheDrainFlorist)
- 微调 XYZ-Aquila-mini (XYZAILab)