Qwen3.6-35B-A3B-NVFP4 (NVIDIA)
Qwen3.6-35B-A3B FP4量化版,面向vLLM高效推理
~21GB 8-bit许可 可商用任务 文本生成最近核对 2026-06-21
- 格式
- 8-bit
- 文件
- ~18GB
- 运行内存
- ~21GB–27GB
- 运行时
- VLLM
- 下载
- 67,020
仅 safetensors · 无 pickle 加载风险
快速上手示例
vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --quantization modelopt 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
社区普遍认为 Qwen3.6-35B-A3B 是本地编程场景下速度与质量的最佳折中选择,NVFP4 量化版在 NVIDIA 硬件上部署便捷、推理极快,MoE 架构以接近稠密模型的质量换来了显著更高的吞吐,在 RTX 5090 上可达约 205 tok/s。部分用户反馈编程体验已接近 Claude 等云端闭源模型,但 NVFP4 量化存在质量损失和失控生成的风险。
- 本地编程推理速度极快,RTX 5090 上约 205 tok/s 且支持 125k 上下文
- NVFP4 量化可直接通过 vLLM 部署,降低使用门槛
- MoE 架构在保持接近稠密模型质量的同时大幅提升推理速度
- 在消费级 NVIDIA 硬件(RTX 5090、DGX Spark)上可流畅运行
- 编程体验接近云端闭源模型,有用户称可与 Claude 媲美
- 支持大上下文窗口(125k-250k),适合长代码任务
- 128GB 内存下可容纳模型并留有 256k+ 上下文余量
- NVFP4 量化存在质量损失,可能出现失控生成和退化循环
- 在架构写作等非编程任务上,同系 27B 稠密模型可能更优
- DGX Spark 上更新 vLLM 会遇到依赖冲突,部署有坑
- 稠密模型(27B)在某些任务上质量更好,只是速度不及 MoE
- NVFP4 格式依赖 NVIDIA 硬件和 vLLM,通用性受限
- 社区实测Qwen 3.6 35B A3B on rtx 5090 is absurdly fast for coding
- 社区实测I'm running qwen3.6-35b-a3b with 8 bit quant and 64k context thru OpenCode on my mbp m5 max 128gb and it's as good as claude
- 社区实测I tested Qwen3.6-27B, Qwen3.6-35B-A3B, Qwen3.5-27B and Gemma 4 on the same real architecture-writing task on an RTX 5090
- 社区实测Solved the DGX Spark, 102 stable tok/s Qwen3.5-35B-A3B on a single GB10
- 独立评测What's the best speed we can get with Qwen 3.6 27B without quantizing?
- 独立评测Benchmark Report: Qwen3.6-35B-A3B-NVFP4 on NVIDIA DGX Spark, Jetson Thor, Blackwell 6000 Pro
- 独立评测NVidia NVFP4 vs llama.cpp Q4: Faster Local LLMs But At What Quality?
- 独立评测NVIDIA Releases Qwen3.6-35B-A3B-NVFP4: An FP4 Quantized Version for vLLM Deployment
- 独立评测Best Q4 / NVFP4 model for quality Qwen3.5-27B or alternatives?
- 社区实测Qwen3.5-122B-A10B vs. old Coder-Next-80B: Both at NVFP4
- 社区实测nvidia/Qwen3.6-35B-A3B-NVFP4 · Hugging Face : r/LocalLLaMA
- 官方/厂商nvidia/Qwen3.6-35B-A3B-NVFP4 · Hugging Face
可信度67020下载,46赞;FP4量化MMLU Pro 85.0,比BF16仅降0.6
完整规格
下载动量
30天下载 8582.7k → 8635.9k · likes +182
观测时间线
模型家族
- Qwen3.6-35B-A3B
- 量化 Qwen3.6-35B-A3B (andreaborio)
- 量化 Qwen3.6-35B-A3B (Qwen)
- 量化 Qwen3.6-35B-A3B-GGUF (Unsloth)
- 量化 Qwen3.6-35B-A3B-NVFP4 (NVIDIA)
- 量化 Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)
- 量化 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 量化 Qwen3.6-35B-A3B-VQ (aquaman164)