模型 / Qwen3.6-35B-A3B-NVFP4 (NVIDIA)

Qwen3.6-35B-A3B-NVFP4 (NVIDIA)

Qwen3.6-35B-A3B FP4量化版,面向vLLM高效推理

作者 nvidia

仓库标识nvidia/Qwen3.6-35B-A3B-NVFP4

显存未知许可 可商用任务 文本生成最近核对 2026-08-09
运行内存
格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
运行时
VLLM
下载
67,020

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --quantization modelopt

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Qwen3.6-35B-A3B的NVFP4量化版,可直接通过vLLM部署,仅为量化重打包,适合有高端GPU的用户。
对位
对位Qwen3.6-35B-A3B BF16
适合
AI Agent系统 / RAG与聊天机器人
不适合
有毒提示或偏见内容生成

独立证据与社区反馈

11 个独立来源 · 另 1 官方/转载最近验证 2026-08-09

社区整体把它当作 Qwen3.6-35B-A3B 的官方 NVFP4 量化:权重从约 67GB 压到 21.9GB,单张 Blackwell GPU 即可运行,配合 Unsloth 的优化量化在 32GB 显存上提速约 1.7 倍,官方基准显示多项指标接近 BF16。但口碑两极:有人认为本地跑编码已接近 Claude,也有人指出 4-bit 相比 FP8 有明显质量损失,且 35B-A3B 本体被反馈指令跟随偏弱,社区对 27B 的整体口碑反而更好。

  • 把约 67GB 的权重压缩到 21.9GB,单张 Blackwell GPU 即可运行,显著降低硬件门槛
  • 减少 GPU 显存与磁盘占用,可直接配合 vLLM 部署,官方基准多项指标接近 BF16
  • Unsloth 的优化 NVFP4 量化让 35B-A3B 在 32GB 显存上提速约 1.7 倍(27B 约 2.5 倍),缓解该模型偏慢的痛点
  • FP8 KV cache 校准把可用上下文长度提升到两倍,适合长上下文任务
  • 本地高配机型(M5 Max 128GB)上可流畅跑 35B-A3B 配合 64K 上下文做编码 agent,有用户反馈体验接近 Claude(8-bit 量化)
  • 面向 agentic 编码、仓库级推理与前端工作流,思考模式可开关,并可在多轮对话中保留思考痕迹
  • 4-bit NVFP4 相对官方 FP8 质量下降明显,用户提醒不要仅凭 NVFP4 量化表现下结论,至少 27B 建议跑 FP8
  • 35B-A3B 被部分用户反馈指令跟随弱、容易忘记指令,社区对 27B 的整体口碑更好
  • 有用户认为 35B 及其衍生模型(Nex N2、Ornith 1.0)质量达不到其工作需求
  • 35B 基础模型本身偏慢,是该用户眼中的主要问题
  • 基准与部署存在坑:需要 nightly vLLM 和特定后端,会碰到报错与崩溃,有人花了三天排错
  • 编码场景仍被多数人认为明显不如 Opus 4.7;122B 更接近但速度太慢
  • 低显存机型可能遇到内存不足(如 M4 Max 64GB)
  • 在翻译、法语文案、新闻深度分析等质量敏感负载上,同系列 27B 被认为更强

可信度67020下载,46赞;FP4量化MMLU Pro 85.0,比BF16仅降0.6

完整规格

规模
35B (激活3B) · 262k · 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
授权
Apache 2.0 · 可商用
框架
vllm
血统
量化自 Qwen3.6-35B-A3B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 10100k → 8739.1k · likes +63

观测时间线

模型家族

查看全部家族 →