模型 / Qwen3.6-27B-NVFP4 (NVIDIA)

Qwen3.6-27B-NVFP4 (NVIDIA)

Qwen3.6-27B NVFP4 量化,面向 vLLM 部署与推理

作者 nvidia

~30GB 8-bit许可 可商用任务 文本生成最近核对 2026-07-08
格式
8-bit
文件
~26GB
运行内存
~30GB–39GB
运行时
VLLM
下载
2,671

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve nvidia/Qwen3.6-27B-NVFP4 --quantization modelopt --max-model-len 262144 --reasoning-parser qwen3

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Qwen3.6-27B的4比特量化版,vlLM一行命令部署,精度接近FP8,显存降2.5倍,适合Hopper/Blackwell用户跑262K长上下文。
对位
对位 Qwen3.6-27B FP8 基础版及同规模开源模型
适合
AI Agent 与工具调用 / 聊天机器人与 RAG 系统
不适合
不适用于安全敏感应用

独立证据与社区反馈

10 个独立来源 · 另 1 官方/转载最近验证 2026-07-08

Qwen3.6-27B-NVFP4 是 NVIDIA 官方量化的 NVFP4 版本,在 DGX Spark 上单卡可跑到 26 tok/s 且多并发至 91.9 tok/s,显著快于 Unsloth 版本;模型体积 21.9 GB 比社区版更小;编码能力被社区验证可在本地替代 Claude Code 进行日常开发。NVFP4 相比 FP8 的质量损失尚待实测评估,且 NVFP4 在 Blackwell 上并不比 FP8 更快。

  • 27B 密集模型在本地可替代 Claude Code 完成脚手架、重构、测试生成等实际编码任务
  • NVFP4 量化将模型体积压缩至 21.9 GB,比 Unsloth 版小 4.5 GB,比 AutoRound MTP BF16 版小 6.7 GB
  • 单卡 DGX Spark 上单会话 26.3 tok/s、4 并发 91.9 tok/s,全面超越 Unsloth 版本
  • RTX 5090 上跑相同 NVFP4 模型可达 122 tok/s
  • 2× RTX 5060 Ti 16GB 消费卡上可运行,边际成本约 $0.010/百万 token
  • 模型在代码生成中解决更多无限循环和输出格式问题
  • Apache 2.0 许可证,可自由商用
  • 可直接用 vLLM 加载推理,无需额外转换
  • NVFP4 相比 FP8 的质量损失尚未被充分验证
  • 需要约 40 GB VRAM,最低需 L40S 48GB 或双卡方案
  • 双 3090 方案占用空间大、发热高
  • DGX Spark 上 35B MoE NVFP4 加推测解码实际仅约 50 tok/s,远低于宣传的 110 tok/s
  • NVFP4 在 Blackwell (SM120) 上并不比 FP8 更快
  • 作为 CLI 编码代理配置(opencode)需要额外调校,不如 Claude Code 开箱即用
  • NVIDIA 版本的 NVFP4 部分不使用 NVFP4 激活,仅做权重量化
  • vLLM 在 16GB 消费卡上内存上限为 16K,长上下文受限

可信度下载量 2671,点赞 168,NVIDIA 官方量化,附带 FP8 vs NVFP4 准确率基准

完整规格

规模
27B · 262k · 下载 ~26GB · 显存最低 ~30GB · 推荐 ~39GB · 8-bit(估算)
授权
Apache-2.0 · 可商用
框架
vllm
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1150.4k → 1572.6k

观测时间线