模型 / NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)

NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)

面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署

作者 nvidia

~49GB 8-bit许可 需自查任务 文本生成最近核对 2026-07-09
格式
8-bit
文件
~43GB
运行内存
~49GB–64GB
运行时
VLLM
下载
47

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
75B参数但仅9.3B活跃,推理效率高,支持1M上下文和Agent任务,需Blackwell/Hopper多卡部署,提供vLLM和Transformers现成示例。
对位
对位 Mixtral-8x7B (活跃 12.9B)
适合
高并发聊天与代理部署 / 推理密集与长上下文任务
不适合
非 Blackwell GPU 低显存设备

完整规格

规模
75B (9.3B active) · 1M · 下载 ~43GB · 显存最低 ~49GB · 推荐 ~64GB · 8-bit(估算)
授权
OpenMDW-1.1 · 需自查
框架
vllm / transformers
工具调用
qwen3_coder 格式
血统
量化自 NVIDIA-Nemotron-3-Super-120B-A12B-BF16
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 41.8k → 54.3k

观测时间线