NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)
面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署
~49GB 8-bit许可 需自查任务 文本生成最近核对 2026-07-09
- 格式
- 8-bit
- 文件
- ~43GB
- 运行内存
- ~49GB–64GB
- 运行时
- VLLM
- 下载
- 47
仅 safetensors · 无 pickle 加载风险
快速上手示例
vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
完整规格
下载动量
30天下载 41.8k → 54.3k