模型 / Nemotron-3-Nano-30B-A3B (NVIDIA)

Nemotron-3-Nano-30B-A3B (NVIDIA)

4bit MoE本地运行于Apple Silicon

作者 mlx-community

~33GB 8-bit许可 需自查任务 文本生成最近核对 2026-07-22
格式
8-bit
文件
~29GB
运行内存
~33GB–43GB
运行时
MLX_LM
下载
855

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

mlx_lm.generate --model mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Nemotron 3 Nano的MLX 4-bit量化版,OptiQ混合精度比标准量化质量更高,可在Apple Silicon本地运行文本生成,适合Mac开发者本地部署高性能模型。
对位
对位 Qwen2.5-3B / Llama-3.2-3B
适合
Apple Silicon本地高效推理 / 代码与数学问题求解
不适合
需要高精度BF16的场景

独立证据与社区反馈

2 个独立来源最近验证 2026-07-22

社区讨论极少,仅有的反馈指出该模型在基准测试上不及 GLM 4.7 Flash

  • 采用混合 Mamba-Transformer MoE 架构,每次前向仅激活 3.2B 参数,兼顾长上下文保留与推理延迟
  • 基准测试表现不及 GLM 4.7 Flash

可信度MLX社区855下载,6基准全胜统一4bit量化

完整规格

规模
30B (3B 激活) · 下载 ~29GB · 显存最低 ~33GB · 推荐 ~43GB · 8-bit(估算)
授权
nvidia-open-model-license · 需自查
框架
mlx
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 855 → 767

观测时间线