模型 / Nemotron-3-Nano-Omni-30B-A3B (NVIDIA)

Nemotron-3-Nano-Omni-30B-A3B (NVIDIA)

NVIDIA 多模态推理模型 GGUF 量化版,本地推理用

作者 lmstudio-community

~18GB 4-bit最近核对 2026-07-22
格式
4-bit
文件
~16GB
运行内存
~18GB–23GB
运行时
LLAMA-SERVER
下载
168,900

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf lmstudio-community/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
GGUF格式可直接在LM Studio/Ollama本地运行,下载量高但仅量化版本,无新能力
对位
对位 3B 激活量的推理模型
适合
本地多模态对话 / 图像理解与推理
不适合
生产级高并发推理

独立证据与社区反馈

3 个独立来源最近验证 2026-07-22

社区普遍认可其多模态理解和长上下文/高吞吐为亮点,但代码生成与格式化输出仍不稳定

  • 本地可运行极高上下文窗口(256K-1M tokens),单张消费级显卡即可完整加载
  • 原生多模态理解(图像/视频/音频/文本),在媒体识别任务上表现突出
  • 推理速度相比同级30B模型显著更快,吞吐量更高
  • 仅3B参数激活,25GB RAM即可运行,显存需求远低于同类模型
  • 代码生成能力弱,时间戳和格式化输出频繁出错或陷入循环
  • 对 token 上限敏感,需手动限制 max_tokens 约4000 以防止失控输出
  • 官方宣称的4x速度提升在社区实测中存在夸大,实际增益有限
  • 合成数据训练痕迹较重,可能影响部分任务的泛化表现

可信度HuggingFace 168900 下载,LM Studio 社区精选

完整规格

规模
30B (3B 激活) · 下载 ~16GB · 显存最低 ~18GB · 推荐 ~23GB · 4-bit(估算)
授权
NVIDIA Open Model Agreement
框架
llama.cpp / ollama / lm-studio
血统
量化自 Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 103.4k → 92.4k · likes +1

观测时间线