Nemotron-3-Nano-Omni-30B-A3B (NVIDIA)
NVIDIA 多模态推理模型 GGUF 量化版,本地推理用
~18GB 4-bit最近核对 2026-07-22
- 格式
- 4-bit
- 文件
- ~16GB
- 运行内存
- ~18GB–23GB
- 运行时
- LLAMA-SERVER
- 下载
- 168,900
快速上手示例
llama-server -hf lmstudio-community/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-GGUF 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
社区普遍认可其多模态理解和长上下文/高吞吐为亮点,但代码生成与格式化输出仍不稳定
- 本地可运行极高上下文窗口(256K-1M tokens),单张消费级显卡即可完整加载
- 原生多模态理解(图像/视频/音频/文本),在媒体识别任务上表现突出
- 推理速度相比同级30B模型显著更快,吞吐量更高
- 仅3B参数激活,25GB RAM即可运行,显存需求远低于同类模型
- 代码生成能力弱,时间戳和格式化输出频繁出错或陷入循环
- 对 token 上限敏感,需手动限制 max_tokens 约4000 以防止失控输出
- 官方宣称的4x速度提升在社区实测中存在夸大,实际增益有限
- 合成数据训练痕迹较重,可能影响部分任务的泛化表现
- 独立评测Nvidia Nemotron 3 Nano Omni - Full Test and Review
- 独立评测NVIDIA Nemotron 3 Nano Omni: Full Review, Benchmarks & How to Run (2026)
- 社区实测Nemotron 3 Nano 30B is Amazing! (TLDR)
可信度HuggingFace 168900 下载,LM Studio 社区精选
完整规格
下载动量
30天下载 103.4k → 92.4k · likes +1