Nemotron-3-Embed-1B (NVIDIA)
多语言文本嵌入模型,用于语义搜索与 RAG
仓库标识nvidia/Nemotron-3-Embed-1B-BF16
~2.4GB BF16许可 需自查任务 向量嵌入最近核对 2026-08-05
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
- 格式
- BF16
- 文件
- ~2.1GB
- 运行内存
- ~2.4GB–3.1GB
- 运行时
- VLLM
- 下载
- 46,305
仅 safetensors · 无 pickle 加载风险
快速上手示例
vllm serve nvidia/Nemotron-3-Embed-1B-BF16 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
1B 版本以约 5% 的精度损失换取大幅降低的索引延迟和推理成本,被定位为 8B 的高效替代方案,适合高吞吐生产环境。
- 在检索精度仅下降 5% 以内的情况下,显著降低索引延迟和服务成本
- 开源且可商用,可直接用于企业 RAG、代码检索、Agent 记忆等场景
- NVFP4 量化下吞吐量翻倍,精度仅损失 1%
- 与 8B 版本相比,在 RTEB(72.38 vs 78.46)和 MMTEB(71.04 vs 75.45)等检索基准上仍有可感知的精度差距
- 评测序列长度限定为 4096 tokens,更长上下文场景下的表现未覆盖
- 独立评测Fast, accurate retrieval with NVIDIA Nemotron 3 Embed
- 独立评测Frontier Retrieval Accuracy, Practical Deployment: NVIDIA Nemotron 3 ...
- 独立评测NVIDIA Nemotron 3 Embed
- 官方/厂商nvidia/Nemotron-3-Embed-8B-BF16 · Hugging Face
可信度46k 下载 · 60 点赞 · RTEB NDCG@10 72.38
完整规格
下载动量
30天下载 602.8k → 667k · likes +10
观测时间线
模型家族
- Ministral-3-3B-Instruct-2512
- 微调 Nemotron-3-Embed-1B (NVIDIA)