指南 / 向量嵌入模型

向量嵌入模型

共 11 个 · 数据更新于 2026-09-04

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

  • all-MiniLM-L6-v2 (sentence-transformers)

    量化自 MiniLM-L6-H384-uncased

    英文句子/短段落向量化,用于语义搜索与聚类

    参数量
    22.7M
    商用
    可商用

    当前运行配置 sentence-transformers/all-MiniLM-L6-v2

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    256 word pieces
    国内可达
    需代理
  • WeMM-Embedding-9B (Tencent)

    微调自 Qwen3.5-9B

    腾讯多模态嵌入模型,支持文本/图像/视频编码,输出 4096 维向量

    参数量
    9B
    商用
    可商用

    当前运行配置 tencent/WeMM-Embedding-9B

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve tencent/WeMM-Embedding-9B --runner pooling
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • 多语言嵌入,支持稠密/稀疏/多向量检索,8k上下文

    商用
    可商用

    当前运行配置 BAAI/bge-m3

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    缺少可用的参数量依据,无法估算显存
    许可证
    MIT
    上下文
    8192
    国内可达
    需代理
  • 轻量级Kimi-K3测试版,保留混合注意力MoE,用于特征提取开发

    参数量
    0.40B
    商用
    可商用

    当前运行配置 inference-optimization/Kimi-K3-0.40B

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • Nemotron-3-Embed-1B-NVFP4 (NVIDIA)

    量化自 Nemotron-3-Embed-1B-BF16

    多语言文本嵌入,NVFP4 量化,专为 RAG 和检索设计

    参数量
    1.14B
    商用
    需自查

    当前运行配置 nvidia/Nemotron-3-Embed-1B-NVFP4

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve nvidia/Nemotron-3-Embed-1B-NVFP4
    为何暂无估算
    格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
    许可证
    OpenMDW-1.1
    上下文
    32k
    国内可达
    需代理
  • 多语言文本嵌入模型,面向RAG检索与语义搜索。

    参数量
    8B
    商用
    需自查

    当前运行配置 nvidia/Nemotron-3-Embed-8B-BF16

    显存
    ~17GB BF16(估算)
    查看详情
    查看运行方式
    vllm serve nvidia/Nemotron-3-Embed-8B-BF16
    许可证
    OpenMDW-1.1
    上下文
    32768
    国内可达
    需代理
  • Nemotron-3-Embed-1B (NVIDIA)

    微调自 Ministral-3-3B-Instruct-2512

    多语言文本嵌入模型,用于语义搜索与 RAG

    参数量
    1.14B
    商用
    需自查

    当前运行配置 nvidia/Nemotron-3-Embed-1B-BF16

    显存
    ~2.4GB BF16(估算)
    查看详情
    查看运行方式
    vllm serve nvidia/Nemotron-3-Embed-1B-BF16
    许可证
    OpenMDW-1.1
    上下文
    32768
    国内可达
    需代理
  • LFM2.5-ColBERT-350M (LiquidAI)

    微调自 LFM2.5-350M-Base

    11 语言 ColBERT 检索模型,专为短文本 RAG 设计

    参数量
    350M
    商用
    需自查

    当前运行配置 LiquidAI/LFM2.5-ColBERT-350M

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    llama-server -hf LiquidAI/LFM2.5-ColBERT-350M-GGUF --embeddings -ngl 99 (需先下载 GGUF 文件)

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    LFM Open License v1.0
    上下文
    32k
    国内可达
    需代理
  • LFM2.5-Embedding-350M (LiquidAI)

    微调自 LFM2.5-350M-Base

    11语种双编码器,面向端侧语义检索

    参数量
    350M
    商用
    需自查

    当前运行配置 LiquidAI/LFM2.5-Embedding-350M

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    llama-server -hf LiquidAI/LFM2.5-Embedding-350M-GGUF (需安装llama.cpp)

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    lfm1.0
    上下文
    32k
    国内可达
    需代理
  • 面向数学证明的语义搜索嵌入模型,用于查找 mathlib 定理

    参数量
    8.2B
    商用
    可商用

    当前运行配置 delta-lab-ai/lean-finder

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    sentence-transformers SentenceTransformer('delta-lab-ai/lean-finder')

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • 多模态嵌入模型,支持文本/图像/视频/音频

    参数量
    1.74B
    商用
    不可商用

    当前运行配置 jinaai/jina-embeddings-v5-omni-small

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    vllm serve jinaai/jina-embeddings-v5-omni-small --trust-remote-code --hf-overrides '{"task":"retrieval"}'

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    cc-by-nc-4.0
    上下文
    32768
    国内可达
    需代理

常见坑

  • 2.8T 参数规模超出个人硬件承载能力,本地推理不可行 —— inference-optimization/Kimi-K3-0.40B
  • 实测输出速度约 62 tok/s,低于同价位中位数 72.7 tok/s —— inference-optimization/Kimi-K3-0.40B
  • 在 UK AISI/CAISI 网络攻防评估中显著落后于前沿模型 —— inference-optimization/Kimi-K3-0.40B
  • 训练依赖出口级 Nvidia 芯片及未公开的替代 GPU,算力受限 —— inference-optimization/Kimi-K3-0.40B
  • 实际可行访问方式仅限于 API,本地推理不现实 —— inference-optimization/Kimi-K3-0.40B
  • 社区讨论度和实际采用率低,远不如 Gemma 和 Qwen 常见 —— nvidia/Nemotron-3-Embed-1B-NVFP4
  • 最大输入长度 32K token,长文档场景受限 —— nvidia/Nemotron-3-Embed-1B-NVFP4
  • 使用 OpenMDW-1.1 协议,非标准开源许可证 —— nvidia/Nemotron-3-Embed-1B-NVFP4
展开其余 5 条
  • 混合架构(Transformer + Mamba-2)在非 NVIDIA 芯片(如 Cerebras/Groq)上编译部署较为困难 —— nvidia/Nemotron-3-Embed-8B-BF16
  • 与 8B 版本相比,在 RTEB(72.38 vs 78.46)和 MMTEB(71.04 vs 75.45)等检索基准上仍有可感知的精度差距 —— nvidia/Nemotron-3-Embed-1B-BF16
  • 评测序列长度限定为 4096 tokens,更长上下文场景下的表现未覆盖 —— nvidia/Nemotron-3-Embed-1B-BF16
  • 使用时需注意非对称的query:和document:前缀,集成时不可忽略 —— LiquidAI/LFM2.5-Embedding-350M
  • Ollama端更新llama.cpp依赖偏慢,Ollama用户可能无法及时获得最新支持 —— LiquidAI/LFM2.5-Embedding-350M

收藏本页,或 订阅 RSS 追踪每日更新。