模型 / Mellum2-12B-A2.5B-Instruct (JetBrains)

Mellum2-12B-A2.5B-Instruct (JetBrains)

直接回答的指令模型,用于交互聊天、代码和工具调用

作者 JetBrains

~7.3GB 4-bit许可 可商用任务 文本生成最近核对 2026-07-22
格式
4-bit
文件
~6.3GB
运行内存
~7.3GB–9.5GB
运行时
VLLM
下载
1,418

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve JetBrains/Mellum2-12B-A2.5B-Instruct --max-model-len 131072

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
JetBrains的MoE模型,Apache-2.0许可,上下文131k,需自行部署。
对位
对位 Ministral 3 14B、Qwen3.5-9B 等指令模型
适合
交互式聊天与代码辅助 / 工具调用与指令跟随
不适合
需显式推理的多步代理流

独立证据与社区反馈

4 个独立来源最近验证 2026-07-22

在消费级 AMD GPU 上推理速度极快,工具调用和编码能力在同规模模型中表现突出。

  • 极低推理延迟:RX 7900 XT 上生成速度 111 t/s,13 万 token 上下文下仍保持 100 t/s 以上
  • 工具调用/代码生成能力强:在 tool_test 任务中超过 gemma4-12b 和 gpt-oss-20b
  • 编码性能接近 Qwen 3.5 9B,但激活参数仅 2.5B
  • ROCM 后端存在硬锁问题,目前仅 Vulkan 后端稳定运行
  • 非编码类任务表现中等(综合评分 8.62/10,部分任务结果一般)

可信度1418下载,48赞;LiveCodeBench v6 37.2%,EvalPlus 78.4%,BFCL v4 44.2%

完整规格

规模
12B (2.5B active) · 131k · 下载 ~6.3GB · 显存最低 ~7.3GB · 推荐 ~9.5GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
vllm / transformers
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 6.3k → 4.5k · likes +8

观测时间线