Mellum2-12B-A2.5B-Instruct (JetBrains)
直接回答的指令模型,用于交互聊天、代码和工具调用
~7.3GB 4-bit许可 可商用任务 文本生成最近核对 2026-07-22
- 格式
- 4-bit
- 文件
- ~6.3GB
- 运行内存
- ~7.3GB–9.5GB
- 运行时
- VLLM
- 下载
- 1,418
仅 safetensors · 无 pickle 加载风险
快速上手示例
vllm serve JetBrains/Mellum2-12B-A2.5B-Instruct --max-model-len 131072 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
在消费级 AMD GPU 上推理速度极快,工具调用和编码能力在同规模模型中表现突出。
- 极低推理延迟:RX 7900 XT 上生成速度 111 t/s,13 万 token 上下文下仍保持 100 t/s 以上
- 工具调用/代码生成能力强:在 tool_test 任务中超过 gemma4-12b 和 gpt-oss-20b
- 编码性能接近 Qwen 3.5 9B,但激活参数仅 2.5B
- ROCM 后端存在硬锁问题,目前仅 Vulkan 后端稳定运行
- 非编码类任务表现中等(综合评分 8.62/10,部分任务结果一般)
- 社区实测Mellum 2 12B A2.5B : r/LocalLLaMA
- 社区实测Jetbrains Mellum 2: a really good and performant model
- 社区实测JetBrains Releases Mellum2: A 12B MoE Model for Fast ...
- 社区实测JetBrains open-sources Mellum2 - anyone tried these?
可信度1418下载,48赞;LiveCodeBench v6 37.2%,EvalPlus 78.4%,BFCL v4 44.2%
完整规格
下载动量
30天下载 6.3k → 4.5k · likes +8