模型 / Mellum2-12B-A2.5B-Thinking (JetBrains)

Mellum2-12B-A2.5B-Thinking (JetBrains)

思考型助手,在<think>块中输出推理链后给出最终答案

作者 JetBrains

~7.3GB 4-bit许可 可商用任务 文本生成最近核对 2026-07-22
格式
4-bit
文件
~6.3GB
运行内存
~7.3GB–9.5GB
运行时
VLLM
下载
799

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve JetBrains/Mellum2-12B-A2.5B-Thinking --max-model-len 131072 --reasoning-parser qwen3

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
来源于JetBrains的MoE思考模型,推理能力较强,支持vLLM快速部署。
对位
对位Qwen3.5与OLMo-3等开源推理模型
适合
复杂代码调试与多步规划 / 数学竞赛与逻辑推理题
不适合
低延迟闲聊或直接指令回答

独立证据与社区反馈

3 个独立来源最近验证 2026-07-22

小型MoE推理模型,速度快、编码能力强,性价比突出,社区普遍认为JetBrains这次做得不错

  • 12B MoE仅2.5B激活参数,推理速度极快,同等硬件上生成速度远超同级别模型
  • 编码和工具调用能力可靠,在复杂调试任务中表现良好
  • 支持131k上下文窗口,长上下文下推理速度几乎不衰减
  • 非编码类任务表现一般,综合评分存在短板
  • ROCm兼容性存在问题,部分用户遇到GPU硬锁

可信度在LiveCodeBench v6代码评测中pass@1达69.9%,在AIME 2025+2026数学评测均分58.4%

完整规格

规模
12B · 131k · 下载 ~6.3GB · 显存最低 ~7.3GB · 推荐 ~9.5GB · 4-bit(估算)
授权
Apache 2.0 · 可商用
框架
vllm / transformers
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 8.2k → 5k · likes +17

观测时间线