模型 / VibeThinker-3B (WeiboAI)

VibeThinker-3B (WeiboAI)

面向数学/代码/STEM的可验证推理3B小模型

作者 WeiboAI

~1.9GB 4-bit许可 可商用任务 文本生成最近核对 2026-07-22
格式
4-bit
文件
~1.6GB
运行内存
~1.9GB–2.4GB
运行时
VLLM

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve WeiboAI/VibeThinker-3B

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
该模型在数学/代码推理任务上表现突出,需自行写transformers代码运行,适合研究小模型推理极限的开发者。
对位
对位 Qwen2.5-Coder-3B
适合
数学/编程竞赛解题 / STEM可验证推理任务
不适合
工具调用/Agent编程

独立证据与社区反馈

4 个独立来源 · 另 1 官方/转载最近验证 2026-07-22

在竞赛数学和编程这类可验证推理任务上,这个 3B 模型能跑出接近大模型水平的分数,但分数是自报的,且离开竞赛场景后实际表现明显下滑。

  • 在可验证推理(竞赛数学、竞赛编程)上以极低成本(单张消费级 GPU/笔记本)达到接近大模型的基准分数
  • 3B 参数、MIT 协议、约 6.7 GB 显存即可运行的开源小模型
  • 基准分数为自报,未经独立第三方验证
  • 非通用模型,知识类基准 GPQA-Diamond 仅 70.2,远低于推理基准表现
  • 实际编码场景(如 PDF 转代码、线性代数例程)效果差,社区反馈不如 Qwen 3.5 4B
  • 存在基准过拟合(benchmaxing)嫌疑
  • 当前不支持工具调用

可信度IMO-AnswerBench 76.4,LeetCode周赛通过率96.1%

完整规格

规模
3B · 64k · 下载 ~1.6GB · 显存最低 ~1.9GB · 推荐 ~2.4GB · 4-bit(估算)
授权
MIT · 可商用
框架
transformers / vllm / sglang
血统
微调自 Qwen2.5-Coder-3B
访问提示
标记为魔搭可用,具体仓库请自行核对

下载动量

30天下载 86k → 52.7k · likes +116

观测时间线

模型家族

查看全部家族 →