VibeThinker-3B (WeiboAI)
面向数学/代码/STEM的可验证推理3B小模型
~1.9GB 4-bit许可 可商用任务 文本生成最近核对 2026-07-22
- 格式
- 4-bit
- 文件
- ~1.6GB
- 运行内存
- ~1.9GB–2.4GB
- 运行时
- VLLM
仅 safetensors · 无 pickle 加载风险
快速上手示例
vllm serve WeiboAI/VibeThinker-3B 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
在竞赛数学和编程这类可验证推理任务上,这个 3B 模型能跑出接近大模型水平的分数,但分数是自报的,且离开竞赛场景后实际表现明显下滑。
- 在可验证推理(竞赛数学、竞赛编程)上以极低成本(单张消费级 GPU/笔记本)达到接近大模型的基准分数
- 3B 参数、MIT 协议、约 6.7 GB 显存即可运行的开源小模型
- 基准分数为自报,未经独立第三方验证
- 非通用模型,知识类基准 GPQA-Diamond 仅 70.2,远低于推理基准表现
- 实际编码场景(如 PDF 转代码、线性代数例程)效果差,社区反馈不如 Qwen 3.5 4B
- 存在基准过拟合(benchmaxing)嫌疑
- 当前不支持工具调用
- 社区实测A 3B Dense Reasoning Model Built on Qwen2.5-Coder- ...
- 社区实测A 3B model is suddenly scoring near frontier ...
- 独立评测VibeThinker-3B: A 3B Model vs the Benchmark Debate (2026) | ThePlanetTools.ai
- 独立评测Medium
- 官方/厂商WeiboAI/VibeThinker-3B · I tested this model
可信度IMO-AnswerBench 76.4,LeetCode周赛通过率96.1%
完整规格
下载动量
30天下载 86k → 52.7k · likes +116
观测时间线
模型家族
- Qwen2.5-Coder-3B
- 微调 VibeThinker-3B (WeiboAI)