模型 / Instella-MoE-16B-A3B-Think (AMD)

Instella-MoE-16B-A3B-Think (AMD)

全开源 MoE 语言模型,16B 总参/2.8B 激活,面向研究

作者 amd

仓库标识amd/Instella-MoE-16B-A3B-Think

显存未知许可 限制商用任务 文本生成最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
transformers
下载
730

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
全流程开放的 MoE 模型,含 Gated MLA 等架构创新,适合研究者深入分析训练阶段;需自行编写推理代码,且仅限研究用途。
对位
对位 DeepSeekMoE-16B(2.8B 激活)
适合
研究实验与训练流程复现 / MoE 架构与系统创新研究
不适合
生产部署或安全关键应用

独立证据与社区反馈

4 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

「完全开放」标签有水分——授权仅限学术/研究用途,且 2.8B 活跃参数仍需 16B 量级的显存规划,离实用部署还有距离。

  • 全流程检查点公开(预训练→中期训练→长上下文扩展→SFT→DPO→RL),便于研究复现和分阶段分析
  • 使用开源 Primus 和 Miles 框架在 AMD MI300X/MI325X 上完成端到端训练,验证了 AMD 软硬件栈的可行性
  • 在 AMD 自有 GPU 上从头训练出与 Gemma-4-E4B 可比的性能,为非 NVIDIA 生态提供了参考案例
  • 授权协议限制仅用于学术和研究活动,任何商业用途均构成违规
  • 2.8B 活跃参数仍需 16B 模型的显存规划,推理成本并不低
  • 加载模型需要 trust_remote_code=True,存在安全和使用门槛
  • 首选部署路径为 Linux,Windows 支持存在但非优先

可信度AMD 官方发布,提供预训练至 RL 全流程检查点,HuggingFace 57 点赞

完整规格

规模
16B · 权重格式未知,无法估算显存
授权
ResearchRAIL · 限制商用
框架
transformers / sglang
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 2.3k → 2.8k · likes +15

观测时间线