模型 / Nemotron-Labs-TwoTower-30B-A3B (NVIDIA)

Nemotron-Labs-TwoTower-30B-A3B (NVIDIA)

双塔扩散LLM,块并行解码,2.42x生成吞吐量

作者 nvidia

~18GB 4-bit许可 需自查任务 文本生成最近核对 2026-07-12
格式
4-bit
文件
~16GB
运行内存
~18GB–23GB
运行时
transformers
下载
7,628

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
扩散语言模型,块状并行生成,速度2.42倍,保留质量98.7%;需2张A100/H100。适合追求高吞吐的文本生成。
对位
对位Qwen2.5-3B等3B激活模型
适合
大规模批量文本生成 / 作为基座模型微调
不适合
低延迟对话或指令跟随

独立证据与社区反馈

2 个独立来源最近验证 2026-07-12

社区实测样本极少,个别用户反馈在低配硬件上可流畅运行,但整体口碑尚未形成

  • 低配硬件可运行(6GB VRAM 旧游戏本)且保持实用推理速度
  • 针对 NVIDIA 硬件优化,支持 TensorRT 以最大化性能
  • 社区实测反馈极少,除个别用户外缺乏广泛真实使用验证

可信度基于Nemotron-3-Nano骨干,2.1T tokens训练,基准保留98.7%质量,HuggingFace 7.6k下载

完整规格

规模
30B (3B 激活) · 128k · 下载 ~16GB · 显存最低 ~18GB · 推荐 ~23GB · 4-bit(估算)
授权
NVIDIA Nemotron Open Model License · 需自查
框架
transformers
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 11.5k → 11.7k

观测时间线