模型 / DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)

DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)

扩散多模态文本生成,3.8B活跃参数,NVFP4量化

作者 nvidia

~16GB 8-bit许可 可商用任务 文本生成最近核对 2026-07-22
格式
8-bit
文件
~14GB
运行内存
~16GB–21GB
运行时
vllm
下载
49,070

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
这是DiffusionGemma的NVFP4量化版,提供vLLM命令和Docker镜像,可快速部署对话/图像视频理解应用,需Hopper或Blackwell GPU。
对位
对位 3B-4B 稠密模型,如 Llama-3.2-3B
适合
多模态文档/图像理解与问答 / 代码生成与函数调用代理
不适合
不保证事实准确性,不适合关键决策

独立证据与社区反馈

8 个独立来源 · 另 1 官方/转载最近验证 2026-07-22

生成速度极快(4x+),但以约5-19个基准点的质量下降为代价;块状并行生成使得输出流畅但有时不够精确,适合部署在消费级 GPU(18-20GB VRAM)上,更偏向对延迟敏感或可微调的场景,而非开箱即用的最强推理。NVFP4 量化在数据中心卡上表现稳定,在消费卡上兼容性存在疑问,部分社区自制量化版本质量堪忧。

  • 4 倍以上生成速度提升,远超同参数量的标准自回归模型
  • NVFP4 量化后仅需约 18-19GB VRAM,可在 RTX 5090 等高端消费显卡上运行
  • 256K token 上下文窗口,支持长文档处理
  • 原生支持 tool calling / function calling,适合 agentic 工作流
  • 在 H100 上以 FP8 可达到 1,100+ tokens/s 的生成速度
  • 在 RTX Blackwell 6000 Pro 上通过 vLLM 可达 1,058+ tokens/s 输出吞吐
  • 支持文本、图像、视频多模态输入
  • 支持 35+ 语言的推理
  • 基准测试分数普遍低于标准 Gemma 4(约 5-19 分差距),开箱即用的推理能力不如原始模型
  • NVFP4 量化在非数据中心 GPU 上兼容性存疑,GB200 与消费级 Blackwell RTX 50 系列的计算能力不完全兼容
  • 部分社区自制 NVFP4 量化版本(如 RedHatAI)质量问题严重,被描述为「完全搞砸了」
  • 存在 JSON 输出格式问题,包括引号重复和三引号错误
  • 块状并行生成偏向「流畅」而牺牲事实准确性,被社区描述为「只在乎流畅」
  • 基准测试结果存在异常(NVFP4 在某些测试中反而超过全精度),暗示单次运行方差大、结果不可靠
  • 错误率显著更高(标题称 6x 更多错误),不适合对准确性要求极高的任务
  • 在特定重复性任务上经微调后才具竞争力,零样本表现有限

可信度下载 4.9 万,NVFP4 量化版 GPQA Diamond 68.6% vs 全精度 69.4%

完整规格

规模
25.2B (3.8B活跃) · 256k · 下载 ~14GB · 显存最低 ~16GB · 推荐 ~21GB · 8-bit(估算)
授权
Apache 2.0 (Gemma Terms) · 可商用
框架
vllm
工具调用
Gemma4 原生工具调用
血统
量化自 diffusiongemma-26B-A4B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 2047.8k → 1743k · likes +24

观测时间线

模型家族

查看全部家族 →