DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)
扩散多模态文本生成,3.8B活跃参数,NVFP4量化
~16GB 8-bit许可 可商用任务 文本生成最近核对 2026-07-22
适合与不适合
独立证据与社区反馈
生成速度极快(4x+),但以约5-19个基准点的质量下降为代价;块状并行生成使得输出流畅但有时不够精确,适合部署在消费级 GPU(18-20GB VRAM)上,更偏向对延迟敏感或可微调的场景,而非开箱即用的最强推理。NVFP4 量化在数据中心卡上表现稳定,在消费卡上兼容性存在疑问,部分社区自制量化版本质量堪忧。
- 4 倍以上生成速度提升,远超同参数量的标准自回归模型
- NVFP4 量化后仅需约 18-19GB VRAM,可在 RTX 5090 等高端消费显卡上运行
- 256K token 上下文窗口,支持长文档处理
- 原生支持 tool calling / function calling,适合 agentic 工作流
- 在 H100 上以 FP8 可达到 1,100+ tokens/s 的生成速度
- 在 RTX Blackwell 6000 Pro 上通过 vLLM 可达 1,058+ tokens/s 输出吞吐
- 支持文本、图像、视频多模态输入
- 支持 35+ 语言的推理
- 基准测试分数普遍低于标准 Gemma 4(约 5-19 分差距),开箱即用的推理能力不如原始模型
- NVFP4 量化在非数据中心 GPU 上兼容性存疑,GB200 与消费级 Blackwell RTX 50 系列的计算能力不完全兼容
- 部分社区自制 NVFP4 量化版本(如 RedHatAI)质量问题严重,被描述为「完全搞砸了」
- 存在 JSON 输出格式问题,包括引号重复和三引号错误
- 块状并行生成偏向「流畅」而牺牲事实准确性,被社区描述为「只在乎流畅」
- 基准测试结果存在异常(NVFP4 在某些测试中反而超过全精度),暗示单次运行方差大、结果不可靠
- 错误率显著更高(标题称 6x 更多错误),不适合对准确性要求极高的任务
- 在特定重复性任务上经微调后才具竞争力,零样本表现有限
- 社区实测DiffusionGemma 26B A4B results on my 5090 : r/LocalLLaMA
- 社区实测nvidia/Gemma-4-26B-A4B-NVFP4
- 社区实测DiffusionGemma: 4x Faster Text Generation
- 社区实测Diffusion Gemma is 4x faster, but makes 6x more mistakes!
- 社区实测DiffusionGemma vs Gemma 4 Over 6x Faster on a Single ...
- 独立评测Performance test: unsloth/gemma-4-26B-A4B-it-NVFP4 vs ...
- 独立评测DiffusionGemma 26B Review: 4x Faster, Real Tradeoffs
- 独立评测Google's DiffusionGemma is 4x faster than its other ...
- 官方/厂商nvidia/diffusiongemma-26B-A4B-it-NVFP4
可信度下载 4.9 万,NVFP4 量化版 GPQA Diamond 68.6% vs 全精度 69.4%
完整规格
下载动量
30天下载 2047.8k → 1743k · likes +24
观测时间线
模型家族
- diffusiongemma-26B-A4B-it
- 量化 DiffusionGemma-26B-A4B-it (Google)
- 量化 DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)