DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)
扩散多模态文本生成,3.8B活跃参数,NVFP4量化
仓库标识nvidia/diffusiongemma-26B-A4B-it-NVFP4
显存未知许可 可商用任务 文本生成最近核对 2026-08-05
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
适合与不适合
独立证据与社区反馈
推理速度显著快于常规 Gemma 4(实测 4-6 倍加速),但以牺牲事实准确性为代价,官方明确建议事实敏感场景使用常规版。单卡 RTX 5090 即可部署,文档解析/OCR 是明确优势场景,但结构化输出和 tool calling 精度不足。
- 推理速度极快,实测在 RTX 5090 上可达 700+ tok/s,H100 上可达 1,100+ tok/s
- NVFP4 量化后仅需约 18GB VRAM,单张 RTX 5090 即可部署 26B 规模模型
- 文档解析/OCR 场景(OmniDocBench)表现优于常规 Gemma 4,双向注意力机制带来结构优势
- 支持 256K token 上下文窗口,可处理长文档
- 原生支持 function calling 和 agentic workflow
- 多模态输入(文本、图像、视频),覆盖 35+ 语言
- 降低推理服务成本,提高并发,适合企业级高吞吐量应用
- Apache 2.0 开源许可
- 事实准确性差,实测错误率是常规 Gemma 4 的约 6 倍(33 正确 vs 28 错误),官方明确质量低于常规版
- 易编造人名、日期、数字等细节(如虚构 Steve Jobs 母亲的名字、虚构同事名字、编造产品价格)
- 冷门话题准确性更差(Jobs 4 错,Tetris 12 错,BeOS 12 错)
- Tool calling 精度不足,社区反馈需要更高精确度的场景表现不佳
- 非数据中心 GPU 上 NVFP4 支持存在兼容性问题
- 多 GPU 配置存在问题
- JSON 输出存在 delimiter 拆分 bug 和引号重复问题(BF16 版本同样存在)
- Google 官方将其定位为实验性模型,明确建议事实敏感场景使用常规 Gemma 4
- 社区实测nvidia/Gemma-4-26B-A4B-NVFP4 : r/LocalLLaMA
- 社区实测DiffusionGemma: 4x Faster Text Generation
- 社区实测Diffusion Gemma is 4x faster, but makes 6x more mistakes!
- 社区实测DiffusionGemma vs Gemma 4 Over 6x Faster on a Single ...
- 社区实测DiffusionGemma 26B A4B results on my 5090 : r/LocalLLaMA
- 独立评测Google DiffusionGemma: First Open-Weight Text Diffusion
- 独立评测Run DiffusionGemma on NVIDIA for Developer-Ready, High-Throughput Text Generation | NVIDIA Technical Blog
- 官方/厂商nvidia/diffusiongemma-26B-A4B-it-NVFP4 · Hugging Face
- 官方/厂商DiffusionGemma: 4x faster text generation
可信度下载 4.9 万,NVFP4 量化版 GPQA Diamond 68.6% vs 全精度 69.4%
完整规格
下载动量
30天下载 108.4k → 29.6k · likes +5
观测时间线
模型家族
- diffusiongemma-26B-A4B-it
- 量化 DiffusionGemma-26B-A4B-it (Google)
- 量化 DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)
- 微调 OUI-1 (Thesys)