DiffusionGemma-26B-A4B-it (Google)
离散扩散文本生成,支持图像/视频输入,低延迟
~15GB 4-bit许可 可商用任务 视觉理解最近核对 2026-06-21
- 格式
- 4-bit
- 文件
- ~13GB
- 运行内存
- ~15GB–20GB
- 运行时
- transformers
- 下载
- 17,666
适合与不适合
独立证据与社区反馈
社区普遍将其视为一款以速度换质量的实验性开放模型,在单张桌面 GPU 上即可跑出 700+ tok/s,但精度明显弱于同规模的 Gemma 4 自回归模型,Google 官方也建议质量优先场景用 Gemma 4。适合对延迟敏感、对输出质量容忍度较高的批量生成任务,但高并发云服务场景下并行解码的优势会递减。
- 单张桌面 GPU 可本地运行 26B MoE 模型(如 RTX 5090 上 700+ tok/s)
- 文本生成速度达自回归模型的约 4 倍,低批量下 H100 超 1100 tok/s
- Apache 2.0 开源权重,可自由商用与二次开发
- 支持文本、图像、视频多模态输入
- 256K token 上下文窗口
- 原生支持函数调用(function calling)
- 支持 35+ 种语言的多语言推理
- 支持 vLLM、HuggingFace Transformers、SGLang、MLX 等多种推理框架
- 支持 Unsloth 高效微调
- 精度不如同规模的 Gemma 4 26B 自回归模型,Google 官方建议质量优先时用 Gemma 4
- 预填充(prefill)性能未改善,是网页搜索/工具调用场景的瓶颈
- 高 QPS 云服务场景下并行解码优势递减,可能导致更高的服务成本
- 内容审查比 Gemma 4 31B 更严格,无法处理 NSFL 内容
- llama.cpp 支持在社区讨论时尚未就绪,本地部署选项受限
- 独立评测DiffusionGemma: Google Bets Diffusion Can Make Text Generation 4x Faster - Developers Digest
- 独立评测Google DiffusionGemma: First Open-Weight Text Diffusion
- 社区实测Google just dropped DiffusionGemma 26B as an Apache 2.0 model ...
- 独立评测diffusiongemma-26b-a4b-it Model by Google - Nvidia NIM
- 社区实测DiffusionGemma: The Developer Guide- Google Developers Blog
- 社区实测Diffusion Gemma 26b model performance on DGX Spark - Facebook
- 社区实测Anyone tried DiffusionGemma 26B A4B? : r/SillyTavernAI - Reddit
- 独立评测DiffusionGemma: The Developer Guide
- 转载/仓库google/diffusiongemma-26B-A4B-it - Hugging Face
可信度Google DeepMind开源,Apache 2.0,Unsloth提供GGUF,下载量1.7万
完整规格
下载动量
30天下载 180.3k → 86.7k · likes +38
观测时间线
模型家族
- diffusiongemma-26B-A4B-it
- 量化 DiffusionGemma-26B-A4B-it (Google)
- 量化 DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)