模型 / Gemma-4-31B-it-GGUF (LM Studio)

Gemma-4-31B-it-GGUF (LM Studio)

Google 31B 指令模型 GGUF 量化版,本地消费级硬件推理

作者 lmstudio-community

仓库标识lmstudio-community/gemma-4-31B-it-GGUF

显存未知许可 可商用最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
OLLAMA
下载
340,436

Hugging Face 源仓库 ↗

快速上手示例

ollama run hf.co/lmstudio-community/gemma-4-31B-it-GGUF:Q4_K_M

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
GGUF格式可直接在LM Studio/Ollama运行;仅为量化重打包,非新能力。
对位
对位 Qwen2.5-32B、Llama-3.1-70B 蒸馏版
适合
本地高参数量指令遵循与对话 / 长上下文理解与 RAG 应用
不适合
4GB 以下显存设备运行

独立证据与社区反馈

15 个独立来源最近验证 2026-08-09

社区共识:这是 31B 级别里性价比拉满的开源权重——数学/编程基准反超 400B+ 规模的竞品,本地跑既快又便宜(「感觉像扔便士」),16GB 显存或 M3 Pro 36GB 都能带得动。口碑扣分点集中在工程面:早期量化与推理模板还在陆续修,MTP 加速在 LM Studio 下常不生效,部分 Apple 配置偏慢,代码偶发低级语法错误。

  • 以小博大:31B 参数在数学/编程基准上反超 400B+ 规模的竞品,被社区称为「范式转变」
  • 运行成本极低,「像扔便士」:对比昂贵的同类闭源选项,本地跑几乎不花钱
  • 低显存可跑:16GB 显存用 IQ3_XS 量化即出不错结果,且能胜任 agentic 编程
  • Apple 用户可直接上手:MBP M3 Pro 36GB 无压力,E4B 量化下可尝试 31B
  • 工程/代码任务经得起实战:7/8 真实生产测试通过,agentic coding 表现良好
  • MTP 加速有效:与 QAT 组合下体验「amazing」,整体提速约 35%/53%
  • 角色扮演/创作社区活跃:base 版出人意料地连贯,uncensored 变体广受喜爱
  • MTP 在 LM Studio 里标称支持但实际不生效,需要自行升级 NVIDIA 驱动与 llama.cpp 才能用
  • 早期量化与模板仍在修复中,社区预计还会有更多修复陆续到来
  • 部分 Apple 配置(如 M2 Ultra 128GB)上 8bit/4bit 都明显偏慢,MLX/llama.cpp/LM Studio 全试过依旧
  • 代码输出偶发低级语法错误:多打括号、用逗号分隔函数定义,需手动修正
  • 部署概念门槛不低:GGUF/Q4/MoE/GPU offload 等名词容易让新手踩坑,需实测确认本地能否流畅跑
  • LM Studio 默认设置会关掉 reasoning,默认跑会大幅削弱能力,需手动调整配置
  • 速度由内存带宽主导:工作站内存带宽高时 CPU 推理反而快过 RTX 4090,仅堆显卡不解决带宽瓶颈

可信度HuggingFace 下载量 34 万,基于 Google gemma-4-31B-it 量化

完整规格

规模
31B · 权重格式未知,无法估算显存
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio
血统
量化自 gemma-4-31B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 59.1k → 50.4k

观测时间线

模型家族

查看全部家族 →