模型 / gemma-4-98e-coderx-GGUF (ManniX-ITA)

gemma-4-98e-coderx-GGUF (ManniX-ITA)

LCB-medium 99%,12GB 级代码专家量化包

作者 ManniX-ITA

~12GB 4-bit许可 可商用最近核对 2026-07-22
格式
4-bit
文件
~11GB
运行内存
~12GB–16GB
运行时
llama.cpp
下载
26,511

Hugging Face 源仓库 ↗

适合与不适合

入选理由
代码专用剪枝版Gemma4,在HumanEval+等代码任务上超越未剪枝版,可通过llama.cpp或ollama直接使用,适合单卡12GB以上。
对位
对位 Qwen2.5-Coder-14B 和 Qwen3.5-9B
适合
本地代码生成与评测 / 工具调用与多轮 agent
不适合
研究生级科学推理(GPQA 仅 48%)

独立证据与社区反馈

9 个独立来源 · 另 3 官方/转载最近验证 2026-07-22

Gemma 4 实际体验优于纸面跑分,在复杂指令遵循和多语言任务上表现突出,但不开推理时表现平庸且偶有跑偏;该 coderx 微调版以牺牲科学知识为代价换取顶尖编程能力,低比特 GGUF 量化是推荐部署路径。

  • 实际体验明显优于基准跑分,复杂指令遵循能力强且不啰嗦
  • Apache 2.0 许可带来真正的商业自由度,较前代 Gemma 的定制许可是一大进步
  • 多语言质量确实强,德语、阿拉伯语、越南语、法语等非英语场景下优于 Qwen 3.5
  • 26B-A4B 的 MoE 架构在 RTX 4090 上可达 138 tok/s 推理速度,比同家族 12B 模型快约 1.7 倍
  • coderx 变体(98e)编程能力顶尖,benchmark 得分 85.71%,适合以代码为主的场景
  • Gemma 4 2B 在旧硬件(RTX 2060 6GB)上比 Qwen 3.5 2B 更快、更省显存,体感接近 Qwen 3.5 9B
  • 26B-A4B 在 one-shot 编程题上达到 GPT 5.2 和 Gemini 3 Pro Preview 水平
  • 可产出美观的前端页面,能较好地遵循提示词结构并交付可用输出
  • 不开推理时表现明显逊色,开启推理后才有质的飞跃
  • 曾频繁跑偏(go off the rails),稳定性存疑
  • MoE 模型(26B-A4B)实际运行速度明显慢于 Qwen 3.5 的同级 MoE 模型
  • 高配变体体积较大,对本地硬件有限的用户不够友好
  • 使用工具链和自定义 harness 编写代码时表现反而比 one-shot 更差
  • 在前端生成任务中,打磨度、连贯性和设计需求执行上 Qwen 3.5 仍略胜一筹
  • 选错硬件对应的模型变体会导致体验极差,容易误以为模型本身有问题
  • coderx 变体编程能力突出但科学知识得分较低(GPQA 仅 51.01)

可信度Q6_K 实测 HE+ 92.68%, LCB-100 99%, 下载 2.6 万

完整规格

规模
20.8B (A4B 活跃) · 下载 ~11GB · 显存最低 ~12GB · 推荐 ~16GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 gemma-4-A4B-98e-v7-coderx-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 11.4k → 13.6k

观测时间线