模型 / Gemma-4-12B Agentic v2 (yuxinlu1)

Gemma-4-12B Agentic v2 (yuxinlu1)

编程与工具调用代理微调,供开发者本地使用

作者 yuxinlu1

~7.2GB 4-bit许可 可商用任务 智能体最近核对 2026-07-08

仅 safetensors · 无 pickle 加载风险

格式
4-bit
文件
~6.2GB
运行内存
~7.2GB–9.3GB
运行时
LLAMA-SERVER
下载
1,833

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF -ngl 99 --jinja

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
专为编码与终端代理微调的Gemma4-12B,tau2-bench工具使用能力提升3.5倍,提供GGUF量化可在8GB显存运行,适合本地开发辅助。
对位
对位 Qwen2.5-14B / Llama-3-8B
适合
终端多步工具调用与调试 / 本地程序合成与测试
不适合
通用知识问答与事实查询

独立证据与社区反馈

12 个独立来源 · 另 2 官方/转载最近验证 2026-07-08

该版本为社区实验性微调,在 Gemma 4 12B 基座上叠加 Composer 2.5 与 Fable 5 推理轨迹及 agentic 调优,面向编程与工具调用。基座模型以 encoder-free 架构实现文本/图像/音频/视频单次直通处理,可在约 4.5 GB 显存的消费级硬件本地运行,Apache 2.0 许可。但量化低于 Q4 时性能严重退化,实际 agentic 工具调用仍不稳定,同尺寸 Qwen 3.5 9B 在多数基准上领先。

  • 可在消费级硬件上本地运行,最低约 4.5 GB 显存或统一内存
  • 提供 Q3_K_M 到 Q8_0 多档量化,适配不同显存预算
  • 兼容 llama.cpp、Ollama、LM Studio、vLLM 等主流本地推理框架
  • 基座 Gemma 4 12B 采用 encoder-free 架构,文本/图像/音频/视频直通处理,无需单独编码器
  • Apache 2.0 许可,可商用,完全离线本地运行
  • 支持 MTP draft 投机解码,实测推理加速约 1.2–1.3 倍
  • 融合 Composer 2.5 与 Fable 5 推理轨迹做编程能力微调
  • 基座 12B 模型多项指标接近 26B 级别
  • 量化低于 Q4 时模型性能严重退化
  • 实际 agentic 工具调用场景中简单工具调用仍不可靠
  • 同尺寸竞品 Qwen 3.5 9B 在 5/8 项基准测试中胜出,且参数量更小
  • encoder-free 架构较新,社区适配和调试存在一定门槛
  • 该微调为社区实验性产物,非官方发布
  • 定性/创意类任务的实际表现可能不同于基准分数

可信度tau2-bench telecom 55% vs base 15%,48 likes,GGUF 一键部署

完整规格

规模
12B · 16k(示例命令) · 下载 ~6.2GB · 显存最低 ~7.2GB · 推荐 ~9.3GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
transformers / llama.cpp / ollama
工具调用
Gemma 4 原生工具调用
血统
微调自 gemma-4-12B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 87.2k → 132.6k

观测时间线

模型家族

查看全部家族 →