模型 / Qwen3.6-27B-MTP-pi-tune (bytkim)

Qwen3.6-27B-MTP-pi-tune (bytkim)

面向无思考代理编码的MTP微调版,本地GGUF推理

作者 bytkim

~16GB 4-bit许可 可商用任务 智能体最近核对 2026-07-22
格式
4-bit
文件
~14GB
运行内存
~16GB–21GB
运行时
OLLAMA
下载
1,543

Hugging Face 源仓库 ↗

快速上手示例

ollama run hf.co/bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
即用GGUF和Ollama,专为无思考代理编码优化,MTP加速解码,适合本地agent开发。基于Qwen3.6-27B微调,有Terminal-Bench基准。
对位
对位 Qwen2.5-Coder-32B
适合
无思考代理编码循环 / 工具调用与 Shell 自动化
不适合
需要安全对齐的敏感场景

独立证据与社区反馈

7 个独立来源 · 另 1 官方/转载最近验证 2026-07-22

Qwen3.6-27B 被社区普遍视为首个能在实际编码工作中真正替代 Claude Code 的本地模型,在 27B 规模上实现了令人惊讶的编码和 agentic 工作流表现,但 MTP 版本有时会降低代码质量,且复杂多文件架构任务仍逊于 Claude。

  • 编码与 agentic 工作流表现优于同系列 397B 大模型
  • 脚手架、重构、测试生成、跨文件调试等日常编码任务可本地完成,体验接近 Claude Code
  • 作为密集模型,比更大更慢的模型速度快,性价比更高
  • 在 OpenRouter 上的定价低于更大、更慢、内存效率更差的 Gemma 同类模型
  • 本地模型在推理速度上可抢在云端模型完成前进行多轮代码改进
  • 可在 RTX 3090 等消费级硬件上本地运行
  • 从 Qwen3.6 35B-A3B 切换到 27B 后编码表现明显更好
  • MTP(max-token=3)版本的代码质量可能低于非 MTP 版本
  • 复杂的多文件架构级编码任务仍不如 Claude
  • opencode 配置为 CLI agent 需要大量调优,不如 Claude Code 开箱即用
  • 微调后的 reasoning 变体在 benchmark 上出现能力下降
  • MTP 在创意编码场景下的速度优势未获结论性验证

可信度已发布多量化GGUF,llama.cpp原生支持MTP,实测draft acceptance ~78%

完整规格

规模
27B · 256k · 下载 ~14GB · 显存最低 ~16GB · 推荐 ~21GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama
工具调用
OpenAI-style function calling
血统
量化自 Qwen3.6-27B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 109.9k → 61k · likes +12

观测时间线

模型家族

查看全部家族 →