模型 / Qwen3.6-27B-Heretic-GGUF (darkc0de)

Qwen3.6-27B-Heretic-GGUF (darkc0de)

Claude Opus推理蒸馏并反审查的27B模型GGUF版

作者 fzcfweasdferttgg

~16GB 4-bit许可 可商用最近核对 2026-07-15
格式
4-bit
文件
~14GB
运行内存
~16GB–21GB
运行时
OLLAMA
下载
132

Hugging Face 源仓库 ↗

快速上手示例

ollama run hf.co/fzcfweasdferttgg/Qwen3.6-27B-Claude-Opus-Reasoning-Distill-v2-heretic-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Qwen3.6的Claude Opus推理蒸馏+去审查版,直接提供GGUF量化,8GB显存可跑Q2_K版本,适合需要高质量、无审查限制的本地推理用户。
对位
对位 Gemma-2-27B
适合
复杂推理与多步逻辑 / 创意写作与无过滤对话
不适合
安全合规的生产环境

独立证据与社区反馈

13 个独立来源 · 另 1 官方/转载最近验证 2026-07-15

27B 密集模型在编码与 agentic 工作流中超越 397B MoE 前代,被社区公认同尺寸性价比顶尖;Heretic 无审查版在保持原模型能力的同时大幅降低拒答,且低量化版本在消费级硬件上即可流畅运行,速度与内存效率优于更大模型。

  • 27B 密集模型在编码基准上超越 397B MoE 前代,代码生成能力越级
  • 密集架构比 MoE 更易部署,本地推理门槛低
  • 量化版本(Q4_K_M)仅需约 17–20GB 显存即可在消费级硬件运行
  • Heretic 无审查版保持原模型能力的同时拒答率仅 6/100
  • 在 agentic 编码与终端基准测试(Terminal-Bench 2.0)中表现突出
  • 相比更大模型提供更快的推理速度与更低的内存占用
  • NEO Di-Matrix 量化技术在量化形式下仍保持接近原模型的高性能
  • 首个将无审查权重与完整 MTP 头结合的 GGUF 版本,补齐此前无审查版缺失 MTP 的短板
  • 不同 GGUF 量化上传者质量存在差异,需要根据 KL 散度等指标选择
  • 与专精编码模型(如 Coder-Next)相比并非在所有编码任务上都占优,选择需结合实际任务评估
  • SVG 等创意生成任务表现不够稳定,偶有失真

可信度基准 ARC +1.8%, BoolQ 持平; 拒绝率从 98/100 降至 8/100

完整规格

规模
27B · 256K · 下载 ~14GB · 显存最低 ~16GB · 推荐 ~21GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 Qwen3.6-27B-Claude-Opus-Reasoning-Distill-v2-heretic
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 978 → 1.2k

观测时间线