模型 / Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3 (LuffyTheFox)

Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3 (LuffyTheFox)

无审查视觉 MoE 模型,Hermes 工具调用,GGUF 本地推理

作者 LuffyTheFox

~21GB 4-bit许可 可商用任务 智能体最近核对 2026-07-19
格式
4-bit
文件
~18GB
运行内存
~21GB–27GB
运行时
LLAMA-SERVER
下载
13,390

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF --jinja

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
基于 Qwen3.6 的 MoE 多模态 GGUF,经信号修复和 Hermes 微调,可直接用 llama.cpp,适合 12GB 显存本地部署。
对位
对位 Qwen2.5-3B 密集模型(激活参数约 3B)
适合
无审查对话与多模态问答 / 本地 agent 工具调用
不适合
需安全审查的生产环境

独立证据与社区反馈

4 个来源 · 均为官方/厂商 · 暂无独立验证最近验证 2026-07-19

厂商材料,未经独立验证:这是一个社区驱动的无审查版 Qwen3.6-35B-A3B,通过纯数值修复恢复了原版中约 750 万死神经元和 SSM 层张量漂移,Genesis 版本是当前最完善的迭代。社区讨论集中在版本选择上,Plus 版因一致性测试失败已被作者撤回,作者建议 Genesis 版搭配 MXFP4_MOE 量化或 Wasserstein 版 Q4_K_P 以上量化使用。

  • 去除原版审查,声称 0/465 次拒绝,完全保留原版能力
  • 修复 FFN 专家层中约 750 万死神经元/零块,恢复专家多样性
  • 修复 SSM conv1d 层的张量漂移,改善长上下文记忆能力
  • Genesis 版本恢复后可进行微调
  • 兼容 llama.cpp、LM Studio、koboldcpp 等主流 GGUF 运行时
  • 提供多种量化版本,适配不同硬件条件
  • 系统提示词必须以特定首行开头,否则模型表现可能下降
  • 量化低于 Q4_K_P 时编程能力显著下降
  • Plus 版本因一致性基准测试失败已被作者撤回
  • Wasserstein(非 Plus)版本仅修复 SSM 层漂移,未修复死神经元
  • 不同版本的推荐量化格式不同(Genesis 推荐 MXFP4_MOE,Wasserstein 推荐 Q4_K_P)

可信度HuggingFace 1.3 万下载,57 点赞,基于 Qwen3.6 与开源 Hermes 数据集

完整规格

规模
35B (3B 激活) · 262K (可扩展至 1M) · 下载 ~18GB · 显存最低 ~21GB · 推荐 ~27GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio / koboldcpp
工具调用
Hermes 风格 function calling
访问提示
Hugging Face 可能需要代理

下载动量

观测时间线