模型 / Qwen3.6-40B (DavidAU)

Qwen3.6-40B (DavidAU)

多模态无审查推理模型,面向代码与视觉应用

作者 DavidAU

仓库标识DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF

~84GB BF16许可 可商用任务 视觉理解最近核对 2026-08-05
格式
BF16
文件
~73GB
运行内存
~84GB–109GB
运行时
llama.cpp
下载
207,104

Hugging Face 源仓库 ↗

适合与不适合

入选理由
GGUF格式可本地或Ollama即用;下载量20万,社区关注度高;基于Qwen3.6扩展至40B并微调,基准有提升。
对位
Qwen 官方模型的无审查替代版
适合
无审查代码生成与推理 / 多模态图像理解
不适合
需要内容过滤的生产场景

独立证据与社区反馈

6 个独立来源最近验证 2026-08-05

社区口碑分化明显:部分用户将其作为日常主力模型,认为输出可接受且连贯,能长时间无人值守运行 agent;但也有人质疑 40B 相比 27B 基座提升有限,质量存在争议。定位偏向服务器级硬件部署,在 RTX 5090 上推理速度不错,但基准测试均为开发者自测,缺乏第三方独立验证。

  • 提供可接受且连贯的输出,满足日常使用需求
  • 能长时间无人值守运行 agent(约一小时)
  • 去除拒绝回答的限制,实现无审查输出
  • 在 RTX 5090 上 Q4_K_S 量化推理速度约 75 t/s
  • 通过 Deckard 扩展技术将参数规模提升至 40B,适合服务器 GPU 部署
  • 质量存在争议,有用户认为「好坏难说」
  • 相比 27B 基座模型提升不明显,有用户认为 40B 未表现出更强能力
  • 基准测试数据为开发者团队自测,未经第三方独立验证
  • MTP 量化模式需严格控制温度 < 1 且 repetition penalty = 1,否则性能下降
  • 40B 参数规模需要服务器级 GPU,不适用于消费级硬件
  • 视频实测中 40B 未能完成提示设定的核心功能,速度也慢于 27B+MTP

可信度HuggingFace 总下载 207k,点赞 94

完整规格

规模
40B · 下载 ~73GB · 显存最低 ~84GB · 推荐 ~109GB · BF16(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 488.9k → 465.1k · likes +36

观测时间线