模型 / Qwopus-3.6-35B-A3B-Coder (Jackrong)

Qwopus-3.6-35B-A3B-Coder (Jackrong)

关闭思考的编码代理模型,降低 token 延迟,适合本地工作流

作者 Jackrong

~21GB 4-bit许可 可商用任务 智能体最近核对 2026-07-08
格式
4-bit
文件
~18GB
运行内存
~21GB–27GB
运行时
LLAMA-SERVER

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF -m qwopus-35b-a3b-coder-q5_k_m.gguf

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
GGUF格式直接可跑,专为agentic coding优化,SWE-bench 62.4%(thinking-off),适合本地部署的代码代理工作流。
对位
对位 Ornith-1.0 35B
适合
代理循环中的代码编辑与调试 / 本地低 token 消耗编码任务
不适合
需要深度推理的长链问题

独立证据与社区反馈

2 个独立来源 · 另 1 官方/转载最近验证 2026-07-08

Qwopus-3.6-35B-A3B-Coder 是一个面向编码代理的思考关闭、令牌高效模型,质量优于 3.5 版本且支持 CPU 卸载,但部分用户反馈社区微调实际可用性不稳定。

  • 在禁用显式长思考时实现令牌高效的编码代理执行
  • 相比 3.5 版本质量明显提升,支持部分 CPU 卸载运行
  • 相比 Qwen 3.6-35B-A3B 基础模型内存占用更少
  • 部分用户反映社区微调版本在实际使用中无法正常工作
  • 3.6 基础模型本身已减少过度思考,使得思考关闭微调的必要性降低

可信度SWE-bench 300 任务 62.4%,Q5_K_M 量化,关闭思考

完整规格

规模
35B (3B 激活) · 下载 ~18GB · 显存最低 ~21GB · 推荐 ~27GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama / llama-cpp-python
血统
LoRA · 基于 Qwopus3.6-35B-A3B-v1
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 397.6k → 523.7k

观测时间线