指南 / 视觉理解模型
视觉理解模型
共 18 个 · 数据更新于 2026-07-23
显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。
| 模型 | 参数量 | 显存门槛 | 上下文 | 许可证 | 商用 | 语言 | 国内可达 | 部署 |
|---|---|---|---|---|---|---|---|---|
| Warmly 0.8B (neureps) LoRA · 基于 Qwen3.5-0.8B-enko | 0.8B | ~0.5GB 4-bit | — | Apache-2.0 | 可商用 | — | 需代理 | ollama run hf.co/neureps/warmly-qwen35-08b-enko-gguf |
| Qwen3.6-27B-Fable-Fusion (DavidAU) | 27B | ~16GB 4-bit | 256k | Apache 2.0 | 需自查 | — | 需代理 | ollama run hf.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF |
| FrickFritz-4B-GGUF (fattis) 量化自 FrickFritz-4B | 4B | ~2.4GB 4-bit | — | apache-2.0 | 可商用 | — | 需代理 | ollama run hf.co/fattis/FrickFritz-4B-GGUF |
| ThinkingCap-Qwen3.6-27B (bottlecapai) 量化自 ThinkingCap-Qwen3.6-27B | 27B | ~16GB 4-bit | — | — | 需自查 | — | 需代理 | llama-server -hf bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:Q4_K_M --mmproj bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:mmproj-ThinkingCap-Qwen3.6-27B-f16.gguf |
| Unlimited-OCR (Baidu) 量化自 Unlimited-OCR | 3B | ~1.8GB 4-bit | — | MIT | 可商用 | — | 需代理 | huggingface-cli download sahilchachra/Unlimited-OCR-GGUF --include Unlimited-OCR-Q4_K_M.gguf mmproj-Unlimited-OCR-F16.gguf --local-dir ./uocr |
| PP-OCRv6_medium_det (PaddlePaddle) | 15.5M | ~0.1GB 4-bit | 不适用 | Apache-2.0 | 可商用 | — | 需代理 | python -c 'from paddleocr import TextDetection; TextDetection(model_name="PP-OCRv6_medium_det", engine="transformers").predict("image.png")' (需 paddleocr 库) 等 2 种 |
| DiffusionGemma-26B-A4B-it (Google) 量化自 diffusiongemma-26B-A4B-it | 25.2B (3.8B active) | ~15GB 4-bit | 256k | Apache 2.0 | 可商用 | — | 需代理 | DiffusionGemmaForBlockDiffusion.from_pretrained("google/diffusiongemma-26B-A4B-it", device_map="auto") |
| Gemma-4-31B-QAT-GGUF (unsloth) 量化自 gemma-4-31B-it-qat-q4_0-unquantized GGUF·unsloth · GGUF·google · GGUF·lmstudio | 31B | ~19GB 4-bit | 256k | apache-2.0 | 可商用 | — | 需代理 | llama-server -hf unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 4 -ngl 999 |
| Gemma-4-26B-A4B-QAT-GGUF (Unsloth) 量化自 gemma-4-26B-A4B-it-qat-q4_0-unquantized GGUF·unsloth · GGUF·lmstudio | 25.2B (3.8B active) | ~15GB 4-bit | 256K | Apache-2.0 (Gemma) | 可商用 | — | 需代理 | ollama run unsloth/gemma-4-26B-A4B-it-qat-GGUF 等 3 种 |
| gemma-4-12B-it (Google) 量化自 gemma-4-12B-it GGUF·lmstudio · GGUF·unsloth | 12B | ~7.2GB 4-bit | 256k | Apache 2.0 | 可商用 | — | 需代理 | ollama: ollama run hf.co/lmstudio-community/gemma-4-12B-it-GGUF:Q4_K_M |
| NuExtract3 (NuMind) 微调自 Qwen3.5-4B | 4B | ~2.7GB 4-bit | 131k | Apache-2.0 | 可商用 | — | 需代理 | vllm serve numind/NuExtract3 --trust-remote-code --limit-mm-per-prompt '{"image": 99, "video": 0}' 等 2 种 |
| Qwen3.5-9B-MTP-GGUF (unsloth) 量化自 Qwen3.5-9B | 9B | ~5.4GB 4-bit | 262k (可扩展至1M) | apache-2.0 | 可商用 | — | 需代理 | git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp && cmake -B build -DGGML_CUDA=ON && cmake --build build --target llama-server 等 2 种 |
| Qwen3.6-27B-GGUF (unsloth) 量化自 Qwen3.6-27B GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP | 27B | ~16GB 4-bit | 262k (可扩展至1M) | apache-2.0 | 可商用 | — | 需代理 | llama.cpp: ./main -m Qwen3.6-27B-Q4_K_M.gguf |
| Qwen3.6-35B-A3B-GGUF (Unsloth) 量化自 Qwen3.6-35B-A3B GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP | 35B (3B 激活) | ~21GB 4-bit | 262k (可扩展至1M) | apache-2.0 | 可商用 | — | 需代理 | ollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF 等 2 种 |
| Gemma-4-E4B-Aggressive (HauhauCS) 量化自 gemma-4-e4b-it | 4B | ~2.4GB 4-bit | 131k | Gemma | 限制商用 | — | 需代理 | llama-cli -m ./gemma4-unc/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf --mmproj ./gemma4-unc/mmproj-Gemma-4-E4B-Uncensored-HauhauCS-Aggressive-f16.gguf --jinja -c 8192 -ngl 99 等 2 种 |
| Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF (DavidAU) 量化自 Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinking | 27B | ~16GB 4-bit | 256k | apache-2.0 | 可商用 | — | 需代理 | llama-server -hf DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF |
| Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive 量化自 Qwen3.6-35B-A3B | 35B | ~21GB 4-bit | — | apache-2.0 | 可商用 | — | 需代理 | ollama run fredrezones55/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive:Q4_K_P 等 4 种 |
| Qwen3.6-40B (DavidAU) 量化自 Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking | 40B | ~24GB 4-bit | — | apache-2.0 | 可商用 | — | 需代理 | llama-cli -m <gguf-file> -p '你的提示' 等 2 种 |
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- DavidAU 的 Fable/Claude 蒸馏版仅约 4000 样本训练,不足以转移能力,可能反而降低质量 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- 蒸馏版实测出现连贯性问题和细微错误,标准基础模型没有这些毛病 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- 类似 Qwopus 蒸馏版存在幻觉问题且耗时翻倍 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- 复杂多文件架构级编程仍不如 Claude —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- 配置 opencode 等 CLI 代理工具比 Claude Code 开箱体验更费劲 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- 部分基准测试中表现不如 Qwen3.5 和 Gemma 4 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- API 输出速度(55 t/s)低于 Qwen3.5(76 t/s) —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
- API 价格高于 Qwen3.5 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
展开其余 71 条
- 基础模型 Qwen3.6 存在过度推理/思考循环问题,会重复表述相同逻辑 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- 复杂的多文件架构级编码任务仍需 Claude 等顶级云端模型 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- 本地 CLI agent 工具链(如 opencode)调校门槛高,不如 Claude Code 开箱即用 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- 复杂非编码任务(深度研究、信息密集文档分析)本地模型仍不及顶级云端模型 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- 编码体验并非始终出色,部分场景表现一般 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- 在 Qwen 推荐的 temperature 1.0 采样下推理质量波动较大 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
- 架构设计被质疑像是在 Transformer 里加 LSTM,存在争议 —— sahilchachra/Unlimited-OCR-GGUF
- 对长对话场景的适用性尚不明确 —— sahilchachra/Unlimited-OCR-GGUF
- HN 讨论量有限,缺乏大规模实际使用反馈 —— sahilchachra/Unlimited-OCR-GGUF
- 安装过程非常折腾,英文文档质量差,社区反馈其为「见过最难安装的开源软件」 —— PaddlePaddle/PP-OCRv6_medium_det_safetensors
- 精度不如同规模的 Gemma 4 26B 自回归模型,Google 官方建议质量优先时用 Gemma 4 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- 预填充(prefill)性能未改善,是网页搜索/工具调用场景的瓶颈 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- 高 QPS 云服务场景下并行解码优势递减,可能导致更高的服务成本 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- 内容审查比 Gemma 4 31B 更严格,无法处理 NSFL 内容 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- llama.cpp 支持在社区讨论时尚未就绪,本地部署选项受限 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
- 社区实测中标准 Q4_0 的 top-1 准确率比 QAT Q4_0 高约 13%(以 Q8_0 为参照) —— unsloth/gemma-4-31B-it-qat-GGUF
- 长文档场景下 QAT Q4_0 top-1 准确率仅 28.57% vs Q8_0,远低于 Q4_K_M 的 77% —— unsloth/gemma-4-31B-it-qat-GGUF
- Q4_K_M 在所有指标上均优于 QAT Q4_0 —— unsloth/gemma-4-31B-it-qat-GGUF
- 数学能力明显弱于 Q8 版本 —— unsloth/gemma-4-31B-it-qat-GGUF
- 存在忽略系统提示词的问题 —— unsloth/gemma-4-31B-it-qat-GGUF
- 31B 的 MTP assistant 模型效果不佳,接受率偏低 —— unsloth/gemma-4-31B-it-qat-GGUF
- 社区基准测试的非对等比较使 QAT 实际质量难以定论 —— unsloth/gemma-4-31B-it-qat-GGUF
- 编程任务在默认 temperature=1.0 下输出充满低级错误,需降至 0.3 或更低 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- 有用户称其为'最差的模型',在代码分析任务中给出大量错误建议 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- QAT 技术来自 Google,Unsloth 仅做格式转换,非独立改进 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- 非 QAT 版 Unsloth Q4_K_XL 中大量 tensor 使用了 q5/q6/q8 精度,可能影响量化一致性 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
- 有用户打出 4/10 评分并转回使用 Qwen —— lmstudio-community/gemma-4-12B-it-GGUF
- 低量化版本可能产生大量语法错误,曾有文件需手动修改 23 处 —— lmstudio-community/gemma-4-12B-it-GGUF
- Q8_0 量化生成速度骤降至约 25 t/s —— lmstudio-community/gemma-4-12B-it-GGUF
- assistant 模型尚无 GGUF 量化版本 —— lmstudio-community/gemma-4-12B-it-GGUF
- MTP 支持在 llama.cpp 中仍处于开发中 —— lmstudio-community/gemma-4-12B-it-GGUF
- 30GB 活跃权重的模型推测仅约 10 t/s,交互体验很慢 —— lmstudio-community/gemma-4-12B-it-GGUF
- 被认为适合一次性/原型项目,在有长期维护需求的产品中可能成为瓶颈 —— numind/NuExtract3
- MMLU Pro 上退化最明显,世界知识有所损失 —— unsloth/Qwen3.5-9B-MTP-GGUF
- 量化后模型与原始 16 位版本不完全等同 —— unsloth/Qwen3.5-9B-MTP-GGUF
- 复杂多文件架构级任务仍需Claude,本地模型无法完全替代 [0] —— unsloth/Qwen3.6-27B-GGUF
- CLI编程代理(如opencode)的调优远不如Claude Code开箱即用,需要大量配置 [0] —— unsloth/Qwen3.6-27B-GGUF
- 27B密集模型推理速度慢,在M5 Max上仅24 tok/s,远低于35B-A3B的65 tok/s [2] —— unsloth/Qwen3.6-27B-GGUF
- 35B-A3B变体在复杂任务上表现很差,几乎不可用 [3] —— unsloth/Qwen3.6-27B-GGUF
- 部分用户无法复现27B对Coder-Next的优势,实际体验存在个体差异 [1] —— unsloth/Qwen3.6-27B-GGUF
- 在部分基准测试上表现落后于Qwen3.5-27B和Gemma 4 31B [10] —— unsloth/Qwen3.6-27B-GGUF
- 输出生成速度低于Qwen3.5-27B,55 tok/s vs 76 tok/s [12] —— unsloth/Qwen3.6-27B-GGUF
- Qwen3.5-27B的API调用价格更便宜 [12] —— unsloth/Qwen3.6-27B-GGUF
- 在笔记本上本地运行不适合严肃编码工作,建议使用独立Mac Mini或服务器 [4] —— unsloth/Qwen3.6-27B-GGUF
- Think模式的推理词链可能导致文档合成任务出现循环删减 [3] —— unsloth/Qwen3.6-27B-GGUF
- 在商业备忘录和文档合成任务上,Coder-Next单次成功运行成本低60-100倍 [3] —— unsloth/Qwen3.6-27B-GGUF
- CPU-only 推理速度慢约 30%:Unsloth GGUF 在纯 CPU 环境下比同类量化同行的 t/s 低约 30% —— unsloth/Qwen3.6-35B-A3B-GGUF
- CPU-only 下 followup 响应延迟高:首次后续响应延迟 25-29 秒,而同类替代方案仅为 14-20 秒 —— unsloth/Qwen3.6-35B-A3B-GGUF
- CUDA 13.2 兼容性问题:已知在 CUDA 13.2 环境下产生乱码输出 —— unsloth/Qwen3.6-35B-A3B-GGUF
- Ollama 需要用户自行调整才能正常使用 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- HuggingFace 硬件兼容性组件不识别 K_P 量化,需手动到 Files 页面查看全部下载 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- LM Studio 中 K_P 量化显示为"?"(仅外观问题,模型可正常加载) —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- 长上下文场景下的人工测试时间不如作者其他发布充分,可能在极端情况遇到边缘问题 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- Google 引入了类似 GenRM 的内部审查机制,其正无审查版本难度持续增加 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- Ollama 上的边缘模型仅支持纯音频或纯视觉,同时使用会崩溃,且剥离多模态的版本不推荐使用 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- 2B 版本(E2B)能力有限,不应期望匹敌 7B 以上模型 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
- Heretic v2版本已推出且声称拒绝率更低,此版本可能已被迭代 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- MoE稀疏变体(如35B A3B)的Heretic版本尚未可用,调优稀疏MoE需大量VRAM和时间 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- 无Discord等社区支持渠道 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- MTP(多令牌预测)支持状态不明 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- IQ2_M级别量化仍有约17%性能损失 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- 即使经过Heretic处理,仍有4%拒绝率残留 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
- 显存需求高:Q4_K_P约20GB,Q6_K_P 31GB,Q8_K_P 44GB;多模态需额外加载mmproj(899MB)。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 某些推理框架(如llama.cpp)需手动设置`--jinja`或`enable_thinking:false`以关闭思维链。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- Aggressive变体虽无拒绝但可能输出简短免责声明(基座训练固有),并非完全空白。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 量化版本众多(含K_P自定义量化),需注意HF硬件兼容性组件不识别K_P,需手动查看文件列表。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 需手动禁用思考模式(编辑 jinja 模板或传参 enable_thinking=false) —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 无独立社区评测,仅有作者自述无智能退化 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 模型名过长,社区以调侃方式表达不满 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
- "Opus"标签被质疑更多是命名营销而非实质提升 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
- 性能对比仅止于"不更差",缺乏明确的优势证据 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF