指南 / 视觉理解模型

视觉理解模型

共 18 个 · 数据更新于 2026-07-23

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

模型参数量显存门槛上下文许可证商用语言国内可达部署
Warmly 0.8B (neureps)
LoRA · 基于 Qwen3.5-0.8B-enko
0.8B~0.5GB 4-bitApache-2.0可商用需代理ollama run hf.co/neureps/warmly-qwen35-08b-enko-gguf
Qwen3.6-27B-Fable-Fusion (DavidAU) 27B~16GB 4-bit256kApache 2.0需自查需代理ollama run hf.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
FrickFritz-4B-GGUF (fattis)
量化自 FrickFritz-4B
4B~2.4GB 4-bitapache-2.0可商用需代理ollama run hf.co/fattis/FrickFritz-4B-GGUF
ThinkingCap-Qwen3.6-27B (bottlecapai)
量化自 ThinkingCap-Qwen3.6-27B
27B~16GB 4-bit需自查需代理llama-server -hf bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:Q4_K_M --mmproj bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:mmproj-ThinkingCap-Qwen3.6-27B-f16.gguf
Unlimited-OCR (Baidu)
量化自 Unlimited-OCR
3B~1.8GB 4-bitMIT可商用需代理huggingface-cli download sahilchachra/Unlimited-OCR-GGUF --include Unlimited-OCR-Q4_K_M.gguf mmproj-Unlimited-OCR-F16.gguf --local-dir ./uocr
PP-OCRv6_medium_det (PaddlePaddle) 15.5M~0.1GB 4-bit不适用Apache-2.0可商用需代理python -c 'from paddleocr import TextDetection; TextDetection(model_name="PP-OCRv6_medium_det", engine="transformers").predict("image.png")' (需 paddleocr 库) 等 2 种
DiffusionGemma-26B-A4B-it (Google)
量化自 diffusiongemma-26B-A4B-it
25.2B (3.8B active)~15GB 4-bit256kApache 2.0可商用需代理DiffusionGemmaForBlockDiffusion.from_pretrained("google/diffusiongemma-26B-A4B-it", device_map="auto")
Gemma-4-31B-QAT-GGUF (unsloth)
量化自 gemma-4-31B-it-qat-q4_0-unquantized
GGUF·unsloth · GGUF·google · GGUF·lmstudio
31B~19GB 4-bit256kapache-2.0可商用需代理llama-server -hf unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 4 -ngl 999
Gemma-4-26B-A4B-QAT-GGUF (Unsloth)
量化自 gemma-4-26B-A4B-it-qat-q4_0-unquantized
GGUF·unsloth · GGUF·lmstudio
25.2B (3.8B active)~15GB 4-bit256KApache-2.0 (Gemma)可商用需代理ollama run unsloth/gemma-4-26B-A4B-it-qat-GGUF 等 3 种
gemma-4-12B-it (Google)
量化自 gemma-4-12B-it
GGUF·lmstudio · GGUF·unsloth
12B~7.2GB 4-bit256kApache 2.0可商用需代理ollama: ollama run hf.co/lmstudio-community/gemma-4-12B-it-GGUF:Q4_K_M
NuExtract3 (NuMind)
微调自 Qwen3.5-4B
4B~2.7GB 4-bit131kApache-2.0可商用需代理vllm serve numind/NuExtract3 --trust-remote-code --limit-mm-per-prompt '{"image": 99, "video": 0}' 等 2 种
Qwen3.5-9B-MTP-GGUF (unsloth)
量化自 Qwen3.5-9B
9B~5.4GB 4-bit262k (可扩展至1M)apache-2.0可商用需代理git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp && cmake -B build -DGGML_CUDA=ON && cmake --build build --target llama-server 等 2 种
Qwen3.6-27B-GGUF (unsloth)
量化自 Qwen3.6-27B
GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP
27B~16GB 4-bit262k (可扩展至1M)apache-2.0可商用需代理llama.cpp: ./main -m Qwen3.6-27B-Q4_K_M.gguf
Qwen3.6-35B-A3B-GGUF (Unsloth)
量化自 Qwen3.6-35B-A3B
GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP
35B (3B 激活)~21GB 4-bit262k (可扩展至1M)apache-2.0可商用需代理ollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF 等 2 种
Gemma-4-E4B-Aggressive (HauhauCS)
量化自 gemma-4-e4b-it
4B~2.4GB 4-bit131kGemma限制商用需代理llama-cli -m ./gemma4-unc/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf --mmproj ./gemma4-unc/mmproj-Gemma-4-E4B-Uncensored-HauhauCS-Aggressive-f16.gguf --jinja -c 8192 -ngl 99 等 2 种
Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF (DavidAU)
量化自 Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinking
27B~16GB 4-bit256kapache-2.0可商用需代理llama-server -hf DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
量化自 Qwen3.6-35B-A3B
35B~21GB 4-bitapache-2.0可商用需代理ollama run fredrezones55/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive:Q4_K_P 等 4 种
Qwen3.6-40B (DavidAU)
量化自 Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking
40B~24GB 4-bitapache-2.0可商用需代理llama-cli -m <gguf-file> -p '你的提示' 等 2 种

常见坑

  • DavidAU 的 Fable/Claude 蒸馏版仅约 4000 样本训练,不足以转移能力,可能反而降低质量 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • 蒸馏版实测出现连贯性问题和细微错误,标准基础模型没有这些毛病 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • 类似 Qwopus 蒸馏版存在幻觉问题且耗时翻倍 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • 复杂多文件架构级编程仍不如 Claude —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • 配置 opencode 等 CLI 代理工具比 Claude Code 开箱体验更费劲 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • 部分基准测试中表现不如 Qwen3.5 和 Gemma 4 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • API 输出速度(55 t/s)低于 Qwen3.5(76 t/s) —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
  • API 价格高于 Qwen3.5 —— DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
展开其余 71 条
  • 基础模型 Qwen3.6 存在过度推理/思考循环问题,会重复表述相同逻辑 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • 复杂的多文件架构级编码任务仍需 Claude 等顶级云端模型 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • 本地 CLI agent 工具链(如 opencode)调校门槛高,不如 Claude Code 开箱即用 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • 复杂非编码任务(深度研究、信息密集文档分析)本地模型仍不及顶级云端模型 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • 编码体验并非始终出色,部分场景表现一般 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • 在 Qwen 推荐的 temperature 1.0 采样下推理质量波动较大 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • 架构设计被质疑像是在 Transformer 里加 LSTM,存在争议 —— sahilchachra/Unlimited-OCR-GGUF
  • 对长对话场景的适用性尚不明确 —— sahilchachra/Unlimited-OCR-GGUF
  • HN 讨论量有限,缺乏大规模实际使用反馈 —— sahilchachra/Unlimited-OCR-GGUF
  • 安装过程非常折腾,英文文档质量差,社区反馈其为「见过最难安装的开源软件」 —— PaddlePaddle/PP-OCRv6_medium_det_safetensors
  • 精度不如同规模的 Gemma 4 26B 自回归模型,Google 官方建议质量优先时用 Gemma 4 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • 预填充(prefill)性能未改善,是网页搜索/工具调用场景的瓶颈 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • 高 QPS 云服务场景下并行解码优势递减,可能导致更高的服务成本 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • 内容审查比 Gemma 4 31B 更严格,无法处理 NSFL 内容 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • llama.cpp 支持在社区讨论时尚未就绪,本地部署选项受限 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • 社区实测中标准 Q4_0 的 top-1 准确率比 QAT Q4_0 高约 13%(以 Q8_0 为参照) —— unsloth/gemma-4-31B-it-qat-GGUF
  • 长文档场景下 QAT Q4_0 top-1 准确率仅 28.57% vs Q8_0,远低于 Q4_K_M 的 77% —— unsloth/gemma-4-31B-it-qat-GGUF
  • Q4_K_M 在所有指标上均优于 QAT Q4_0 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 数学能力明显弱于 Q8 版本 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 存在忽略系统提示词的问题 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 31B 的 MTP assistant 模型效果不佳,接受率偏低 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 社区基准测试的非对等比较使 QAT 实际质量难以定论 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 编程任务在默认 temperature=1.0 下输出充满低级错误,需降至 0.3 或更低 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • 有用户称其为'最差的模型',在代码分析任务中给出大量错误建议 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • QAT 技术来自 Google,Unsloth 仅做格式转换,非独立改进 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • 非 QAT 版 Unsloth Q4_K_XL 中大量 tensor 使用了 q5/q6/q8 精度,可能影响量化一致性 —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • 有用户打出 4/10 评分并转回使用 Qwen —— lmstudio-community/gemma-4-12B-it-GGUF
  • 低量化版本可能产生大量语法错误,曾有文件需手动修改 23 处 —— lmstudio-community/gemma-4-12B-it-GGUF
  • Q8_0 量化生成速度骤降至约 25 t/s —— lmstudio-community/gemma-4-12B-it-GGUF
  • assistant 模型尚无 GGUF 量化版本 —— lmstudio-community/gemma-4-12B-it-GGUF
  • MTP 支持在 llama.cpp 中仍处于开发中 —— lmstudio-community/gemma-4-12B-it-GGUF
  • 30GB 活跃权重的模型推测仅约 10 t/s,交互体验很慢 —— lmstudio-community/gemma-4-12B-it-GGUF
  • 被认为适合一次性/原型项目,在有长期维护需求的产品中可能成为瓶颈 —— numind/NuExtract3
  • MMLU Pro 上退化最明显,世界知识有所损失 —— unsloth/Qwen3.5-9B-MTP-GGUF
  • 量化后模型与原始 16 位版本不完全等同 —— unsloth/Qwen3.5-9B-MTP-GGUF
  • 复杂多文件架构级任务仍需Claude,本地模型无法完全替代 [0] —— unsloth/Qwen3.6-27B-GGUF
  • CLI编程代理(如opencode)的调优远不如Claude Code开箱即用,需要大量配置 [0] —— unsloth/Qwen3.6-27B-GGUF
  • 27B密集模型推理速度慢,在M5 Max上仅24 tok/s,远低于35B-A3B的65 tok/s [2] —— unsloth/Qwen3.6-27B-GGUF
  • 35B-A3B变体在复杂任务上表现很差,几乎不可用 [3] —— unsloth/Qwen3.6-27B-GGUF
  • 部分用户无法复现27B对Coder-Next的优势,实际体验存在个体差异 [1] —— unsloth/Qwen3.6-27B-GGUF
  • 在部分基准测试上表现落后于Qwen3.5-27B和Gemma 4 31B [10] —— unsloth/Qwen3.6-27B-GGUF
  • 输出生成速度低于Qwen3.5-27B,55 tok/s vs 76 tok/s [12] —— unsloth/Qwen3.6-27B-GGUF
  • Qwen3.5-27B的API调用价格更便宜 [12] —— unsloth/Qwen3.6-27B-GGUF
  • 在笔记本上本地运行不适合严肃编码工作,建议使用独立Mac Mini或服务器 [4] —— unsloth/Qwen3.6-27B-GGUF
  • Think模式的推理词链可能导致文档合成任务出现循环删减 [3] —— unsloth/Qwen3.6-27B-GGUF
  • 在商业备忘录和文档合成任务上,Coder-Next单次成功运行成本低60-100倍 [3] —— unsloth/Qwen3.6-27B-GGUF
  • CPU-only 推理速度慢约 30%:Unsloth GGUF 在纯 CPU 环境下比同类量化同行的 t/s 低约 30% —— unsloth/Qwen3.6-35B-A3B-GGUF
  • CPU-only 下 followup 响应延迟高:首次后续响应延迟 25-29 秒,而同类替代方案仅为 14-20 秒 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • CUDA 13.2 兼容性问题:已知在 CUDA 13.2 环境下产生乱码输出 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • Ollama 需要用户自行调整才能正常使用 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • HuggingFace 硬件兼容性组件不识别 K_P 量化,需手动到 Files 页面查看全部下载 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • LM Studio 中 K_P 量化显示为"?"(仅外观问题,模型可正常加载) —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • 长上下文场景下的人工测试时间不如作者其他发布充分,可能在极端情况遇到边缘问题 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • Google 引入了类似 GenRM 的内部审查机制,其正无审查版本难度持续增加 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • Ollama 上的边缘模型仅支持纯音频或纯视觉,同时使用会崩溃,且剥离多模态的版本不推荐使用 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • 2B 版本(E2B)能力有限,不应期望匹敌 7B 以上模型 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • Heretic v2版本已推出且声称拒绝率更低,此版本可能已被迭代 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • MoE稀疏变体(如35B A3B)的Heretic版本尚未可用,调优稀疏MoE需大量VRAM和时间 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 无Discord等社区支持渠道 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • MTP(多令牌预测)支持状态不明 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • IQ2_M级别量化仍有约17%性能损失 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 即使经过Heretic处理,仍有4%拒绝率残留 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 显存需求高:Q4_K_P约20GB,Q6_K_P 31GB,Q8_K_P 44GB;多模态需额外加载mmproj(899MB)。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 某些推理框架(如llama.cpp)需手动设置`--jinja`或`enable_thinking:false`以关闭思维链。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • Aggressive变体虽无拒绝但可能输出简短免责声明(基座训练固有),并非完全空白。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 量化版本众多(含K_P自定义量化),需注意HF硬件兼容性组件不识别K_P,需手动查看文件列表。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 需手动禁用思考模式(编辑 jinja 模板或传参 enable_thinking=false) —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 无独立社区评测,仅有作者自述无智能退化 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 模型名过长,社区以调侃方式表达不满 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
  • "Opus"标签被质疑更多是命名营销而非实质提升 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 性能对比仅止于"不更差",缺乏明确的优势证据 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF

收藏本页,或 订阅 RSS 追踪每日更新。