指南 / 视觉理解模型

视觉理解模型

共 34 个 · 数据更新于 2026-09-15

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

  • Qwen3.8-27B-TWIN-TURBO (DavidAU)

    量化自 Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored

    27B图像文本微调GGUF,面向本地硬件推理

    参数量
    27B
    商用
    可商用

    当前运行配置 DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF

    显存
    ~57GB BF16(估算)
    查看详情
    查看运行方式
    llama-server -hf DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF
    许可证
    Apache-2.0
    上下文
    256k
    国内可达
    需代理
  • Swift-Qwen3.8-27B-GGUF (UkisAI)

    量化自 Swift-Qwen3.8-27b

    Qwen3.8-27B 低思考 token GGUF,支持图像输入

    参数量
    27B
    商用
    需自查

    当前运行配置 ukisai/Swift-Qwen3.8-27B-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf ukisai/Swift-Qwen3.8-27B-GGUF:Q4_K_M --jinja -fa on -ngl 99 -c 262144 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0 --presence-penalty 0 --repeat-penalty 1.0
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Swift Open License v1.0 (gated)
    上下文
    262k
    国内可达
    需代理
  • Qwen3.8-27B (ISTA-DASLab)

    量化自 Qwen3.8-27B

    GSQ-RCO 非均匀 GGUF 量化,含视觉投影器

    参数量
    27B
    商用
    可商用

    当前运行配置 ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Qwen3.8-27B-TURBO-Fable-Cold-Fusion (DavidAU)

    量化自 Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NM-DAU

    图像文本多模态 GGUF,面向本地消费级硬件部署

    参数量
    27B
    商用
    可商用

    当前运行配置 DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF

    显存
    ~57GB BF16(估算)
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    许可证
    apache-2.0
    上下文
    256k
    国内可达
    需代理
  • Tiel-Coder-35B-A3B-GGUF (peculiar-ragdoll)

    量化自 Ornith-1.5-35B-A3B

    35B-A3B 编程模型,本地 Agent 编码

    参数量
    35B-A3B
    商用
    可商用

    当前运行配置 peculiar-ragdoll/Tiel-Coder-35B-A3B-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf peculiar-ragdoll/Tiel-Coder-35B-A3B-GGUF --hf-file Tiel-Coder-35B-A3B-UD-Q4_K_XL.gguf -ngl 99 --jinja
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • 27B GGUF 量化,Sharp 模板+MTP,视觉

    参数量
    27B
    商用
    可商用

    当前运行配置 peculiar-ragdoll/Dirk-Qwen3.8-27B-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf peculiar-ragdoll/Dirk-Qwen3.8-27B-GGUF:Q4_K_XL -ngl 99
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • 去拒绝版 Qwen3.8-27B GGUF,多模态本地推理

    参数量
    27B
    商用
    可商用

    当前运行配置 huihui-ai/Huihui-Qwen3.8-27B-abliterated-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run huihui_ai/Qwen3.8-abliterated
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    262k
    国内可达
    需代理
  • Qwen3.8-27B-Cold-Fusion-GAIN-V1.1 (DavidAU)

    量化自 Qwen3.8-27B-Cold-Fusion-GAIN-V1.1

    Qwen3.8-27B 微调 GGUF,减思考 token 支持视觉

    参数量
    27B
    商用
    可商用

    当前运行配置 DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF

    显存
    ~57GB BF16(估算)
    查看详情
    查看运行方式
    llama-server -hf DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF
    许可证
    Apache-2.0
    上下文
    256k
    国内可达
    需代理
  • 27B 未审查 GGUF,带视觉与 FastMTP

    参数量
    27B
    商用
    可商用

    当前运行配置 HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF --jinja
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262k 原生
    国内可达
    需代理
  • Qwen3.8-27B (LM Studio)

    量化自 Qwen3.8-27B

    Qwen3.8-27B 量化版,本地图文对话与转写

    参数量
    27B
    商用
    可商用

    当前运行配置 lmstudio-community/Qwen3.8-27B-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf lmstudio-community/Qwen3.8-27B-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    262k
    国内可达
    需代理
    其它形态
    GGUF·lmstudio · GGUF·atomicchat · GGUF·unsloth
  • Qwen3.8-27B 混合量化 GGUF,本地图文推理

    参数量
    27B
    商用
    可商用

    当前运行配置 empero-ai/Qwen3.8-27B-Ridge-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/empero-ai/Qwen3.8-27B-Ridge-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262k / YaRN 1M
    国内可达
    需代理
  • Qwen3.6-27B 无审查多模态 GGUF,本地部署

    参数量
    27B
    商用
    可商用

    当前运行配置 HauhauCS/Qwen3.6-27B-Uncensored-HauhauCS-Aggressive

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf HauhauCS/Qwen3.6-27B-Uncensored-HauhauCS-Aggressive --jinja -c 131072 -ngl 99
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262k(可扩展至 ~1M)
    国内可达
    需代理
  • Muse-Glimmer-30B (meta-models)

    量化自 Muse-Glimmer-30B

    30B GGUF 量化模型,供 LM Studio 本地推理

    参数量
    30B
    商用
    需自查

    当前运行配置 lmstudio-community/Muse-Glimmer-30B-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf lmstudio-community/Muse-Glimmer-30B-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    上下文
    128k+
    国内可达
    需代理
    其它形态
    GGUF·lmstudio · GGUF·meta-models · GGUF·unsloth
  • Inkling-Small-GGUF (Unsloth)

    量化自 Inkling-Small

    多模态文本/图像/音频输入,GGUF 量化,适合本地运行。

    参数量
    12B (激活, 276B 总)
    商用
    可商用

    当前运行配置 unsloth/Inkling-Small-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/unsloth/Inkling-Small-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • sakthai-vision-7b (Nanthasit)

    量化自 LLaVA-1.5-7b

    LLaVA-1.5-7B GGUF 量化,本地图像描述与视觉问答

    参数量
    7B
    商用
    需自查

    当前运行配置 Nanthasit/sakthai-vision-7b

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    LLaMA 2 Community
    上下文
    4k
    国内可达
    需代理
  • 无审查9B多模态模型,提升推理与指令跟随

    参数量
    9B
    商用
    需自查

    当前运行配置 DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF

    显存
    ~19GB BF16(估算)
    查看详情
    查看运行方式
    llama-server -hf DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
    许可证
    Apache 2.0
    上下文
    256k
    国内可达
    需代理
  • Warmly 0.8B (neureps)

    LoRA · 基于 Qwen3.5-0.8B-enko

    0.8B韩英图像字幕与对话,LoRA适配低内存设备

    参数量
    0.8B
    商用
    可商用

    当前运行配置 neureps/warmly-qwen35-08b-enko-gguf

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/neureps/warmly-qwen35-08b-enko-gguf
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • 多阶段微调的27B视觉模型,提升推理与创意写作

    参数量
    27B
    商用
    需自查

    当前运行配置 DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF

    显存
    ~57GB BF16(估算)
    查看详情
    查看运行方式
    ollama run hf.co/DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF
    许可证
    Apache 2.0
    上下文
    256k
    国内可达
    需代理
  • FrickFritz-4B-GGUF (fattis)

    量化自 FrickFritz-4B

    GGUF 量化,解禁角色扮演与图像描述

    参数量
    4B
    商用
    可商用

    当前运行配置 fattis/FrickFritz-4B-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/fattis/FrickFritz-4B-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • ThinkingCap-Qwen3.6-27B (bottlecapai)

    量化自 ThinkingCap-Qwen3.6-27B

    视觉语言模型,思考令牌减半,GGUF量化,适合本地运行

    参数量
    27B
    商用
    需自查

    当前运行配置 bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:Q4_K_M --mmproj bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:mmproj-ThinkingCap-Qwen3.6-27B-f16.gguf
    为何暂无估算
    权重格式未知,无法估算显存
    国内可达
    需代理
  • Unlimited-OCR (Baidu)

    量化自 Unlimited-OCR

    3B 视觉语言 OCR 模型,文档解析与 Markdown 转换

    参数量
    3B
    商用
    可商用

    当前运行配置 sahilchachra/Unlimited-OCR-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    huggingface-cli download sahilchachra/Unlimited-OCR-GGUF --include Unlimited-OCR-Q4_K_M.gguf mmproj-Unlimited-OCR-F16.gguf --local-dir ./uocr
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    国内可达
    需代理
  • 轻量级多语言文本检测模型,48语种,服务端/边缘可用

    参数量
    15.5M
    商用
    可商用

    当前运行配置 PaddlePaddle/PP-OCRv6_medium_det_safetensors

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    python -c 'from paddleocr import TextDetection; TextDetection(model_name="PP-OCRv6_medium_det", engine="transformers").predict("image.png")' (需 paddleocr 库)

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    不适用
    国内可达
    需代理
  • DiffusionGemma-26B-A4B-it (Google)

    量化自 diffusiongemma-26B-A4B-it

    离散扩散文本生成,支持图像/视频输入,低延迟

    参数量
    25.2B (3.8B active)
    商用
    可商用

    当前运行配置 unsloth/diffusiongemma-26B-A4B-it-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    DiffusionGemmaForBlockDiffusion.from_pretrained("google/diffusiongemma-26B-A4B-it", device_map="auto")
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    上下文
    256k
    国内可达
    需代理
  • Gemma-4-31B-QAT-GGUF (unsloth)

    量化自 gemma-4-31B-it-qat-q4_0-unquantized

    Gemma 4 31B 量化图文模型,支持工具调用,本地部署

    参数量
    31B
    商用
    可商用

    当前运行配置 unsloth/gemma-4-31B-it-qat-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 4 -ngl 999
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    256k
    国内可达
    需代理
    其它形态
    GGUF·unsloth · GGUF·google · GGUF·lmstudio
  • Gemma-4-26B-A4B-QAT-GGUF (Unsloth)

    量化自 gemma-4-26B-A4B-it-qat-q4_0-unquantized

    Gemma 4 26B MoE 量化版,用于本地图像与文本推理

    参数量
    25.2B (3.8B active)
    商用
    可商用

    当前运行配置 unsloth/gemma-4-26B-A4B-it-qat-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    ollama run unsloth/gemma-4-26B-A4B-it-qat-GGUF

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0 (Gemma)
    上下文
    256K
    国内可达
    需代理
    其它形态
    GGUF·unsloth · GGUF·lmstudio
  • gemma-4-12B-it (Google)

    量化自 gemma-4-12B-it

    12B 多模态模型,支持图文音频输入,本地 GGUF 量化部署

    参数量
    12B
    商用
    可商用

    当前运行配置 lmstudio-community/gemma-4-12B-it-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama: ollama run hf.co/lmstudio-community/gemma-4-12B-it-GGUF:Q4_K_M
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    上下文
    256k
    国内可达
    需代理
    其它形态
    GGUF·lmstudio · GGUF·unsloth
  • NuExtract3 (NuMind)

    微调自 Qwen3.5-4B

    文档结构化提取和Markdown转换的4B视觉语言模型

    参数量
    4B
    商用
    可商用

    当前运行配置 numind/NuExtract3

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    vllm serve numind/NuExtract3 --trust-remote-code --limit-mm-per-prompt '{"image": 99, "video": 0}'

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    131k
    国内可达
    需代理
  • Qwen3.5-9B-MTP-GGUF (unsloth)

    量化自 Qwen3.5-9B

    Qwen3.5-9B 多模态模型,MTP 投机解码,本地快速运行

    参数量
    9B
    商用
    可商用

    当前运行配置 unsloth/Qwen3.5-9B-MTP-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp && cmake -B build -DGGML_CUDA=ON && cmake --build build --target llama-server

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    262k (可扩展至1M)
    国内可达
    需代理
  • Qwen3.6-27B-GGUF (unsloth)

    量化自 Qwen3.6-27B

    27B参数GGUF版,本地AI原型开发

    参数量
    27B
    商用
    可商用

    当前运行配置 unsloth/Qwen3.6-27B-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama.cpp: ./main -m Qwen3.6-27B-Q4_K_M.gguf
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    262k (可扩展至1M)
    国内可达
    需代理
    其它形态
    GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP
  • Qwen3.6-35B-A3B-GGUF (Unsloth)

    量化自 Qwen3.6-35B-A3B

    35B MoE仅3B激活的GGUF量化版,适合本地中文开发

    参数量
    35B (3B 激活)
    商用
    可商用

    当前运行配置 unsloth/Qwen3.6-35B-A3B-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    262k (可扩展至1M)
    国内可达
    需代理
    其它形态
    GGUF·unsloth · GGUF·lmstudio · GGUF·unsloth·MTP
  • Gemma-4-E4B-Aggressive (HauhauCS)

    量化自 gemma-4-e4b-it

    无审查的Gemma 4多模态模型,适合内容生成开发者

    参数量
    4B
    商用
    限制商用

    当前运行配置 HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    llama-cli -m ./gemma4-unc/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf --mmproj ./gemma4-unc/mmproj-Gemma-4-E4B-Uncensored-HauhauCS-Aggressive-f16.gguf --jinja -c 8192 -ngl 99

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Gemma
    上下文
    131k
    国内可达
    需代理
  • Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF (DavidAU)

    量化自 Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinking

    解禁版Qwen3.6-27B量化模型,为创意写作与代码而生

    参数量
    27B
    商用
    可商用

    当前运行配置 DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF

    显存
    ~57GB BF16(估算)
    查看详情
    查看运行方式
    llama-server -hf DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
    许可证
    apache-2.0
    上下文
    256k
    国内可达
    需代理
  • 35B MoE多模态去审查模型,适合本地无限制输出

    参数量
    35B
    商用
    可商用

    当前运行配置 HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

    显存
    暂无估算
    查看详情
    查看运行方式(还有 3 种)
    ollama run fredrezones55/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive:Q4_K_P

    其它 3 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Qwen3.6-40B (DavidAU)

    量化自 Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking

    多模态无审查推理模型,面向代码与视觉应用

    参数量
    40B
    商用
    可商用

    当前运行配置 DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF

    显存
    ~84GB BF16(估算)
    查看详情
    查看运行方式(还有 1 种)
    llama-cli -m <gguf-file> -p '你的提示'

    其它 1 种运行方式见详情页

    许可证
    apache-2.0
    国内可达
    需代理

常见坑

  • 276B 总参数使权重内存成为家庭实验室的实际瓶颈 —— unsloth/Inkling-Small-GGUF
  • 需使用 add-inkling 分支的 llama.cpp 才能加载 Unsloth 量化版,mainline 无法直接加载 —— unsloth/Inkling-Small-GGUF
  • 有社区用户对 Unsloth 的量化模型(如 GLM-4.6、Step-Flash)表示失望 —— unsloth/Inkling-Small-GGUF
  • 代码生成幻觉严重,会编造不存在的API —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
  • 推理链偶尔失控,思维token出现不可控状态 —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
  • 在agentic coding方面仍落后于Claude —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
  • MTP量化需温度<1且关闭重复惩罚,否则性能下降 —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
  • 长时间运行可能感觉慢且不稳定 —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
展开其余 95 条
  • DavidAU过往模型口碑参差,部分用户对其持保留态度 —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
  • 基准测试分数与实际表现存在差距,不可全信榜单 —— DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF
  • 无法通过 strawberry 测试(字母计数),即使提示逐字符思考也失败 —— neureps/warmly-qwen35-08b-enko-gguf
  • 存在 tokenization 导致的自身缺陷不自知问题,字符级推理能力弱 —— neureps/warmly-qwen35-08b-enko-gguf
  • 在 Orange Pi Zero 2W 等超低功耗设备上运行速度极低 —— neureps/warmly-qwen35-08b-enko-gguf
  • 编程基准得分仅 1.0,远低于同系列大尺寸模型(27B 得分 33.4,122B 得分 31.6) —— neureps/warmly-qwen35-08b-enko-gguf
  • 不支持视觉(vision)输入 —— neureps/warmly-qwen35-08b-enko-gguf
  • 与 opencode/ollama 的集成存在连接问题,可能让初次使用者觉得「完全不能用」 —— neureps/warmly-qwen35-08b-enko-gguf
  • 部分 agentic 基准上基础模型表现略优于 ThinkingCap —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • 训练分布外任务的性能未经评估,真实表现未知 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • FP16 全精度部署需约 60GB VRAM,本地部署门槛不低 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • 部分基准准确率有轻微波动,如 GPQA-Diamond 从 85.5 降至 83.8,MMLU-Pro 从 85.9 降至 85.4 —— bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF
  • 架构设计被质疑像是在 Transformer 里加 LSTM,存在争议 —— sahilchachra/Unlimited-OCR-GGUF
  • 对长对话场景的适用性尚不明确 —— sahilchachra/Unlimited-OCR-GGUF
  • HN 讨论量有限,缺乏大规模实际使用反馈 —— sahilchachra/Unlimited-OCR-GGUF
  • 高精度仅限medium版本,tiny版本检测仅80.6%,差距明显 —— PaddlePaddle/PP-OCRv6_medium_det_safetensors
  • 与VLM的对比基于PaddleOCR自有基准测试,并非独立评测 —— PaddlePaddle/PP-OCRv6_medium_det_safetensors
  • 论文未提供独立第三方验证及手写或退化场景下的表现数据 —— PaddlePaddle/PP-OCRv6_medium_det_safetensors
  • 各项基准上全面弱于 Gemma 4 26B A4B,Google 官方亦承认 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • 扩散式加速对 MoE 架构的增益属中等水平(社区对比单步并行 16 token、类 MTP 方案),并非无差别 4 倍 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • 速度优势依赖专用 GPU(独显/H100 级),普通硬件上难以发挥,自部署门槛不低 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • 官方定位实验性架构,社区口碑仍不及同门 Gemma 4 26B A4B,多属技术尝鲜而非日常主力 —— unsloth/diffusiongemma-26B-A4B-it-GGUF
  • 个别实测 31B QAT 数学能力明显不如 Q8 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 同样实测反馈忽略系统提示、不调用工具 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 部分用户质疑专门选用 Unsloth GGUF 的必要性,认为自量化即可 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 社区对 QAT 与标准量化的对比基准数据存疑,认为需要更严谨验证或挑错 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 对比结果常被压成单一数字,易导致误读 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 追求速度时,NVFP4 等方案质量已接近 unsloth Q3 且快得多(如 GB10 等带宽受限设备) —— unsloth/gemma-4-31B-it-qat-GGUF
  • 与 Qwen3.6-27B 等主流竞品的选择之争仍缺社区实证结论 —— unsloth/gemma-4-31B-it-qat-GGUF
  • 编程输出简单粗暴:常给出非常基础、缺失小细节的代码,问题会随时间累积放大,即使给很具体的指令也一样(2) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • 在线实时场景速度不够:1.63s TTFT 与 46.7 t/s 对 live、面向用户的应用没有竞争力,更偏原型用途(8) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • 48k 有效上下文在一些后端支持仍较粗糙(4) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • vLLM 明显慢于 llama.cpp:约 30 t/s 对 51.57 t/s,选对推理后端很重要(14) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • 内存不足的机器(如低配 M3 Max)无法把上下文扩到实用程度(6) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • 智能/编程/智能体榜单排名中游:整体智能 #112/393、编程 #60/157、智能体 #139/300(10) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • 量化版本口碑两极:有用户在特定 Q4_K_M 上体验极差并称「最差模型」,社区建议换用 Bartowski 的量化(1)(3) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • 共享 GPU 环境下并发扩展的实际效率必然低于理想线性扩展(11) —— unsloth/gemma-4-26B-A4B-it-qat-GGUF
  • 多轮对话后会出现奇怪的循环(looping)现象,影响长对话体验。 —— lmstudio-community/gemma-4-12B-it-GGUF
  • 官方 naive Q4_0 GGUF 被指丢失原始 safetensors 中的质量,需换用 Dynamic 量化版本。 —— lmstudio-community/gemma-4-12B-it-GGUF
  • Ollama 生态只提供官方少量量化,社区认为用 Hugging Face 上的量化更优化、选择更自由。 —— lmstudio-community/gemma-4-12B-it-GGUF
  • 本地默认推理设置可能反而拉低表现,需要手动调优才能发挥模型实力。 —— lmstudio-community/gemma-4-12B-it-GGUF
  • 多模态输入有限制:音频最长 30 秒,视频最长 60 秒(按 1fps 处理)。 —— lmstudio-community/gemma-4-12B-it-GGUF
  • 进一步微调可能覆盖模型已有的专用抽取能力,二进制权重发布方式不利于需要持续重训的生产管道 —— numind/NuExtract3
  • 0.8B–9B 尺寸模型在 2–3 轮对话后输出乱码,可靠性存疑 —— unsloth/Qwen3.5-9B-MTP-GGUF
  • MTP 对通用叙事/闲聊对话的加速效果不明显 —— unsloth/Qwen3.5-9B-MTP-GGUF
  • Unsloth GGUF 比同类量化慢约 30%,且后续回复处理时间更长 —— unsloth/Qwen3.5-9B-MTP-GGUF
  • Unsloth Studio 更新后可能导致 MTP 功能突然失效 —— unsloth/Qwen3.5-9B-MTP-GGUF
  • Bartowski 量化在输出质量/「聪明程度」上优于 Unsloth 量化 —— unsloth/Qwen3.5-9B-MTP-GGUF
  • q4_0 量化质量较差,不推荐使用 —— unsloth/Qwen3.5-9B-MTP-GGUF
  • 长上下文会显著降低工具调用性能 —— unsloth/Qwen3.5-9B-MTP-GGUF
  • 未启用 MTP 的旧版 GGUF/MLX 中 MTP 层闲置浪费 VRAM —— unsloth/Qwen3.5-9B-MTP-GGUF
  • MLX 模型质量明显不如 GGUF,不推荐使用 —— unsloth/Qwen3.5-9B-MTP-GGUF
  • Imatrix 量化虽降低 KLD/PPL,但推理速度会降低 5–10% —— unsloth/Qwen3.5-9B-MTP-GGUF
  • 基准测试表现可能高于实际使用体验,部分场景实测不如 Gemma 4 —— unsloth/Qwen3.6-27B-GGUF
  • 部分编程工具 (如 qwencode) 实际体验不佳 —— unsloth/Qwen3.6-27B-GGUF
  • 与 DeepSeek Flash 相比仍有明显差距 —— unsloth/Qwen3.6-27B-GGUF
  • 低量化版本 (IQ2_M) 仅保留全精度约 83% 的质量 —— unsloth/Qwen3.6-27B-GGUF
  • 社区微调变体改变了原始模型行为,非纯原版 Qwen3.6 —— unsloth/Qwen3.6-27B-GGUF
  • 缺乏 27B 版本的 tool-eval-bench 可比得分数据 —— unsloth/Qwen3.6-27B-GGUF
  • thinking 模式下配合代码解释器时经常只写完代码就停止、不出最终输出(非 thinking 模式正常) —— unsloth/Qwen3.6-35B-A3B-GGUF
  • Q8_K_XL 档在基准上表现令人失望:解出的测试更少、报错更多,反不如 Qwen3.5 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • Q3 档位被用户认为不够可靠 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 同硬件下速度弱于部分第三方量化(实测 23 TK/sec vs 30 TK/sec) —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 推理速度仍明显慢于 Claude Sonnet 4.6 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 知识储备不如更大的 Qwen3 Next 80B,做离线知识库时差距明显 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 不同厂商量化的质量/速度差异大,ByteShape 声称其量化更快更小且保留更多基准分 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 在相同设置下不同量化的失败表现各不相同,质量以观感为准 —— unsloth/Qwen3.6-35B-A3B-GGUF
  • 实际编程体验明显落后于 Qwen3.5 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • OpenRouter 上推理速度极慢,几乎不可用 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • 长距离约束跟踪能力不如更大模型 —— HauhauCS/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive
  • 部分用户认为 DavidAU 模型比基础模型"less intelligent" —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • Heretic 模型有时会丢失非英语语言能力 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • Ollama 需手动添加模型,无法直接拉取使用 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • Q8_0 量化高负载下约 18.71 tok/s,速度有限 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 没有 MLX 版本 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 40B 版本(基于 27B)速度太慢不宜实用 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 有用户建议如果只需要 uncensored 可以用 llmfan46 的版本作为替代 —— DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 显存需求高:Q4_K_P约20GB,Q6_K_P 31GB,Q8_K_P 44GB;多模态需额外加载mmproj(899MB)。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 某些推理框架(如llama.cpp)需手动设置`--jinja`或`enable_thinking:false`以关闭思维链。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • Aggressive变体虽无拒绝但可能输出简短免责声明(基座训练固有),并非完全空白。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 量化版本众多(含K_P自定义量化),需注意HF硬件兼容性组件不识别K_P,需手动查看文件列表。 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 对提示词更敏感,含糊或欠约束的输入容易漂移,需明确写出格式、约束、范围 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 官方未提供与基座的独立对比基准,去审查对推理、编码、事实准确性的影响未经验证 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 基座本身在多数评测中并不优于 3.5 基座 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 表现高度依赖硬件配置与运行时优化 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 复杂场景下可能产生不正确、不完整或不一致的输出 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 量化 GGUF 变体的能力受量化影响,作者报告的零拒绝结果未经独立复测 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • AWQ 版本系社区多次请求后才放出,作者曾计划在额度获批后补充 BF16 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 不同去审查技术在边缘用例上的行为可能不同,选型需实测 —— HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
  • 质量存在争议,有用户认为「好坏难说」 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 相比 27B 基座模型提升不明显,有用户认为 40B 未表现出更强能力 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 基准测试数据为开发者团队自测,未经第三方独立验证 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
  • MTP 量化模式需严格控制温度 < 1 且 repetition penalty = 1,否则性能下降 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 40B 参数规模需要服务器级 GPU,不适用于消费级硬件 —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF
  • 视频实测中 40B 未能完成提示设定的核心功能,速度也慢于 27B+MTP —— DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF

收藏本页,或 订阅 RSS 追踪每日更新。