指南 / 智能体模型

智能体模型

共 57 个 · 数据更新于 2026-09-12

显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。

  • NeoHorse-1-4B (TokenRhythm)

    微调自 Qwen3.5-4B

    面向 agent 开发者的 4B 文本工具调用模型

    参数量
    4B
    商用
    可商用

    当前运行配置 TokenRhythm/NeoHorse-1-4B

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve TokenRhythm/NeoHorse-1-4B --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262k (可扩至 1.01M)
    国内可达
    魔搭可用
  • 2B 端侧文本模型,面向本地助手与 agent

    参数量
    2B
    商用
    可商用

    当前运行配置 openbmb/MiniCPM5-2B

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf openbmb/MiniCPM5-2B-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    131k
    国内可达
    魔搭可用
    其它形态
    原生 · GGUF
  • Qwen3.8-27B 微调 GGUF,面向本地 agent 工作流

    参数量
    27B
    商用
    可商用

    当前运行配置 Jackrong/Qwopus3.8-27B-Flash-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf Jackrong/Qwopus3.8-27B-Flash-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Granite-4.2-3B-MLX-6bit (IBM)

    量化自 granite-4.2-3b

    Granite 4.2 3B MLX 6bit 量化,本地推理

    参数量
    3B
    商用
    可商用

    当前运行配置 lmstudio-community/granite-4.2-3b-MLX-6bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/granite-4.2-3b-MLX-6bit
    为何暂无估算
    已有格式线索,但估算映射未支持,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Granite-4.2-8B-MLX-6bit (LM Studio)

    量化自 granite-4.2-8b

    Granite 4.2 8B 的 MLX 6-bit 量化

    参数量
    8B
    商用
    可商用

    当前运行配置 lmstudio-community/granite-4.2-8b-MLX-6bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/granite-4.2-8b-MLX-6bit
    为何暂无估算
    已有格式线索,但估算映射未支持,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Granite-4.2-30B-MLX-6bit (LM Studio)

    量化自 granite-4.2-30b

    IBM 30B MLX 6bit 量化,Mac 用

    参数量
    30B
    商用
    可商用

    当前运行配置 lmstudio-community/granite-4.2-30b-MLX-6bit

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/granite-4.2-30b-MLX-6bit --prompt "Hello"
    为何暂无估算
    已有格式线索,但估算映射未支持,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Granite-4.2-3B-MLX-8bit (LM Studio)

    量化自 granite-4.2-3b

    IBM Granite 3B MLX 量化,苹果芯片推理

    参数量
    3B
    商用
    可商用

    当前运行配置 lmstudio-community/granite-4.2-3b-MLX-8bit

    显存
    ~3.3GB 8-bit(估算)
    查看详情
    查看运行方式
    mlx_lm.generate --model lmstudio-community/granite-4.2-3b-MLX-8bit
    许可证
    apache-2.0
    国内可达
    需代理
    其它形态
    8bit · GGUF · 4bit
  • PhoneLLM Alpha 1 (Pipecat)

    微调自 NVIDIA-Nemotron-3-Nano-30B-A3B-BF16

    面向电话语音代理的 30B-A3B 微调模型

    参数量
    30B (3.5B 激活)
    商用
    需自查

    当前运行配置 pipecat-ai/phonellm-alpha-1

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve pipecat-ai/phonellm-alpha-1 --trust-remote-code
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    BSD-2-Clause(含 NVIDIA Nemotron Open Model License)
    上下文
    262k
    国内可达
    需代理
  • Qwen3.8-Flash-Next-Uncensored (orcarouter)

    量化自 Qwen3.8-Flash-Next

    Qwen3.8 GGUF,本地图像文本推理

    参数量
    3.8B
    商用
    需自查

    当前运行配置 orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    国内可达
    需代理
  • Apodex-1.1-mini (Apodex)

    微调自 Qwen3.5-35B-A3B

    面向复杂研究任务的推理型 agent 模型

    参数量
    35B-A3B
    商用
    可商用

    当前运行配置 apodex/Apodex-1.1-mini

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve apodex/Apodex-1.1-mini --max-model-len 262144 --enable-auto-tool-choice --tool-call-parser qwen3_coder --reasoning-parser qwen3
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262144
    国内可达
    需代理
  • Granite-4.2-30B (IBM)

    量化自 granite-4.2-30b

    Granite 30B MLX 8-bit,本地推理

    参数量
    30B
    商用
    可商用

    当前运行配置 ibm-granite/granite-4.2-30b

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve ibm-granite/granite-4.2-30b
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    128K (可扩展 512K)
    国内可达
    需代理
    其它形态
    原生 · GGUF · 4bit · 8bit
  • Granite-4.2-8B (IBM)

    量化自 granite-4.2-8b

    Granite 8B MLX 4bit,Mac推理

    参数量
    8B
    商用
    可商用

    当前运行配置 lmstudio-community/granite-4.2-8b-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf lmstudio-community/granite-4.2-8b-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
    其它形态
    GGUF · 4bit · 8bit
  • 27B 图像-文本到文本 GGUF,本地推理

    参数量
    27B
    商用
    可商用

    当前运行配置 orcarouter/Qwen3.8-27B-Uncensored-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf orcarouter/Qwen3.8-27B-Uncensored-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    需代理
    其它形态
    GGUF·orcarouter · GGUF·jonathancoletti
  • Qwen3.8-9B-Distill (Empero)

    微调自 Qwen3.5-9B

    全参蒸馏 9B 推理模型,面向数学/代码/工具调用

    参数量
    9B
    商用
    可商用

    当前运行配置 empero-ai/Qwen3.8-9B-Distill

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve empero-ai/Qwen3.8-9B-Distill
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • Qwen3.8-9B (Empero)

    微调自 Qwen3.5-9B

    9B 蒸馏推理模型,面向数学/代码/工具调用

    参数量
    9B
    商用
    可商用

    当前运行配置 empero-ai/Qwen3.8-9B

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve empero-ai/Qwen3.8-9B
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    需代理
  • Qwen3.8-27B-ABLITERATED (Blackfrost)

    量化自 Qwen3.8-27B-ABLITERATED-BF16

    GGUF 量化 27B 图文模型,供 llama.cpp 本地部署

    参数量
    27B
    商用
    可商用

    当前运行配置 Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF:Q4_K_M -ngl 999 --jinja -c 16384
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    需代理
  • 45M 工具调用模型,14MB 二进制跑边缘设备

    参数量
    45M
    商用
    可商用

    当前运行配置 Cactus-Compute/needle2

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    256 tokens
    国内可达
    需代理
  • BTL-4 (Bad Theory Labs)

    基于 Ornith-1.0-35B

    面向工具调用与软件工程的35B推理模型

    参数量
    35B
    商用
    需自查

    当前运行配置 badtheorylabs/BTL-4

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve badtheorylabs/BTL-4 --max-model-len 131072 --enable-auto-tool-choice --tool-call-parser qwen3_xml --reasoning-parser qwen3 --trust-remote-code
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    上下文
    262k
    国内可达
    需代理
  • fuse-1-Lite (Akahsizrr)

    微调自 LFM2.5-2.6B

    5.7B MoE,融合LFM2与Qwen编码专家,用于代码生成

    参数量
    5.7B
    商用
    需自查

    当前运行配置 Akahsizrr/fuse-1-Lite

    显存
    暂无估算
    查看详情
    查看运行方式
    mlx_lm.generate --model Akahsizrr/fuse-1-Lite-MLX --trust-remote-code
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    国内可达
    需代理
  • Qwen3.6-35B-A3B (Qwen)

    量化自 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

    35B MoE多模态GGUF,无审查角色扮演与函数调用代理

    参数量
    35B (3B激活)
    商用
    可商用

    当前运行配置 LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    262K (可扩至1M)
    国内可达
    需代理
  • Macaron-V1-Tall (MindLab)

    微调自 Qwen3.6-35B-A3B

    Mixture of LoRA 个人助手与工具编码模型

    参数量
    35B (激活 3B)
    商用
    可商用

    当前运行配置 mindlab-research/Macaron-V1-Tall

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    MIT
    上下文
    262k
    国内可达
    需代理
  • sakthai-context-0.5b-merged (Nanthasit)

    量化自 Qwen2.5-0.5B-Instruct

    边缘工具调用模型,基于 Qwen2.5-0.5B,可在树莓派运行

    参数量
    0.5B
    商用
    可商用

    当前运行配置 Nanthasit/sakthai-context-0.5b-merged

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/Nanthasit/sakthai-context-0.5b-merged

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • Qwen3.6-35B-A3B (LuffyTheFox)

    量化自 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

    无审查多模态MoE,经Genesis去噪,适合角色扮演和代理

    参数量
    35B (3B active)
    商用
    可商用

    当前运行配置 LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF --jinja -ngl 99
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    262K
    国内可达
    需代理
  • antares-1b (fdtn-ai)

    微调自 granite-4.0-1b

    1B 参数语言模型,用于轻量推理与微调实验

    参数量
    1B
    商用
    需自查

    当前运行配置 fdtn-ai/antares-1b

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    国内可达
    需代理
  • grug-27b (ProCreations)

    微调自 Qwen3.6-27B

    27B 令牌高效推理模型,用于智能体与工具调用

    参数量
    27B
    商用
    可商用

    当前运行配置 ProCreations/grug-27b

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve ProCreations/grug-27b --reasoning-parser qwen3 --max-model-len 32768
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • BTL-3 (Bad Theory Labs)

    LoRA · 基于 Qwen3.6-27B

    27B 开源代理模型,面向代理编程与结构化工具调用

    参数量
    27B
    商用
    可商用

    当前运行配置 badtheorylabs/BTL-3

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve Qwen/Qwen3.6-27B --revision 6a9e13bd6fc8f0983b9b99948120bc37f49c13e9 --served-model-name BTL-3 --enable-lora --max-lora-rank 32 --lora-modules BTL-3=badtheorylabs/BTL-3 --lora-target-modules q_proj k_proj v_proj o_proj in_proj_qkv in_proj_z in_proj_b in_proj_a out_proj gate_proj up_proj down_proj --reasoning-parser qwen3 --language-model-only --max-model-len 32768
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    需代理
  • KAT-Coder-V2.5-Dev (KwaiKAT)

    基于 Qwen3.6-35B-A3B

    35B MoE编程代理模型,为代码修复与终端任务设计

    参数量
    35B(3B激活)
    商用
    可商用

    当前运行配置 Kwaipilot/KAT-Coder-V2.5-Dev

    显存
    暂无估算
    查看详情
    查看运行方式
    vllm serve Kwaipilot/KAT-Coder-V2.5-Dev --language-model-only --reasoning-parser qwen3
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    256k
    国内可达
    需代理
  • Qwen3.6-35B-A3B-Genesis-Hermes-V5-GGUF (LuffyTheFox)

    量化自 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

    无审查多模态 MoE,支持 Hermes 工具调用,为创作者

    参数量
    35B (激活 3B)
    商用
    可商用

    当前运行配置 LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF --jinja
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    262K (可扩展至 1M)
    国内可达
    需代理
  • 无审查视觉 MoE 模型,Hermes 工具调用,GGUF 本地推理

    参数量
    35B (3B 激活)
    商用
    可商用

    当前运行配置 LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF --jinja
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262K (可扩展至 1M)
    国内可达
    需代理
  • MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking (GnLOLot)

    量化自 MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking

    1B 工具调用思考模型 GGUF 量化,本地运行

    参数量
    1B
    商用
    可商用

    当前运行配置 GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    128k
    国内可达
    需代理
  • MaralGPT-Mythos-9B (MaralGPT)

    量化自 Qwen3.5-9B

    无审查 Qwen3.5-9B 微调,用于网络安全与生物医学

    参数量
    9B
    商用
    可商用

    当前运行配置 MaralGPT/MaralGPT-Mythos-9B-2606-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    ollama run hf.co/MaralGPT/MaralGPT-Mythos-9B-2606-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    1M
    国内可达
    需代理
  • Gemma-4-12B Agentic v2 (yuxinlu1)

    微调自 gemma-4-12B-it

    编程与工具调用代理微调,供开发者本地使用

    参数量
    12B
    商用
    可商用

    当前运行配置 yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF -ngl 99 --jinja
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    16k(示例命令)
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • 无审查Gemma4-26B MoE,适用于代理编码与创意写作

    参数量
    26B-A4B
    商用
    限制商用

    当前运行配置 HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -m Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf --mmproj mmproj-Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-BF16.gguf -md mtp-gemma-4-26B-A4B-it.gguf --spec-type draft-mtp -ngl 99 -fa on (需下载3个文件)
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    gemma
    上下文
    256k
    国内可达
    需代理
  • 未审查 1M 上下文 Qwen3.5 微调,支持工具调用

    参数量
    9B
    商用
    可商用

    当前运行配置 huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-cli -hf huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF --model Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-Q4_K.gguf -ngl 99 -c 262144 -fa on -np 1 --spec-type draft-mtp --spec-draft-n-max 2
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    1M
    国内可达
    需代理
  • Qwopus-3.6-35B-A3B-Coder (Jackrong)

    LoRA · 基于 Qwopus3.6-35B-A3B-v1

    关闭思考的编码代理模型,降低 token 延迟,适合本地工作流

    参数量
    35B (3B 激活)
    商用
    可商用

    当前运行配置 Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    llama-server -hf Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF -m qwopus-35b-a3b-coder-q5_k_m.gguf

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    国内可达
    需代理
  • Qwen-AgentWorld-35B-A3B (Qwen)

    量化自 Qwen-AgentWorld-35B-A3B

    语言世界模型,模拟7类agent交互环境

    参数量
    35B (3B激活)
    商用
    可商用

    当前运行配置 Qwen/Qwen-AgentWorld-35B-A3B

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    vllm serve Qwen/Qwen-AgentWorld-35B-A3B --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --reasoning-parser qwen3 --trust-remote-code

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    262k
    国内可达
    魔搭可用
    其它形态
    原生 · GGUF
  • Gemma-4-31B-it (Google)

    量化自 gemma-4-31B-it

    IQ2_M 31B 多模态 Agent,10 GiB 本地运行

    参数量
    31B
    商用
    限制商用

    当前运行配置 pearsonkyle/gemma-4-31b-imatrix-GGUF

    显存
    ~11GB 2-bit(估算)
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/pearsonkyle/gemma-4-31b-imatrix-GGUF:IQ2_M

    其它 1 种运行方式见详情页

    许可证
    gemma
    国内可达
    需代理
  • Qwen3.6-27B-AEON-Uncensored (AEON-7)

    量化自 Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16

    无审查的27B视觉语言模型,用于多模态对话与图像理解

    参数量
    27B
    商用
    可商用

    当前运行配置 mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF

    显存
    ~57GB BF16(估算)
    查看详情
    查看运行方式(还有 1 种)
    ollama run hf.co/mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF:Q4_K_M

    其它 1 种运行方式见详情页

    许可证
    apache-2.0
    国内可达
    需代理
  • Qwen3.6-27B-Uncensored (AEON-7/mradermacher)

    量化自 Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16

    27B 无审查多模态混合模型,本地创作者使用

    参数量
    27B
    商用
    可商用

    当前运行配置 mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF

    显存
    ~57GB BF16(估算)
    查看详情
    查看运行方式(还有 1 种)
    llama-server -hf mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF

    其它 1 种运行方式见详情页

    许可证
    apache-2.0
    国内可达
    需代理
  • Gemma4-12B-Uncensored (HauhauCS)

    量化自 gemma-4-12B-it

    解除审查的Gemma4多模态模型,面向代理编码与创意写作

    参数量
    12B
    商用
    限制商用

    当前运行配置 HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -m Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf -md mtp-gemma-4-12B-it.gguf --spec-type draft-mtp --mmproj mmproj-Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced-BF16.gguf -ngl 99 -fa on (需先下载gguf及mmproj文件)
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    gemma
    上下文
    256K
    国内可达
    需代理
  • Qwopus3.6-27B-Coder (Jackrong)

    量化自 Qwopus3.6-27B-Coder

    27B编码器GGUF,兼容多种工具历史格式,供本地开发者使用

    参数量
    27B
    商用
    可商用

    当前运行配置 Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF (需代理下载)
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    32K
    国内可达
    需代理
  • Qwythos-9B (Empero)

    微调自 Qwen3.5-9B

    开源 9B 推理模型,不审查,支持 1M 上下文和函数调用

    参数量
    9B
    商用
    需自查

    当前运行配置 empero-ai/Qwythos-9B-Claude-Mythos-5-1M

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    vllm serve empero-ai/Qwythos-9B-Claude-Mythos-5-1M --max-model-len 1010000

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    上下文
    1M
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • 万亿参数 MoE 编码智能体,长周期复杂任务更省 token、工具调用更强

    参数量
    1.1T
    商用
    需自查

    当前运行配置 moonshotai/Kimi-K2.7-Code

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    other
    国内可达
    魔搭可用
  • 云端旗舰,225B 参数稀疏 MoE,专为智能体编程和长周期任务设计

    参数量
    225.8B
    商用
    可商用

    当前运行配置 poolside/Laguna-M.1

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    需代理
  • 原生多模态 1M 上下文 MoE 模型,融合图文与视频理解,擅长编程及智能体协作

    参数量
    427B
    商用
    需自查

    当前运行配置 MiniMaxAI/MiniMax-M3

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    other
    国内可达
    魔搭可用
  • 面向真实生产力场景的智能体模型,统一推理、工具调用与执行闭环

    参数量
    396.8B
    商用
    可商用

    当前运行配置 nex-agi/Nex-N2-Pro

    显存
    暂无估算
    查看详情
    暂无收录命令

    本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    国内可达
    魔搭可用
  • 3B活跃参数的通用Agent,自动研究/编程/推理

    参数量
    35B (3B激活)
    商用
    可商用

    当前运行配置 AlexWortega/SIQ-1-35B

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    python -m sglang.launch_server --model-path AlexWortega/SIQ-1-35B --tp 2 --context-length 131072 --reasoning-parser qwen3 --tool-call-parser qwen3 --port 8080

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    131k
    国内可达
    需代理
  • 面向无思考代理编码的MTP微调版,本地GGUF推理

    参数量
    27B
    商用
    可商用

    当前运行配置 bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    ollama run hf.co/bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    256k
    国内可达
    需代理
  • Qwopus-3.6-27B-Coder (Jackrong)

    LoRA · 基于 Qwopus3.6-27B-v2

    面向代理编码与工具调用的27B推理模型

    参数量
    27B
    商用
    可商用

    当前运行配置 Jackrong/Qwopus3.6-27B-Coder-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -hf Jackrong/Qwopus3.6-27B-Coder-GGUF
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    32K
    国内可达
    需代理
    其它形态
    GGUF·jackrong · GGUF·jackrong·MTP
  • Qwable-v1 (lordx64)

    微调自 Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled

    Qwen3.6基MoE代理编码模型(3B激活)

    参数量
    35B (3B 激活)
    商用
    可商用

    当前运行配置 lordx64/Qwable-v1

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    llama-cli -hf lordx64/Qwable-v1-GGUF:IQ4_XS -p "Hello"(需代理)

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    AGPL-3.0
    国内可达
    需代理
  • North-Mini-Code-1.0 (CohereLabs)

    量化自 North-Mini-Code-1.0

    30B总/3B激活的MoE代码代理模型,专注代码生成与终端任务

    参数量
    30B总 / 3B激活
    商用
    可商用

    当前运行配置 CohereLabs/North-Mini-Code-1.0

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    vllm serve CohereLabs/North-Mini-Code-1.0

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    256K
    国内可达
    需代理
    其它形态
    原生 · GGUF
  • 1B 模型 GGUF 量化,本地 agent 与边缘部署用

    参数量
    1B
    商用
    可商用

    当前运行配置 openbmb/MiniCPM5-1B

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    vllm serve openbmb/MiniCPM5-1B --port 8000

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    128k
    国内可达
    魔搭可用
    其它形态
    原生 · GGUF
  • Qwopus3.6-27B-v2-MTP-GGUF (Jackrong)

    LoRA · 基于 Qwen3.6-27B

    多Token预测推理模型,面向编码、数学、DevOps开发者

    参数量
    27B
    商用
    可商用

    当前运行配置 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 1 种)
    llama.cpp server -m qwopus3.6-27b-v2-mtp.Q4_K_M.gguf -ngl 99

    其它 1 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache 2.0
    上下文
    128k
    国内可达
    需代理
    其它形态
    GGUF·jackrong·MTP · GGUF·jackrong
  • Qwopus3.5-9B-Coder-MTP (Jackrong)

    LoRA · 基于 Qwopus3.5-9B-v3.5

    9B多令牌预测代码模型,GGUF量化,面向代码推理

    参数量
    9B
    商用
    可商用

    当前运行配置 Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    ollama run hf.co/Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF:Q4_K_M

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    apache-2.0
    上下文
    128k
    国内可达
    需代理
    其它形态
    GGUF·jackrong·MTP · GGUF·jackrong
  • SuperGemma4-26B (Jiunsong)

    量化自 gemma-4-26B-A4B-it

    Gemma4 26B 无审查 MLX, 本地代理加速

    参数量
    26B (4-bit)
    商用
    限制商用

    当前运行配置 Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2

    显存
    ~16GB 4-bit(估算)
    查看详情
    查看运行方式(还有 1 种)
    mlx_lm.server --model Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2

    其它 1 种运行方式见详情页

    许可证
    gemma
    国内可达
    需代理
  • Gemma4 无审查多模态 MoE,面向创意写作与角色扮演

    参数量
    26B (25.2B total, 3.8B active)
    商用
    可商用

    当前运行配置 HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced

    显存
    暂无估算
    查看详情
    查看运行方式
    llama-server -m Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-Q4_K_P.gguf --mmproj mmproj-Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-f16.gguf --jinja -c 32768 -ngl 99
    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    Apache-2.0
    上下文
    256K
    国内可达
    需代理
  • SuperGemma4-26B-Uncensored (Jiunsong)

    量化自 gemma-4-26B-A4B-it

    无审查Gemma 4 26B GGUF,适合苹果硅本地快速推理

    参数量
    26B
    商用
    限制商用

    当前运行配置 Jiunsong/supergemma4-26b-uncensored-gguf-v2

    显存
    暂无估算
    查看详情
    查看运行方式(还有 2 种)
    ollama run hf.co/Jiunsong/supergemma4-26b-uncensored-gguf-v2

    其它 2 种运行方式见详情页

    为何暂无估算
    权重格式未知,无法估算显存
    许可证
    gemma
    国内可达
    需代理

常见坑

  • 授权后仍无法访问模型(gated 模型流程问题) —— fdtn-ai/antares-1b
  • 存在拒绝边界模糊的问题("It can't say no?") —— fdtn-ai/antares-1b
  • 复现结果有备注(caveats),无法完全复现声称效果 —— fdtn-ai/antares-1b
  • 基准测试声称介于 GLM 5.2 与 Opus 4.8 之间,但实际表现远逊于 GLM 5.2 —— Kwaipilot/KAT-Coder-V2.5-Dev
  • Q4_K_P 及以下量化等级编程能力显著下降,高量化或全精度才能保持编程质量 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
  • Plus 版本因用户反馈基准一致性测试失败已被删除 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
  • 编程能力不如同系列 27B Genesis 版本 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
  • Q4KM 量化在复杂真实任务上质量衰减明显,与全精度版本差距大 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
展开其余 132 条
  • 系统提示必须以 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' 开头,否则性能下降 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
  • NL2Repo 编程基准仅 29.4%,与最佳模型差距 26.5 个百分点 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
  • 公开排行榜排名 #114/215,综合得分 50.44/100 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
  • Q8_K_P 量化需约 43.6 GB 显存,硬件门槛较高 —— LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF
  • 训练数据集被社区称为'简单秘密数据集'(simple secret dataset),蒸馏自 Claude、GPT 等商用模型,数据来源与可复现性存疑 —— MaralGPT/MaralGPT-Mythos-9B-2606-GGUF
  • 发布时个人网站因访问量过大宕机,无法正常访问 —— MaralGPT/MaralGPT-Mythos-9B-2606-GGUF
  • 生成代码偶有低级语法错误:会多打括号/括号不配对、用逗号分隔函数定义,需手工修正 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 低量化有损:Q4 以下质量明显下滑(serious degradation),用低量化需有预期 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 多模态语音在长上下文(约 4k-8k)下会不回指令/失效,纯文本模式才正常,agent 场景建议纯文本 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 本地设置容易搞坏体验:社区普遍反馈「卡是好卡,但你的本地配置可能在毁它」 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 技术向口碑有分歧:不少用户仍认为纯问答、写码、agent 类活儿 Qwen 更稳 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 工具调用与 agentic 需要调参:社区常在求教开启 tool calling 与 agentic 的参数与思路,默认配置不一定好用 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • v2 微调偏科:通用知识(MMLU-Pro)比基础卡略低,是聚焦 coding+agentic 的取舍 —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 综合榜单排名一般:综合榜 218 款里排第 147,公开分 47.32/100(标注为估算,仅 12 行基准) —— yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
  • 在工具调用/自定义 harness 编码评测中表现显著弱于其单次编码成绩,实际 agent 场景可靠性存疑 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • HauhauCS 作者在社区中拒绝与用户讨论和对话,引发部分用户不满 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • 去审查版本有时需要先「说服自己」才能输出,并非所有场景都立即响应 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • HauhauCS 的 31B 版本已宣布但尚未发布,目前仅有 26B 和更小的 E4B/E2B 可用 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • 不同 API 提供商之间性能差异巨大,TTFT 从 0.68s 到 5.51s 不等,输出速度相差近 5 倍 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • 在编码/agent 任务上明显落后于 Qwen3.6-35B-A3B(Terminal-Bench 2.0 差距 +8.6 分) —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • 社区有反馈称其实际表现与模型卡上的全面提升描述存在落差,有时甚至弱于前代 —— HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
  • 1M 上下文窗口在实际个人配置中无法达到,实际可用窗口受 RAM 和 Ollama 设置限制 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
  • 9B 参数规模决定了它不是前沿模型,推理能力有上限 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
  • 加载速度可能偏慢 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
  • 没有内置记忆等附加功能,仅是一个纯推理模型 —— huihui-ai/Huihui-Qwythos-9B-Claude-Mythos-5-1M-abliterated-GGUF
  • 部分用户反映社区微调版本在实际使用中无法正常工作 —— Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF
  • 3.6 基础模型本身已减少过度思考,使得思考关闭微调的必要性降低 —— Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF
  • Qwen 团队对该模型的定位说明不清,导致社区普遍困惑其实际用途 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 模型训练目标为环境模拟/世界建模,并非直接作为 agent 使用;社区反馈明确指出'用它当 agent 并不是设计初衷' —— Qwen/Qwen-AgentWorld-35B-A3B
  • 在代码任务上弱于 Qwen3.6-27B,差距明显 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 在代码挑战中有时需要额外几轮 prompt 才能产出可用结果 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 个人测试中难以评估其世界建模能力,缺乏实用的评估方法 —— Qwen/Qwen-AgentWorld-35B-A3B
  • 深度推理仍无法触及前沿闭源模型水平 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
  • 有用户表示 90% 的场景更偏好 Qwen 3.6 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
  • 在手机上运行速度偏慢 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
  • 有用户认为 Qwen 3.6 完全碾压 Gemma 4 —— pearsonkyle/gemma-4-31b-imatrix-GGUF
  • 编码速度远慢于35B-A3B,fp8版本仅7 tok/s(35B-A3B为25 tok/s),MacBook上24 tok/s(35B-A3B为65 tok/s) —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • 代码输出可能需要更多review和实现轮次,成本高于预期 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • AEON版本在部分用户那失败率过高 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • GGUF格式无法在vllm中使用 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • NVFP4量化在agent模式下不如高精度量化彻底,Copilot工作流中出现循环问题 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • 编码工作推荐FP8而非NVFP4,尽管解码更慢 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • 不适合高并发或agentic为主的工作流,35B-A3B更优 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • MTP是专用VRAM Blackwell变体,非通用升级,DGX Spark上DFlash反超MTP 26%-52% —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-i1-GGUF
  • 部分用户反馈 AEON abliteration 变体失败率偏高,不如 prismascout 的量化质量 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
  • GGUF 格式无法在 vLLM 中使用,对生态兼容性构成限制 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
  • 在 DGX Spark 上运行 MTP 或在专用 VRAM 上运行 DFlash 均为实测损失,不应混用 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
  • n=12 投机令牌在 DGX Spark 上与 CUDA device-side assert 崩溃相关,建议 n=10 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
  • 质量与速度的权衡高度依赖具体工作负载,同一模型在不同任务上表现差异显著 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
  • 4090 上 TG512 生码速度仅约 45.81 tok/s,生成速度在部分场景下仍显不足 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
  • 35B-A3B 的 NVFP4 量化在 Agent 工作流中已知损坏,选型时需避开 —— mradermacher/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16-GGUF
  • 编程能力普遍不如同尺寸竞品(如 Qwen 3.6 35B A3B),尤其智能体编程场景差距明显 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
  • QAT 版在长上下文实战中 compaction 后容易迷失,需要大量人工推动 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
  • 部分边缘 prompt 首次会回避,需重新提问或策略性措辞才能获得完整输出 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
  • "优于两倍大模型"说法仅限同家族内比较(对比 Gemma 3 27B),不代表超越其他实验室同尺寸模型 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
  • 非 QAT 版在工具调用上存在问题,实际对比中输出代码但功能未实现 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
  • E2B 版本音频处理存在问题,作者标注后续需要修复 —— HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced
  • MMLU-Pro 数学和医学类得分低于原版 Qwen3.6-27B —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
  • Dense Q5 版本满上下文显存约 31 GB,24GB 显卡需更低量化 —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
  • Dense 版本推理速度仅 43.9 tok/s,远低于同系列 MoE 版本的 161.9 tok/s —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
  • 多模态视觉功能依赖 Ollama 运行时和客户端支持,非所有 UI 可直接使用 —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
  • 模型总大小约 30 GB(含视觉投影器),下载和存储成本高 —— Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
  • 初版 v3 之前的对话模板存在 bug,需重新下载 GGUF/Safetensor —— empero-ai/Qwythos-9B-Claude-Mythos-5-1M
  • 模型卡疑似过度刷榜,无第三方独立评测佐证实际效果 —— empero-ai/Qwythos-9B-Claude-Mythos-5-1M
  • 在编码基准上与 GPT-5.5/Opus 仍有实质差距,尚不能全面替代前沿闭源模型 —— moonshotai/Kimi-K2.7-Code
  • 有开发者公开质疑官方基准选择,认为实测表现与宣称不符 —— moonshotai/Kimi-K2.7-Code
  • Vivace $39/月付费计划周限额紧张,有用户 3 小时用掉 12%、两天用掉 37% —— moonshotai/Kimi-K2.7-Code
  • 部分场景下 K2.6 执行更经济,有用户倾向用 K2.7 思考模式搭配 K2.6 干活 —— moonshotai/Kimi-K2.7-Code
  • 采用 Modified MIT License,对商业使用有限制 —— moonshotai/Kimi-K2.7-Code
  • 仅支持思考模式(thinking model only),无普通模式可选 —— moonshotai/Kimi-K2.7-Code
  • 实际使用中可能 token 消耗大、速度变慢 —— moonshotai/Kimi-K2.7-Code
  • 代码审查中曾将已有模式误标为阻断性严重问题,判断不够准确 —— moonshotai/Kimi-K2.7-Code
  • 在同一次代码审查对比中,GLM 5.2 审查质量更好且 token 消耗不到一半 —— moonshotai/Kimi-K2.7-Code
  • 通过 OpenRouter 调用推理速度慢 —— poolside/Laguna-M.1
  • 225B 总参数却在部分基准上被 Qwen 3.6 35B 反超 —— poolside/Laguna-M.1
  • 官方基准被社区质疑与 Qwen-3.6 35B 过于相似 —— poolside/Laguna-M.1
  • 相较同门 Laguna XS.2 已落后一代 —— poolside/Laguna-M.1
  • 免费使用仅为限时提供,后续可能收费 —— poolside/Laguna-M.1
  • 有用户反馈实际体感上下文窗口偏小 —— poolside/Laguna-M.1
  • 实际使用中性能并不总能匹配基准成绩 —— MiniMaxAI/MiniMax-M3
  • 速度很慢且表现不稳定 —— MiniMaxAI/MiniMax-M3
  • 宣称开源但权重尚未可见,参数规模也未披露 —— MiniMaxAI/MiniMax-M3
  • 模型较新,长期可靠性数据不足 —— MiniMaxAI/MiniMax-M3
  • 相比 M2.7 提升幅度有限 —— MiniMaxAI/MiniMax-M3
  • 速度慢 —— nex-agi/Nex-N2-Pro
  • 部分场景输出不稳定、不一致 —— nex-agi/Nex-N2-Pro
  • 实际表现不如基准跑分所暗示的那样能替代闭源模型 —— nex-agi/Nex-N2-Pro
  • GGUF 内嵌聊天模板有 bug,需切换模板才能正常工作 —— nex-agi/Nex-N2-Pro
  • 默认温度下容易出现重复/循环输出问题 —— nex-agi/Nex-N2-Pro
  • 目前 OpenRouter 似乎是唯一提供 API 服务的平台 —— nex-agi/Nex-N2-Pro
  • 第三方基准工具给出的排名低于官方宣称 —— nex-agi/Nex-N2-Pro
  • 存在生成失败的情况 —— nex-agi/Nex-N2-Pro
  • 低比特不可靠:Q3 档位被反馈『too unreliable』,建议 Q4 起跳(1) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 量化敏感:INT4 vs BF16 在重复工具调用(83.7% vs 90.7%)与严格结构化输出(64% vs 100%)上差距明显,求稳需上高精度(4) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 资源门槛:dense 27B 吃内存/显存,有用户称『needs more RAM than I have』,16GB 级平台即便开 MTP 也难跑顺(1,3) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 吞吐靠调参:需手动配 --spec-type draft-mtp、--spec-draft-n-max 等(乃至叠加 ngram-mod)才能拿到最佳 tok/s(6) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 换代压力:与 Qwen3.8-27B 直接对比时后者 10 项真实任务 9 胜 1 负(8.838 vs 6.862),社区已有迁移势头(10) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 量化试错成本:不同量化档位体验差异大(如 q4 k xl 有时反而更快更好),逐档下载试错耗时(1) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 微调选择分歧:哪个微调最好没有共识,有人推 ff711/Qwopus,有人直接转投 35B-A3B 或 Qwen3.8,选择成本高(0,1,2,10) —— bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF
  • 部分用户实测中频繁遇到错误,需要反复修正,最终退回使用 Gemma 4 —— Jackrong/Qwopus3.6-27B-Coder-GGUF
  • 有用户反馈该系列模型均未成功运行,且认为基于 3.6 的微调说服力不如 3.5 时代 —— Jackrong/Qwopus3.6-27B-Coder-GGUF
  • 与 Qwen3.6 27B 相比,社区对 Qwopus 的实际提升争议较大 —— Jackrong/Qwopus3.6-27B-Coder-GGUF
  • 属实验性社区发布版本,未进行完整安全评估 —— Jackrong/Qwopus3.6-27B-Coder-GGUF
  • 非官方发布,无 Qwen 或 Anthropic 参与或背书,训练来源与能力声明均为发布者个人主张 —— lordx64/Qwable-v1
  • 编码基准测试尚未完成,编码能力无可靠量化结论 —— lordx64/Qwable-v1
  • AGPL 许可 + Anthropic 衍生训练数据带来合规不确定性 —— lordx64/Qwable-v1
  • FP16 推理需约 78GB 显存,消费级卡无法跑全精度 —— lordx64/Qwable-v1
  • 不支持 Ollama,Mac 上需用 MLX 运行 —— lordx64/Qwable-v1
  • 实测在 Mac Studio M4 Max 36GB 上运行偏慢 —— lordx64/Qwable-v1
  • 22K token 上下文下首 token 延迟约 115 秒,prefill 阶段极慢 —— CohereLabs/North-Mini-Code-1.0
  • 在 SWE/OpenCode 等预期 harness 之外表现异常 —— CohereLabs/North-Mini-Code-1.0
  • 产品命名体系引起社区困惑,存在 MiniCPM5-2B 与 1B 之间的混淆 —— openbmb/MiniCPM5-1B
  • 输出可能陷入循环,稳定性有待改善 —— Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
  • 在社区综合对比中排序不及 DavidAU 的 Heretic 变体 —— Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
  • 同场对比被更新的小模型反超:有评论称 Gemma 4 E4B 评分高于 Qwopus 9B。 —— Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF
  • MTP 相关认知门槛:社区讨论中有用户不清楚模型是否内置 MTP、以为需要自行转换,且普通 GGUF 加载会报错,需选对专门版本。 —— Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF
  • 非 Google 官方发布,为个人社区微调,无官方维护承诺 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 24GB 统一内存为最低舒适门槛,推荐 32GB+ —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 基准测试数据来自创作者自己的模型卡,需独立验证,不宜全信 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 仅支持文本任务,不具备多模态能力 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 需要自行配置 MLX-LM 或 llama.cpp 等本地推理框架 —— Jiunsong/supergemma4-26b-uncensored-mlx-4bit-v2
  • 开启推理时偶尔陷入思考循环,反复输出如「Rebuilding Gemma 4 31b...」等中间内容 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
  • 对非指令文本困惑度异常:在 llama-perplexity 上处理非 instruct 文本困惑度可达数千,非 Gemma 自身生成的指令文本困惑度也在 70 上下 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
  • 官方 API 端性能中等:TTFT 1.63s、输出 46.7 t/s,适合原型验证、不适合实时面向用户的场景 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
  • 与 12B 的公开分数差(57.04 vs 46.25)90% 置信区间重叠,不宜凭单一分数断言明显更强 —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
  • 作者自述 Gemma 4 是其做过去审查难度最大的模型,这一版打磨超过 1 个月才放出 RC —— HauhauCS/Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced
  • 部分社区成员认为原版本身已相当开放,只是过度避讳粗俗词——对不需要这类内容的用户,去审查的增量可能有限。 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
  • 主打文本,多模态不在其强项。 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
  • 需按运行时与硬件选择合适的打包,对新手有一定门槛。 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
  • 基准分随评估方法与硬件配置变化,横向比较需谨慎。 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
  • 同类去审查产物已有多个(Balanced、abliterated 等),定位与行为不同需甄别。 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2
  • Balanced 一类做法对最边缘内容会先给简短 reasoning preamble 再输出完整答案,不同做法在边缘内容处理上差异明显。 —— Jiunsong/supergemma4-26b-uncensored-gguf-v2

收藏本页,或 订阅 RSS 追踪每日更新。