可商用的文本生成模型
共 112 个
当前运行配置
ReliquaryForge/qwen3-4b-base-dapo-v4- 显存
- 暂无估算
查看详情查看运行方式
vllm serve ReliquaryForge/qwen3-4b-base-dapo-v4- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 32k
- 国内可达
- 需代理
Qwen3.5-9B-Atlassian-Q4-mlx (LeanZero)
LoRA · 基于 Qwen3.5-9B
面向 Atlassian Forge 的 6-bit MLX 模型
- 参数量
- 9B
- 商用
- 可商用
当前运行配置
Mihai-LeanZero/Qwen3.5-9B-Atlassian-Q4-mlx- 显存
- ~5.4GB 4-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model Mihai-LeanZero/Qwen3.5-9B-Atlassian-Q4-mlx --prompt "Which Forge module adds a panel to the Jira issue view?"- 许可证
- Apache-2.0
- 上下文
- 32k
- 国内可达
- 需代理
- 其它形态
- MLX·mihai-leanzero · MLX·mihai-leanzero
当前运行配置
Mihai-LeanZero/Qwen3.8-27B-Atlassian-Q8-mlx- 显存
- ~30GB 8-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model Mihai-LeanZero/Qwen3.8-27B-Atlassian-Q8-mlx- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
- 其它形态
- MLX·mihai-leanzero · MLX·mihai-leanzero
Edge0-35B-A3B-preview (Edge0)
LoRA · 基于 Qwen3.5-MoE-35B-A3B
35B 稀疏 MoE,3 GiB 内存可跑,面向设备端推理
- 参数量
- 35B (3B 激活)
- 商用
- 可商用
当前运行配置
Edge0/Edge0-35B-A3B-preview- 显存
- ~21GB 4-bit(估算)
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
nex-agi/Nex-N2.5-Pro- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 缺少可用的参数量依据,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 魔搭可用
当前运行配置
nex-agi/Nex-N2.5-mini- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 魔搭可用
Qwen3.6-35B-A3B-VQ-3.4bpw (TheDrainFlorist)
量化自 Qwen3.6-35B-A3B
Apple 芯片 13.8GiB VQ 量化,24GB 可跑
- 参数量
- 35B-A3B
- 商用
- 可商用
当前运行配置
TheDrainFlorist/Qwen3.6-35B-A3B-VQ-3.4bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.6-35B-A3B-VQ-3.4bpw --prompt 'Explain the difference between a mutex and a semaphore.' --max-tokens 512- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
XHToken/Spark-X2.5-4B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve XHToken/Spark-X2.5-4B --trust-remote-code- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 1M
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
Qwen3.6-35B-A3B-VQ-3.8bpw (TheDrainFlorist)
量化自 Qwen3.6-35B-A3B
Apple Silicon VQ量化 Qwen3.6-35B-A3B
- 参数量
- 35B-A3B
- 商用
- 可商用
当前运行配置
TheDrainFlorist/Qwen3.6-35B-A3B-VQ-3.8bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.6-35B-A3B-VQ-3.8bpw- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
Qwen3.6-35B-A3B-VQ-4.6bpw (TheDrainFlorist)
量化自 Qwen3.6-35B-A3B
Mac 可跑的 Qwen3.6-35B VQ 量化
- 参数量
- 35B-A3B
- 商用
- 可商用
当前运行配置
TheDrainFlorist/Qwen3.6-35B-A3B-VQ-4.6bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.6-35B-A3B-VQ-4.6bpw --prompt "Hello"- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
Qwen3.6-35B-A3B-VQ-5.4bpw (TheDrainFlorist)
量化自 Qwen3.6-35B-A3B
MLX 向量量化,Apple Silicon 本地推理
- 参数量
- 35B-A3B
- 商用
- 可商用
当前运行配置
TheDrainFlorist/Qwen3.6-35B-A3B-VQ-5.4bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.6-35B-A3B-VQ-5.4bpw --prompt "Hello" --max-tokens 32- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
IFM/K2-Horizon-7B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve IFM/K2-Horizon-7B --trust-remote-code --dtype bfloat16 --max-model-len 131072 --reasoning-parser k2_horizon --enable-auto-tool-choice --tool-call-parser k2_horizon- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 512k
- 国内可达
- 需代理
K2-Horizon-MoVA-36B-A4B (IFM)
量化自 K2-Horizon-MoVA-36B-A4B
36B/4B 激活 MoE+MoVA,面向 agent 与长上下文
- 参数量
- 36B (4B 激活)
- 商用
- 可商用
当前运行配置
IFM/K2-Horizon-MoVA-36B-A4B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve IFM/K2-Horizon-MoVA-36B-A4B --trust-remote-code --reasoning-parser k2_horizon --tool-call-parser k2_horizon --enable-auto-tool-choice- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 512k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
TheDrainFlorist/Qwen3.8-27B-VQ-3.9bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.8-27B-VQ-3.9bpw --prompt "Explain vector quantization briefly." --max-tokens 512- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
TheDrainFlorist/Qwen3.8-27B-VQ-4.5bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.8-27B-VQ-4.5bpw --prompt "Explain vector quantization briefly." --max-tokens 512- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
TheDrainFlorist/Qwen3.8-27B-VQ-4.8bpw- 显存
- 暂无估算
查看详情查看运行方式
python -m mlx_lm generate --model TheDrainFlorist/Qwen3.8-27B-VQ-4.8bpw --prompt "Explain vector quantization briefly." --max-tokens 512- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
XHToken/Spark-X2.5-1.7B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve XHToken/Spark-X2.5-1.7B --trust-remote-code- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 1M
- 国内可达
- 需代理
当前运行配置
openai-community/gpt2- 显存
- 暂无估算
查看详情查看运行方式
vllm serve openai-community/gpt2- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 1024
- 国内可达
- 需代理
当前运行配置
Youssofal/Qwen3.8-27B-MTPLX-Bare-Speed- 显存
- ~16GB 4-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model Youssofal/Qwen3.8-27B-MTPLX-Bare-Speed- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
Youssofal/Qwen3.8-27B-MTPLX-Optimized-Quality- 显存
- ~30GB 8-bit(估算)
查看详情查看运行方式
mtplx serve --model Youssofal/Qwen3.8-27B-MTPLX-Optimized-Quality- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed- 显存
- ~16GB 4-bit(估算)
查看详情查看运行方式
mtplx serve --model Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed- 许可证
- apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
z-lab/Qwen3.8-27B-DFlash2- 显存
- 暂无估算
查看详情查看运行方式
vllm serve Qwen/Qwen3.8-27B --speculative-config '{"method":"dflash","model":"z-lab/Qwen3.8-27B-DFlash2","num_speculative_tokens":7}'- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
- 其它形态
- 原生·z-lab · 原生·incoai · GGUF·incoai · GGUF·z-lab
当前运行配置
EschaLabs/Qwen3.8-27B-Escha-W2- 显存
- ~9.2GB 2-bit(估算)
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
Qwen3.8-27B-Unleashed (outsourc-e)
量化自 Qwen3.8-27B-Uncensored
无审查 Qwen3.8-27B 动态量化 GGUF,本地推理
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
ornith-ai/Ornith-1.5-35B-A3B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve ornith-ai/Ornith-1.5-35B-A3B --trust-remote-code --reasoning-parser qwen3 --tool-call-parser qwen3_xml --enable-auto-tool-choice- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 262k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
Dagger-Qwen3.6-27B (peculiar-ragdoll)
量化自 ThinkingCap-Qwen3.6-27B
Mac 用 Qwen3.6-27B MLX 量化,低冗余输出
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
peculiar-ragdoll/Dagger-Qwen3.6-27B-MLX- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model peculiar-ragdoll/Dagger-Qwen3.6-27B-MLX- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 256k
- 国内可达
- 需代理
当前运行配置
ornith-ai/Ornith-1.5-9B- 显存
- 暂无估算
查看详情查看运行方式
vllm serve ornith-ai/Ornith-1.5-9B --served-model-name Ornith-1.5-9B --max-model-len 262144 --enable-auto-tool-choice --tool-call-parser qwen3_xml --reasoning-parser qwen3 --trust-remote-code- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 262k(YaRN 可扩展至约 1M)
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
OBLITERATUS/Qwen3.8-27B-OBLITERATED- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/OBLITERATUS/Qwen3.8-27B-OBLITERATED- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
Qwen3.8-27B Heretic Abliterated GGUF (0bserverx)
量化自 Qwen3.8-27B
Qwen3.8-27B 去安全限制 GGUF,供角色扮演与创作
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
Scrappy-Doo/GLM-5.2- 显存
- 暂无估算
查看详情查看运行方式
vllm serve Scrappy-Doo/GLM-5.2 --trust-remote-code- 为何暂无估算
- 缺少可用的参数量依据,无法估算显存
- 许可证
- MIT
- 上下文
- 1M
- 国内可达
- 需代理
- 其它形态
- 原生·scrappy-doo · GGUF · 原生·zai-org
当前运行配置
AutomatosX/AX-Qwen3.6-35B-A3B-MLX-AXQ-6bit-MTP- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model AutomatosX/AX-Qwen3.6-35B-A3B-MLX-AXQ-6bit-MTP- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
当前运行配置
deepgrove/maple-preview- 显存
- ~5.4GB ternary(估算)
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 许可证
- MIT
- 上下文
- 131k
- 国内可达
- 需代理
当前运行配置
lmstudio-community/Ornith-1.0-9B-MLX-5bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/Ornith-1.0-9B-MLX-5bit- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
Qwen/Qwen2.5-7B-Instruct- 显存
- 暂无估算
查看详情查看运行方式
vllm serve Qwen/Qwen2.5-7B-Instruct- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
antirez/deepseek-v4-gguf- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/antirez/deepseek-v4-gguf- 为何暂无估算
- 缺少可用的参数量依据,无法估算显存
- 许可证
- MIT
- 上下文
- 100k
- 国内可达
- 需代理
当前运行配置
lmstudio-community/Ornith-1.0-35B-MLX-6bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/Ornith-1.0-35B-MLX-6bit- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
lmstudio-community/Ornith-1.0-9B-MLX-6bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/Ornith-1.0-9B-MLX-6bit- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
meituan-longcat/LongCat-Flash-Lite-Sparse- 显存
- 暂无估算
查看详情查看运行方式
python3 -m sglang.launch_server --model meituan-longcat/LongCat-Flash-Lite-Sparse --trust-remote-code --chunked-prefill-size 2048 --nsa-prefill-backend fa3 --kv-cache-dtype bfloat16- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 1M
- 国内可达
- 需代理
当前运行配置
lmstudio-community/Ornith-1.0-35B-MLX-5bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model lmstudio-community/Ornith-1.0-35B-MLX-5bit- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- mit
- 国内可达
- 需代理
当前运行配置
lmstudio-community/DeepSeek-V4-Flash-0731-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/lmstudio-community/DeepSeek-V4-Flash-0731-GGUF- 为何暂无估算
- 缺少可用的参数量依据,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
- 其它形态
- GGUF·lmstudio · GGUF·unsloth
Qwen3.6-35B-A3B-Escha-W2 (EschaLabs)
量化自 Qwen3.6-35B-A3B
2-bit Qwen3.6-35B-A3B,12.3GB,单卡本地推理
- 参数量
- 35B (3B active)
- 商用
- 可商用
当前运行配置
EschaLabs/Qwen3.6-35B-A3B-Escha-W2- 显存
- ~12GB 2-bit(估算)
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
Goekdeniz-Guelmez/JOSIE-2-4B-Preview- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model Goekdeniz-Guelmez/JOSIE-2-4B-Preview- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
gokhanturhan/CLINAMEN-Chat- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 国内可达
- 需代理
当前运行配置
ThingAI/Quak-50m-v2- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 2048
- 国内可达
- 需代理
gemma-4-E2B-it-crap-gguf (matthewhaynesonline)
量化自 gemma-4-E2B-it-crap
直接生成可执行ELF hex的文本模型
- 参数量
- 约4.3B (基于F16.gguf 8.6GiB推断)
- 商用
- 可商用
Grok-3-reasoning-gemma3-4B-GGUF (mradermacher)
量化自 Grok-3-reasoning-gemma3-4B-distilled-HF
Grok-3推理蒸馏Gemma3-4B的GGUF量化版
- 参数量
- 4B
- 商用
- 可商用
当前运行配置
mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
FINAL-Bench/POCKET-KR-MLX- 显存
- ~12GB 2-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model FINAL-Bench/POCKET-KR-MLX- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
AtomicChat/ornith-35b-MLX-8bit- 显存
- ~39GB 8-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model AtomicChat/ornith-35b-MLX-8bit --prompt Hello- 许可证
- MIT
- 上下文
- 256K
- 国内可达
- 需代理
当前运行配置
AtomicChat/ornith-35b-MLX-6bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model AtomicChat/ornith-35b-MLX-6bit --prompt 'Hello'- 为何暂无估算
- 已有格式线索,但估算映射未支持,无法估算显存
- 许可证
- MIT
- 上下文
- 256K
- 国内可达
- 需代理
当前运行配置
prism-ml/Bonsai-27B-mlx-1bit- 显存
- ~4.1GB 1-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model prism-ml/Bonsai-27B-mlx-1bit- 许可证
- apache-2.0
- 上下文
- 262K
- 国内可达
- 需代理
当前运行配置
alphaZimuth/Hy-MT2-30B-A3B-APEX-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/alphaZimuth/Hy-MT2-30B-A3B-APEX-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
AngelSlim/Hy3-GGUF- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/AngelSlim/Hy3-GGUF- 为何暂无估算
- 缺少可用的参数量依据,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 65536
- 国内可达
- 魔搭可用
当前运行配置
GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking- 显存
- 暂无估算
查看详情查看运行方式
ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit --prompt 'Explain quantum computing.' --max-tokens 200- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
prism-ml/Ternary-Bonsai-27B-mlx-2bit- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
Qwen3.6-35B-A3B-VQ (aquaman164)
量化自 Qwen3.6-35B-A3B
MLX VQ量化35B MoE,适合Apple Silicon本地推理
- 参数量
- 35B (3B激活)
- 商用
- 可商用
当前运行配置
aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw- 显存
- 暂无估算
查看详情查看运行方式
huggingface-cli download aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw --local-dir qwen-vq && python qwen-vq/code/vq_serve.py --model qwen-vq- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
mlx-community/Qwen3.5-9B-OptiQ-4bit- 显存
- 暂无估算
查看详情查看运行方式
mlx_lm.generate --model mlx-community/Qwen3.5-9B-OptiQ-4bit- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- apache-2.0
- 上下文
- 128k
- 国内可达
- 需代理
当前运行配置
empero-ai/Qwythos-9B-v2- 显存
- 暂无估算
查看详情查看运行方式
vllm serve empero-ai/Qwythos-9B-v2 --trust-remote-code- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 1048k
- 国内可达
- 需代理
- 其它形态
- 原生 · GGUF
当前运行配置
Smilyai-labs/Nova-1-Standard-1.3B-Preview- 显存
- 暂无估算
查看详情查看运行方式
pipeline('text-generation', model='Smilyai-labs/Nova-1-Standard-1.3B-Preview', trust_remote_code=True, device_map='auto')- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 2048
- 国内可达
- 需代理
当前运行配置
manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64- 显存
- 暂无估算
查看详情查看运行方式
pip install 'turboquant-mlx-full>=0.12.3' && python -m turboquant_mlx.generate --model manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
Gemma4-Gutenberg-31B-Heretic-mlx-8Bit (ailexleon)
量化自 Gemma4-Gutenberg-31B-Heretic
MLX 8-bit 量化英文创意写作模型,适合故事小说生成
- 参数量
- 31B
- 商用
- 可商用
当前运行配置
ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit- 显存
- ~34GB 8-bit(估算)
查看详情查看运行方式
mlx_lm.generate --model ailexleon/Gemma4-Gutenberg-31B-Heretic-mlx-8Bit --prompt 'hello'- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
nvidia/Qwen3.6-27B-NVFP4- 显存
- 暂无估算
查看详情查看运行方式
vllm serve nvidia/Qwen3.6-27B-NVFP4 --port 8000 --quantization modelopt --max-model-len 262144 --reasoning-parser qwen3- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache-2.0
- 上下文
- 262k
- 国内可达
- 需代理
BugTraceAI-CORE-Ultra-27B (BugTraceAI)
量化自 Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinking
生成漏洞利用与安全工具,面向攻防研究者
- 参数量
- 27B
- 商用
- 可商用
当前运行配置
BugTraceAI/BugTraceAI-CORE-Ultra-27B-Q6- 显存
- 暂无估算
当前运行配置
microsoft/FastContext-1.0-4B-RL- 显存
- 暂无估算
查看详情查看运行方式(还有 1 种)
python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-RL --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --host 0.0.0.0 --port 30000 --tp-size 1 --mem-fraction-static 0.8其它 1 种运行方式见详情页。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 262k
- 国内可达
- 需代理
Huihui-gemma-4-12B-coder-abliterated (huihui-ai)
微调自 gemma-4-12B-coder-fable5-composer2.5-v1
未审查版 Gemma 代码模型,用于编程与推理,已去除拒答
- 参数量
- 12B
- 商用
- 可商用
当前运行配置
deepseek-ai/DeepSeek-V4-Flash- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- mit
- 国内可达
- 魔搭可用
当前运行配置
deepseek-ai/DeepSeek-V4-Pro- 显存
- 暂无估算
查看详情暂无收录命令
本站暂未收录这个配置的命令;请看详情页或官方仓库,不借用其它配置的命令。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- mit
- 国内可达
- 魔搭可用
当前运行配置
Gryphe/Gemma-4-31B-StyleTune- 显存
- 暂无估算
查看详情查看运行方式
python -c "from transformers import AutoModelForCausalLM; model = AutoModelForCausalLM.from_pretrained('Gryphe/Gemma-4-31B-StyleTune')"- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
FastContext-1.0-4B-SFT (Microsoft)
微调自 Qwen3-4B-Instruct-2507
轻量仓库探索子代理,供编码代理按需调用,减少 token 消耗
- 参数量
- 4B
- 商用
- 可商用
当前运行配置
microsoft/FastContext-1.0-4B-SFT- 显存
- 暂无估算
查看详情查看运行方式(还有 1 种)
python3 -m sglang.launch_server --model-path microsoft/FastContext-1.0-4B-SFT --tool-call-parser qwen --context-length 262144 --trust-remote-code --dtype bfloat16 --host 0.0.0.0 --port 30000 --tp-size 1 --mem-fraction-static 0.8其它 1 种运行方式见详情页。
- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 262k
- 国内可达
- 需代理
DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)
量化自 diffusiongemma-26B-A4B-it
扩散多模态文本生成,3.8B活跃参数,NVFP4量化
- 参数量
- 25.2B (3.8B活跃)
- 商用
- 可商用
当前运行配置
nvidia/diffusiongemma-26B-A4B-it-NVFP4- 显存
- 暂无估算
查看详情查看运行方式
VLLM_USE_V2_MODEL_RUNNER=1 vllm serve nvidia/diffusiongemma-26B-A4B-IT-NVFP4 --trust-remote-code --max-num-seqs 4 --attention-backend TRITON_ATTN --enable-auto-tool-choice --tool-call-parser gemma4 --reasoning-parser gemma4 --override-generation-config '{"max_new_tokens": null}' --default-chat-template-kwargs '{"enable_thinking":true}' (需H100/B100)- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache 2.0 (Gemma Terms)
- 上下文
- 256k
- 国内可达
- 需代理
当前运行配置
silx-ai/Quasar-Preview- 显存
- 暂无估算
查看详情查看运行方式
python -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('silx-ai/Quasar-Preview', trust_remote_code=True)"- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- MIT
- 上下文
- 5M (实验性配置)
- 国内可达
- 需代理
当前运行配置
marin-community/delphi-1e23-25Bparams-628Btokens- 显存
- 暂无估算
查看详情查看运行方式
transformers.from_pretrained('marin-community/delphi-1e23-25Bparams-628Btokens')- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 4k
- 国内可达
- 需代理
Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)
量化自 Qwen3.6-35B-A3B
Apple Silicon 4-bit MLX混精量化+MTP投机解码
- 参数量
- 35B-A3B
- 商用
- 可商用
Qwen3.6-35B-A3B-NVFP4 (NVIDIA)
量化自 Qwen3.6-35B-A3B
Qwen3.6-35B-A3B FP4量化版,面向vLLM高效推理
- 参数量
- 35B (激活3B)
- 商用
- 可商用
当前运行配置
nvidia/Qwen3.6-35B-A3B-NVFP4- 显存
- 暂无估算
查看详情查看运行方式
vllm serve nvidia/Qwen3.6-35B-A3B-NVFP4 --quantization modelopt- 为何暂无估算
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 许可证
- Apache 2.0
- 上下文
- 262k
- 国内可达
- 需代理
aro-coder-4bit (ARO-Lang)
LoRA · 基于 Qwen3-Coder-30B-A3B-Instruct-4bit
为ARO语言微调的代码生成器,4bit量化,供ARO DSL开发者使用
- 参数量
- 30B (3B active)
- 商用
- 可商用
当前运行配置
tencent/Hy-MT2-1.8B-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama-server -hf tencent/Hy-MT2-1.8B-GGUF- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 魔搭可用
当前运行配置
lmstudio-community/granite-4.1-30b-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama.cpp: huggingface-cli download lmstudio-community/granite-4.1-30b-GGUF --include '*.gguf' --local-dir . && ./llama-cli -m <file>- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache 2.0
- 国内可达
- 需代理
当前运行配置
lmstudio-community/granite-4.1-3b-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama.cpp -m granite-4.1-3b-Q4_K_M.gguf- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- Apache-2.0
- 国内可达
- 需代理
当前运行配置
lmstudio-community/granite-4.1-8b-GGUF- 显存
- 暂无估算
查看详情查看运行方式
llama.cpp -m granite-4.1-8b.gguf- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
prism-ml/Bonsai-8B-mlx-1bit- 显存
- ~1.2GB 1-bit(估算)
查看详情查看运行方式
pip install mlx-lm; pip install mlx@git+https://github.com/PrismML-Eng/mlx.git@prism; from mlx_lm import load; load('prism-ml/Bonsai-8B-mlx-1bit')- 许可证
- Apache-2.0
- 上下文
- 65k
- 国内可达
- 需代理
当前运行配置
jackxinning/Leanly_AI- 显存
- 暂无估算
查看详情查看运行方式
transformers: AutoModel.from_pretrained('jackxinning/Leanly_AI')- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 国内可达
- 需代理
当前运行配置
FrontiersMind/Nandi-Mini-600M-Early-Checkpoint- 显存
- 暂无估算
查看详情查看运行方式
transformers.from_pretrained('FrontiersMind/Nandi-Mini-600M-Early-Checkpoint')- 为何暂无估算
- 权重格式未知,无法估算显存
- 许可证
- apache-2.0
- 上下文
- 2048
- 国内可达
- 需代理