开源模型与 AI 工具选型参考
任务类型 ·
text-generation
共 216 个 (跨 94 天)
2026-09-14
Qwen3-4B-Base-DAPO-v4 (ReliquaryForge)
Qwen3-4B-Base-DAPO-v4 文本生成模型
2026-09-13
Qwen3.5-9B-Atlassian-Q4-mlx (LeanZero)
Forge/Jira 开发辅助 4-bit MLX
Qwen3.5-9B-Atlassian-Q6-mlx (LeanZero)
面向 Atlassian Forge 的 6-bit MLX 模型
Qwen3.8-27B-Atlassian-Q4-mlx (LeanZero)
面向 Atlassian Forge 的 4-bit MLX 模型
Qwen3.8-27B-Atlassian-Q8-mlx (LeanZero)
Atlassian 开发专用 27B MLX 模型
OUI-1 (Thesys)
生成式 UI 扩散模型,面向 OpenUI 应用开发者
2026-09-12
Edge0-35B-A3B-preview (Edge0)
35B 稀疏 MoE,3 GiB 内存可跑,面向设备端推理
NeoHorse-1-4B (TokenRhythm)
面向 agent 开发者的 4B 文本工具调用模型
2026-09-11
NeoHorse-1-4B (TokenRhythm)
面向 Agent 工具调用与编码的 4B 文本模型
2026-09-10
Qwen3.6-35B-A3B-VQ-3.4bpw (TheDrainFlorist)
Apple 芯片 13.8GiB VQ 量化,24GB 可跑
Nex-N2.5-Pro (Nex-AGI)
长时程agent模型,面向电脑操作与网页浏览
Nex-N2.5-mini (Nex-AGI)
开源 agent 模型,面向长程电脑操作与网页任务
MiniCPM5-2B-GGUF (openbmb)
2B 端侧文本模型,面向本地助手与 agent
2026-09-08
Spark-X2.5-4B-GGUF (XHToken)
4B 通用文本模型 GGUF,可本地跑对话、编码与 agent
MiniCPM5-2B (OpenBMB)
端侧 2B 模型,用于本地助手、编码与工具调用
2026-09-07
Qwen3.6-35B-A3B-VQ-3.8bpw (TheDrainFlorist)
Apple Silicon VQ量化 Qwen3.6-35B-A3B
Qwen3.6-35B-A3B-VQ-4.6bpw (TheDrainFlorist)
Mac 可跑的 Qwen3.6-35B VQ 量化
Qwen3.6-35B-A3B-VQ-5.4bpw (TheDrainFlorist)
MLX 向量量化,Apple Silicon 本地推理
2026-09-06
K2-Horizon-7B (IFM)
7B 密集解码器,512K 上下文,面向推理/代码/长上下文
K2-Horizon-MoVA-36B-A4B (IFM)
36B/4B 激活 MoE+MoVA,面向 agent 与长上下文
Qwen3.8-27B-VQ (TheDrainFlorist)
Apple Silicon 用 Qwen3.8-27B 量化版
Qwen3.8-27B-VQ-4.5bpw (Qwen)
Qwen3.8-27B MLX 向量量化版
Qwen3.8-27B-VQ-4.8bpw (Qwen)
Apple Silicon 本地运行的 27B 向量量化文本生成模型
2026-09-05
Spark-X2.5-1.7B (XHToken)
1.7B 通用语言模型,支持 1M 上下文与工具调用
2026-09-04
K2-Horizon-MoVA-36B-A4B (IFM)
36B MoE 开源模型,4B 激活,面向 agent/推理
Spark-X2.5-4B (XHToken)
4B 通用语言模型,面向对话/代码/agent
Qwen3.8-27B (Qwen)
Mac本地Qwen3.8-27B-4bit量化
Qwen3.8-27B MTPLX (Youssofal)
Mac 上 8-bit 量化 Qwen3.8 27B(MTP 加速)
Granite-4.2-3B-MLX-6bit (IBM)
Granite 4.2 3B MLX 6bit 量化,本地推理
GPT-2 (OpenAI)
英文因果语言模型,用于文本生成与下游微调
GLM-5.3-GGUF (unsloth)
开源 MoE 代码与智能体模型 GGUF 量化版
2026-08-31
Qwen3.8-Flash-Next Optimized Speed (MTPLX)
Mac 上 MTPLX 4-bit 量化,MTP 投机加速
2026-08-30
Granite-4.2-8B-MLX-6bit (LM Studio)
Granite 4.2 8B 的 MLX 6-bit 量化
2026-08-29
SemanticRepair-270M (Gramscii)
面向 RAG 路由的查询重写小模型
GLM-5.3-Flash-DFlash2 (incoai)
为 GLM-5.3-Flash 推理加速的 DFlash2 草稿模型
Granite-4.2-30B-MLX-6bit (LM Studio)
IBM 30B MLX 6bit 量化,Mac 用
Granite-4.2-3B-MLX-4bit (LM Studio)
3B开源文本生成模型,面向Apple Silicon本地推理与工具调用
Granite-4.2-3B-MLX-8bit (LM Studio)
IBM Granite 3B MLX 量化,苹果芯片推理
PhoneLLM Alpha 1 (Pipecat)
面向电话语音代理的 30B-A3B 微调模型
2026-08-28
Qwen3.8-27B-MTPLX-Optimized-Speed (Youssofal)
Mac 上 Qwen3.8-27B 4-bit量化
Apodex-1.1-mini (Apodex)
面向复杂研究任务的推理型 agent 模型
Granite-4.2-30B (IBM)
IBM 30B 推理模型,原生 thinking 与工具调用
Granite-4.2-30B-MLX-4bit (LM Studio)
Granite 4.2 30B MLX 量化,Mac
Granite-4.2-30B-MLX-8bit (IBM/LM Studio)
Granite 30B MLX 8-bit,本地推理
Granite-4.2-8B-MLX-4bit (LM Studio)
Granite 8B MLX 4bit,Mac推理
2026-08-27
Granite-4.2-8B-MLX-8bit (IBM)
Granite 4.2 8B MLX 量化版,Mac 本地跑
2026-08-24
Qwen3.8-27B-Escha-W2 (Escha)
2-bit 量化 27B 模型,24GB 显卡 64k 上下文
Qwen3.8-27B-Unleashed (outsourc-e)
无审查 Qwen3.8-27B 动态量化 GGUF,本地推理
Qwen3.8-27B-DFlash2-GGUF (z-lab)
Qwen3.8-27B 的投机解码草案模型,需搭配目标模型使用
Qwen3.8-27B-DFlash2 (z-lab)
为 Qwen3.8-27B 提供投机解码加速的草案模型
2026-08-22
Qwen3.8-27B-DFlash2-GGUF (incoai)
llama.cpp 投机解码草稿模型 GGUF
Ornith-1.5-35B-A3B (Ornith)
35B MoE 激活 3B,面向工具调用与长上下文推理
S1-mini (Superwhisper)
ASR 后处理文本规范化器,英文听写与字幕管道用
2026-08-21
LFM2.5-8B-A1B-DSpark-GGUF (LiquidAI)
8B-A1B 投机解码草稿侧车,配 llama.cpp 加速
Qwen3.8-27B-OBLITERATED (OBLITERATUS)
无审查 Qwen3.8-27B,供红队与对齐研究
Ornith-1.5-35B-A3B-GGUF (Ornith)
35B MoE 激活3B GGUF,本地编码与工具调用
Ornith-1.5-9B-GGUF (ornith-ai)
9B 推理模型 GGUF,供本地编码与代理使用
Ornith-1.5-9B (ornith-ai)
9B 稠密推理模型,单卡部署与终端编程
Dagger-Qwen3.6-27B (peculiar-ragdoll)
Mac 用 Qwen3.6-27B MLX 量化,低冗余输出
2026-08-20
Qwen3.8-27B Heretic Abliterated GGUF (0bserverx)
Qwen3.8-27B 去安全限制 GGUF,供角色扮演与创作
Qwen3.8-9B-Distill-GGUF (Empero)
9B 蒸馏推理模型 GGUF 量化,本地部署用
Qwen3.8-9B-Distill (Empero)
全参蒸馏 9B 推理模型,面向数学/代码/工具调用
Qwen3.8-27B-DFlash2 (incoai)
Qwen3.8 草稿模型,用于 SGLang/vLLM 投机解码
2026-08-18
hamo-score-0.6b (HamoAI)
给心理支持对话逐句打五维评分,供本地部署
Qwen3.8-9B (Empero)
9B 蒸馏推理模型,面向数学/代码/工具调用
2026-08-17
Amethyst-1-Mini (VertexAIco)
Gemma 3 4B 蒸馏微调对话模型,面向轻量试验与聊天
2026-08-16
Qwen3.8-27B-Uncensored-GGUF (JonathanColetti)
27B 未审查 GGUF,含 MTP 投机解码
2026-08-15
LFM2.5-2.6B-MLX-5bit (LM Studio)
2.6B 5-bit MLX 量化,Mac 本地推理
2026-08-13
Needle2-45M (Cactus Compute)
45M 工具调用模型,14MB 二进制跑边缘设备
2026-08-12
Nemotron-3.5-Lightning-30B-A3B (NVIDIA)
30B总参3B激活,为微调与量化而设计
Nemotron-3.5-Lightning-30B-A3B (NVIDIA)
3B活跃参数,面向本地Agent和长上下文推理
2026-08-11
LFM2.5-2.6B (LiquidAI)
6-bit MLX 量化推理模型,为 Apple Silicon 优化
2026-08-10
GLM-5.2 (智谱)
1M 上下文旗舰模型,适合复杂长程任务开发
Nanbeige4.2-3B (Nanbeige)
3B Agent 模型 GGUF 量化版本,用于资源受限部署
2026-08-09
Qwen3.6-35B-A3B (AutomatosX)
Apple Silicon 本地推理的 MLX 6-bit 量化模型
LFM2.5-2.6B-MLX-4bit (LiquidAI)
Apple Silicon 用 4-bit 量化 LFM,始终思考模式
2026-08-08
fuse-1-Lite (Akahsizrr)
5.7B MoE,融合LFM2与Qwen编码专家,用于代码生成
BTL-4 (Bad Theory Labs)
面向工具调用与软件工程的35B推理模型
Maple-Preview (DeepGrove)
20B-A1B 三元推理模型,M4 218 tok/s
LFM2.5-2.6B-MLX-8bit (LM Studio)
8-bit MLX量化一直思考模型,Apple Silicon用
Ornith-1.0-9B-MLX (deepreinforce-ai)
通用文本生成的MLX量化版,供Apple Silicon本地使用
2026-08-06
LFM2.5-2.6B (LiquidAI)
端侧部署的混合架构模型,用于文本生成。
Qwen2.5-7B-Instruct (Qwen)
Qwen2.5 7B 指令模型,用于多语言对话与长文本生成。
DeepSeek-V4-Flash-Ablit (huihui-ai)
未审查 DeepSeek-V4-Flash GGUF,供研究测试
Llama-3.1-8B-Instruct (Meta)
8B 指令微调模型,用于通用对话与文本生成任务
2026-08-05
LFM2.5-2.6B (LiquidAI)
2.6B 混合架构代理模型,面向端侧工具调用与 128K 长上下文任务
2026-08-04
DeepSeek-V4-Flash GGUF (DeepSeek)
ds4引擎 DeepSeek-V4-Flash 量化,Mac 本地运行
Ornith-1.0-35B (deepreinforce-ai)
MLX 6-bit 35B,用于 Apple Silicon 文本生成
Ornith-1.0-9B-MLX-6bit (deepreinforce-ai)
MLX量化9B文本模型,苹果芯片本地推理
Koleslaw-Nemotron-30B (ThunkAboutIt)
把粗糙提示变成结构化详细提示,方便交给任意模型
2026-08-03
Ornith-1.0-35B-MLX-4bit (lmstudio-community)
在 Apple Silicon 上运行的 35B 文本生成模型
Ornith-1.0-35B-MLX (LM Studio)
苹果硅本地运行的 35B 文本生成模型
Ornith-1.0-9B-MLX (LM Studio)
MLX 8-bit量化,为Apple Silicon优化
LongCat-Flash-Lite-Sparse (美团)
69B MoE,仅3B激活,1M上下文,面向Agent与长文本任务
2026-08-02
Neutrino-8B (Fermion)
子 2 比特 8B 聊天模型,容器 2.56 GB
Ornith-1.0-35B MLX (lmstudio-community)
Apple Silicon本地35B生成模型MLX量化版
Ornith-1.0-9B (DeepReinforce)
MLX 4-bit量化,Apple Silicon文本生成
2026-07-31
Qwen3.6-35B-A3B-Escha-W2 (EschaLabs)
2-bit Qwen3.6-35B-A3B,12.3GB,单卡本地推理
Qwopus3.6-27B-Fusion (KyleHessling1)
融合推理与代码的27B单模型,适合本地编程代理
sakthai-context-0.5b-merged (Nanthasit)
边缘工具调用模型,基于 Qwen2.5-0.5B,可在树莓派运行
XYZ-Aquila-mini (XYZAILab)
面向深度搜索的开放权重思考模型
Macaron-V1-Tall (MindLab)
Mixture of LoRA 个人助手与工具编码模型
2026-07-29
Instella-MoE-16B-A3B-Think (AMD)
全开源 MoE 语言模型,16B 总参/2.8B 激活,面向研究
2026-07-27
JOSIE-2-4B-Preview (G. Gülmez)
全Apple Silicon训练·推理优先微调·4B预览版
2026-07-26
grug-27b (ProCreations)
27B 令牌高效推理模型,用于智能体与工具调用
Quark-50m-v2 (ThingAI)
43.8M 意英双语对话模型,专为 CPU 环境的意大利语问答设计
antares-1b (fdtn-ai)
1B 参数语言模型,用于轻量推理与微调实验
CLINAMEN-Chat (gokhanturhan)
虚构机构的对话神谕,面向艺术与超虚构创作
gemma-4-E2B-it-crap-gguf (matthewhaynesonline)
直接生成可执行ELF hex的文本模型
2026-07-25
BTL-3 (Bad Theory Labs)
27B 开源代理模型,面向代理编程与结构化工具调用
2026-07-24
POCKET-KR-MLX (FINAL-Bench)
35B 韩语模型,在 iPhone/Mac 上用 MLX 本地运行
KAT-Coder-V2.5-Dev (KwaiKAT)
35B MoE编程代理模型,为代码修复与终端任务设计
2026-07-23
Ornith-35b-MLX-6bit (AtomicChat)
35B MoE MLX 量化,Mac 本地多模态推理
Ornith-35B-MLX (AtomicChat)
面向 Apple Silicon 的多模态量化模型,文本+图像
Nanbeige4.2-3B (Nanbeige)
3B 参数 agent 模型,聚焦工具调用与本地个人助理
Laguna-S-2.1-NVFP4 (poolside)
117.6B MoE (8.5B 激活) 代理编码模型,本地设备可运行
2026-07-22
Ornith-1.0-35B (DeepReinforce)
35B MoE代理编码模型,支持终端代理与工具调用
2026-07-21
GPT-OSS-20B (OpenAI)
2-bit 量化 MLX 模型,专为 Apple Silicon 推理
2026-07-20
gear-manual-qwen3-4b (Raindog)
面向硬件音乐设备的本地助手,基于Qwen3-4B微调
2026-07-18
Qwen3.6-35B-A3B (andreaborio)
Qwen3.6 MoE 量化版,Apple Metal 加速推理
2026-07-17
MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking (GnLOLot)
1B 工具调用思考模型 GGUF 量化,本地运行
2026-07-16
Hy3-GGUF (腾讯)
腾讯 Hy3 混合精度 GGUF,针对本地受限硬件极限压缩
MiniCPM5-1B-Thinking (OpenBMB)
1B 思考模型,改进编码与指令遵循,适合本地部署
Dolphin3-Cyber-8B (RavichandranJ)
网络安全领域8B微调模型, 本地离线运行红蓝队工具
Bonsai-27B-mlx-1bit (Prism ML)
1-bit 27B 模型, 可在手机和笔记本本地运行推理
2026-07-15
Qwen3.5-35B-A3B (Qwen)
4-bit MLX 量化,Apple Silicon 本地运行文本生成
Bonsai-27B (Prism ML)
27B 1-bit 量化模型,面向笔记本与手机本地推理
Ternary-Bonsai-27B (Prism ML)
三元权重 27B 推理模型,笔记本本地运行
Nemotron-3-Nano-30B-A3B (NVIDIA)
4bit MoE本地运行于Apple Silicon
Ternary Bonsai 27B (prism-ml)
三元2-bit 27B开源模型,笔记本本地运行推理
2026-07-14
Qwen3.6-35B-A3B-VQ (aquaman164)
MLX VQ量化35B MoE,适合Apple Silicon本地推理
2026-07-13
Qwythos-9B-v2 (Empero AI)
修复循环生成并保留1M上下文推理能力的研究型模型
Qwen3.5-9B-OptiQ-4bit (mlx-community)
Apple Silicon 本地 4-bit 混合精度量化文本生成模型
Ornith-1.0-35B-MLX (deepreinforce-ai)
Apple Silicon 上 Claude-Code 式本地编码代理
2026-07-11
Nemotron-Labs-Audex-2B (NVIDIA)
统一音频-文本语言模型,支持语音识别、翻译、TTS 与音频生成
2026-07-10
MiniCPM5-1B-Thinking-GGUF (GnLOLot)
1B 思维链模型 GGUF 量化,本地轻量代码与指令任务
2026-07-09
Supra-Router-51M (SupraLabs)
51M 参数边缘路由器, 判断提示词复杂度并分发至本地或云端模型
NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)
面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署
Nemotron-Labs-Audex-30B-A3B (NVIDIA)
音频-文本统一LLM,兼顾文本推理与语音/音频生成
2026-07-07
Grug-12B (kai-os)
紧凑推理微调,减少冗余推理轨迹,降低推理token消耗
2026-07-06
MaralGPT-Mythos-9B (MaralGPT)
无审查 Qwen3.5-9B 微调,用于网络安全与生物医学
Nova-1-Standard-1.3B (Smilyai Labs)
1.3B MoD对话模型,支持ChatML与代码/数学生成
Qwen3.6-35B-A3B (Qwen)
三元专家量化版,9.4 GB 全量跑在 16 GB Mac 上
2026-07-05
Gemma-4-12B Agentic v2 (yuxinlu1)
编程与工具调用代理微调,供开发者本地使用
2026-07-04
Gemma4-Gutenberg-31B-Heretic-mlx-8Bit (ailexleon)
MLX 8-bit 量化英文创意写作模型,适合故事小说生成
Laguna XS 2.1 (poolside)
33B MoE 编码模型,3B 激活,为本地代理与长任务设计
2026-07-03
Ornith-1.0-35B (DeepReinforce)
35B开源编码代理模型,原生工具调用与推理链
Ornith-1.0-9B-MTP (protoLabs)
Ornith-9B MTP GGUF:llama.cpp推测解码加速
2026-07-02
Huihui-GLM-5.2-GGUF (huihui-ai)
移除安全过滤的GLM-5.2 GGUF,供研究实验用
Huihui-Qwythos-9B-1M (huihui-ai)
未审查 1M 上下文 Qwen3.5 微调,支持工具调用
Nemotron-Labs-TwoTower-30B-A3B (NVIDIA)
双塔扩散LLM,块并行解码,2.42x生成吞吐量
Qwen3.6-27B-NVFP4 (NVIDIA)
Qwen3.6-27B NVFP4 量化,面向 vLLM 部署与推理
2026-07-01
Agents-A1 (InternScience)
35B MoE Agent 模型,面向长程搜索、工程与科研
2026-06-29
LFM2.5-230M (LiquidAI)
混合架构边缘设备模型,用于设备端文本生成
2026-06-27
Ornith-1.0-35B (DeepReinforce)
用于代理式编码的自改进开源 MoE,35B 总参、低激活,量化后本地可跑
Ornith-1.0-9B (DeepReinforce)
面向编程代理的开源文本生成模型;为单卡部署设计
Ornith-1.0-9B (DeepReinforce)
自改进编码代理模型,9B 单卡部署
Qwen-AgentWorld-35B-A3B (Qwen)
语言世界模型,模拟7类agent交互环境
2026-06-26
LFM2.5-230M (LiquidAI)
230M混合架构,为边缘设备推理与代理任务设计
Ornith-1.0-35B (DeepReinforce)
轻量级代理编码开源模型,单 GPU 可部署
Mythos-nano (squ11z1)
3B无审查推理模型,专注数学与竞赛编程
2026-06-25
Qwen-AgentWorld-35B-A3B (Qwen)
语言世界模型,模拟7种智能体交互环境
2026-06-24
Qwen3.6-27b-Fable5 (hotdogs)
Qwen3.6-27B的LoRA微调,用于故事与寓言生成
2026-06-23
Qwythos-9B (Empero)
开源 9B 推理模型,不审查,支持 1M 上下文和函数调用
Huihui-gemma-4-12B-coder-abliterated (huihui-ai)
未审查版 Gemma 代码模型,用于编程与推理,已去除拒答
FastContext-1.0-4B-RL (Microsoft)
为编码代理提供仓库探索与精确文件引用
2026-06-22
Qwythos-9B-Claude-Mythos-5-1M (Empero)
基于Qwen3.5的推理模型,1M上下文,支持函数调用
GLM-5.2-GGUF (Unsloth)
1M上下文开源模型,面向长文本处理与代码生成
2026-06-20
SIQ-1-35B (AlexWortega)
3B活跃参数的通用Agent,自动研究/编程/推理
Gemma-4-12B-it-LWQ6 (wepiqx)
混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成
gemma-4-12B-agentic-v2 (yuxinlu1)
本地离线编码与工具使用Agent,仅需4.5GB显存即可运行
2026-06-18
Gemma-4-31B-StyleTune (Gryphe)
Gemma 4 31B风格微调,陈词减60%,角色扮演与创意写作。
Qwen3.6-27B-MTP-pi-tune (bytkim)
面向无思考代理编码的MTP微调版,本地GGUF推理
2026-06-17
VibeThinker-3B (WeiboAI)
面向数学/代码/STEM的可验证推理3B小模型
Qwable-v1 (lordx64)
Qwen3.6基MoE代理编码模型(3B激活)
2026-06-16
FastContext-1.0-4B-SFT (Microsoft)
轻量仓库探索子代理,供编码代理按需调用,减少 token 消耗
2026-06-15
Z-Image-Engineer-V6 (BennyDaBall)
4B 提示词增强与 Z-Image 文本编码器,本地双用途
DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)
扩散多模态文本生成,3.8B活跃参数,NVFP4量化
2026-06-14
Gemma4-12B-Coder (yuxinlu1)
本地 Python 编程模型,离线解决算法问题
2026-06-13
Quasar-Preview (silx-ai)
18B MoE预览模型,面向Bittensor SN24研究蒸馏
2026-06-12
LFM2.5-1.2B-JP (LiquidAI)
日英双语聊天模型,适合代理工作流与工具使用
Delphi-25B (Marin Community)
Delphi扩展律研究基座,25B参数,终版模型
2026-06-11
Harness-1 (pat-jj)
20B搜索智能体,对标前沿检索性能
2026-06-10
North-Mini-Code-1.0 (CohereLabs)
30B-A3B 代码生成与 agent 模型,面向软件工程终端任务
Gemma-4-12B-OBLITERATED (OBLITERATUS)
零拒绝消融Gemma 4,供对齐研究与红队测试
2026-06-09
Nex-N2-mini (nex-agi)
面向编码与工具调用的智能体模型
2026-06-07
Qwen3.6-27B-MTPLX (Youssofal)
Qwen3.6-27B 的 MLX 推理加速版供苹果芯片
Qwen3.5-0.8B-OptiQ-4bit (mlx-community)
苹果芯片4-bit MLX 量化 Qwen3.5-0.8B
Qwen3.5-2B-OptiQ-4bit (mlx-community)
4-bit混合精度MLX量化Qwen3.5-2B,苹果芯片推理
Qwen3.6-27B-OptiQ-4bit (mlx-community)
Apple Silicon的Qwen3.6-27B 4bit混合量化版
Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)
Apple Silicon 4-bit MLX混精量化+MTP投机解码
2026-06-05
Mellum2-12B-A2.5B-Instruct (JetBrains)
直接回答的指令模型,用于交互聊天、代码和工具调用
2026-06-04
HelixLM-40M-ep1 (david-thrower)
循环异构图语言模型,用于个性化微调与端侧推理
2026-06-03
Mellum2-12B-A2.5B-Thinking (JetBrains)
思考型助手,在<think>块中输出推理链后给出最终答案
LFM2.5-8B-A1B (Liquid AI)
8.3B总参/1.5B活跃,面向端侧个人助手的混合架构模型
2026-06-01
Qwen3.5-9B (Qwen)
Qwen3.5-9B MoQ量化版,MTP推测解码,适合本地快速生成
2026-05-31
Qwen3.6-35B-A3B-NVFP4 (NVIDIA)
Qwen3.6-35B-A3B FP4量化版,面向vLLM高效推理
2026-05-29
LFM2.5-8B-A1B (LiquidAI)
混合架构边缘语言模型,GGUF 量化,供 llama.cpp 部署
LFM2.5-8B-A1B (LiquidAI)
端侧部署的混合MoE模型,用于工具调用与多语言助理
2026-05-28
MiniCPM5-1B-GGUF (OpenBMB)
1B 模型 GGUF 量化,本地 agent 与边缘部署用
2026-05-27
BitCPM-CANN-8B (OpenBMB)
昇腾原生1.58-bit三元LLM,推理内存降6x,保持95.7%性能
2026-05-26
aro-coder-4bit (ARO-Lang)
为ARO语言微调的代码生成器,4bit量化,供ARO DSL开发者使用
MiniCPM5-1B (OpenBMB)
1B 端侧模型,工具调用与混合推理
2026-05-24
Qwopus3.6-27B-v2-MTP-GGUF (Jackrong)
多Token预测推理模型,面向编码、数学、DevOps开发者
Qwen3.6-27B (OBLITERATUS)
移除拒绝回路,能力保持,本地全栈部署
2026-05-22
Meta-Llama-3-8B-Instruct-4bit (mlx-community)
Llama-3-8B 4-bit版,M系列芯片本地推理
Ternary-Bonsai-8B (Prism ML)
三元1.58-bit量化8B模型,苹果芯片本地推理
2026-05-21
Qwopus3.5-9B-Coder-MTP (Jackrong)
9B多令牌预测代码模型,GGUF量化,面向代码推理
Llama-2-7b-chat-mlx (mlx-community)
Apple芯片上本地运行的Llama2 7B对话模型
Nemotron-Labs-Diffusion-14B (NVIDIA)
三模式 LM (AR/扩散/自推测),为 AI 应用开发者提供高效生成
2026-05-20
SuperGemma4-26B (Jiunsong)
Gemma4 26B 无审查 MLX, 本地代理加速
Bonsai-8B-mlx-1bit (PrismML)
Apple Silicon 的 1-bit LLM,端侧极低内存推理
Minimalism (salakash)
为开发者输出最少代码行的可运行代码
HRM-Text-1B (sapientinc)
1B预对齐前缀LM,用前缀条件做结构化输出与推理
2026-05-18
SuperGemma4-26B-Uncensored (Jiunsong)
无审查Gemma 4 26B GGUF,适合苹果硅本地快速推理
2026-05-16
Nandi-Mini-600M (FrontiersMind)
600M参数早期检查点,面向低资源多语言部署
Esc
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索