指南 / 文本生成模型 / 可用 CPU 运行

可用 CPU 运行的文本生成模型

共 40 个

Nanbeige4.2-3B (Nanbeige) 3B 参数 agent 模型,聚焦工具调用与本地个人助理 Ornith-1.0-35B (DeepReinforce) 35B MoE代理编码模型,支持终端代理与工具调用 Qwen3.6-35B-A3B (andreaborio) Qwen3.6 MoE 量化版,Apple Metal 加速推理 Dolphin3-Cyber-8B (RavichandranJ) 网络安全领域8B微调模型, 本地离线运行红蓝队工具 Hy-MT2-30B-A3B-APEX (Tencent) 多语言翻译 MoE 模型的 APEX 量化版,供本地 GGUF 推理 Hy3-GGUF (腾讯) 腾讯 Hy3 混合精度 GGUF,针对本地受限硬件极限压缩 MiniCPM5-1B-Thinking (OpenBMB) 1B 思考模型,改进编码与指令遵循,适合本地部署 Bonsai-27B (Prism ML) 27B 1-bit 量化模型,面向笔记本与手机本地推理 Ternary-Bonsai-27B (Prism ML) 三元权重 27B 推理模型,笔记本本地运行 Qwythos-9B-v2 (Empero AI) 修复循环生成并保留1M上下文推理能力的研究型模型 Nemotron-Labs-Audex-2B (NVIDIA) 统一音频-文本语言模型,支持语音识别、翻译、TTS 与音频生成 Supra-Router-51M (SupraLabs) 51M 参数边缘路由器, 判断提示词复杂度并分发至本地或云端模型 Agents-A1 (InternScience) 35B MoE 视觉 Agent,用于长程搜索与工具调用 Nova-1-Standard-1.3B (Smilyai Labs) 1.3B MoD对话模型,支持ChatML与代码/数学生成 Ornith-1.0-9B (DeepReinforce) Ornith-9B MTP GGUF:llama.cpp推测解码加速 Huihui-GLM-5.2-GGUF (huihui-ai) 移除安全过滤的GLM-5.2 GGUF,供研究实验用 LFM2.5-8B-A1B-APEX (LiquidAI / LocalAI) 8B参数1B激活MoE,消费级GPU可运行的APEX量化 LFM2.5-230M (LiquidAI) 混合架构边缘设备模型,用于设备端文本生成 Mythos-nano (squ11z1) 3B无审查推理模型,专注数学与竞赛编程 Mythos-nano (squ11z1) 轻量推理模型,专注数学与代码任务的本地运行 GLM-5.2 1M上下文开源模型,面向长文本处理与代码生成 Gemma-4-12B-it-LWQ6 (wepiqx) 混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成 VibeThinker-3B (WeiboAI) 面向数学/代码/STEM的可验证推理3B小模型 prism-coder-14b (dcostenco) 基于 Qwen3 的 14B 代码模型 GGUF 量化,本地可跑 prism-coder-14b (mradermacher) 基于 Qwen3 的代码模型,GGUF 量化版,适合本地运行 Averroes-Q-Instruct (hayulalab) Qwen2 架构的阿/英指令模型 GGUF 量化 Gemma4-12B-Coder (yuxinlu1) 本地 Python 编程模型,离线解决算法问题 LFM2.5-1.2B-JP (LiquidAI) 日英双语聊天模型,适合代理工作流与工具使用 Qwen3.5-0.8B-OptiQ-4bit (mlx-community) 苹果芯片4-bit MLX 量化 Qwen3.5-0.8B HelixLM-40M-ep1 (david-thrower) 循环异构图语言模型,用于个性化微调与端侧推理 LFM2.5-8B-A1B (LiquidAI) 8.3B总参/1.5B活跃,面向端侧个人助手的混合架构模型 Hy-MT2-1.8B-GGUF (Tencent) 轻量多语言翻译模型,支持 llama.cpp 本地部署 Granite-4.1-30B (IBM) IBM Granite 30B GGUF量化, 本地部署与推理 Granite-4.1-3B-GGUF (IBM) IBM Granite 4.1 3B GGUF量化,本地推理与边缘部署 Granite-4.1-8B-GGUF (IBM) IBM Granite 4.1 8B的GGUF量化,用于本地推理 MiniMax-M2.7 (MiniMax) MiniMax M2.7 GGUF量化版,适合本地部署与实验 Bonsai-8B-mlx-1bit (PrismML) Apple Silicon 的 1-bit LLM,端侧极低内存推理 HRM-Text-1B (sapientinc) 1B预对齐前缀LM,用前缀条件做结构化输出与推理 Minimalism (salakash) 为开发者输出最少代码行的可运行代码 Nandi-Mini-600M (FrontiersMind) 600M参数早期检查点,面向低资源多语言部署