可商用的文本生成模型
共 64 个
Nanbeige4.2-3B (Nanbeige) 3B 参数 agent 模型,聚焦工具调用与本地个人助理 Ornith-35B-MLX (AtomicChat) 面向 Apple Silicon 的多模态量化模型,文本+图像 Ornith-35b-MLX-6bit (AtomicChat) 35B MoE MLX 量化,Mac 本地多模态推理 Ornith-1.0-35B (DeepReinforce) 35B MoE代理编码模型,支持终端代理与工具调用 Qwen3.6-35B-A3B (andreaborio) Qwen3.6 MoE 量化版,Apple Metal 加速推理 Bonsai-27B-mlx-1bit (Prism ML) 1-bit 27B 模型, 可在手机和笔记本本地运行推理 Hy-MT2-30B-A3B-APEX (Tencent) 多语言翻译 MoE 模型的 APEX 量化版,供本地 GGUF 推理 Hy3-GGUF (腾讯) 腾讯 Hy3 混合精度 GGUF,针对本地受限硬件极限压缩 MiniCPM5-1B-Thinking (OpenBMB) 1B 思考模型,改进编码与指令遵循,适合本地部署 Qwen3.5-35B-A3B (Qwen) 4-bit MLX 量化,Apple Silicon 本地运行文本生成 Ternary Bonsai 27B (prism-ml) 三元2-bit 27B开源模型,笔记本本地运行推理 Ternary-Bonsai-27B (Prism ML) 三元权重 27B 推理模型,笔记本本地运行 Qwen3.6-35B-A3B-VQ (aquaman164) MLX VQ量化35B MoE,适合Apple Silicon本地推理 Qwen3.5-9B-OptiQ-4bit (mlx-community) Apple Silicon 本地 4-bit 混合精度量化文本生成模型 Qwythos-9B-v2 (Empero AI) 修复循环生成并保留1M上下文推理能力的研究型模型 Nova-1-Standard-1.3B (Smilyai Labs) 1.3B MoD对话模型,支持ChatML与代码/数学生成 Qwen3.6-35B-A3B (Qwen) 三元专家量化版,9.4 GB 全量跑在 16 GB Mac 上 Gemma4-Gutenberg-31B-Heretic-mlx-8Bit (ailexleon) MLX 8-bit 量化英文创意写作模型,适合故事小说生成 Ornith-1.0-9B (DeepReinforce) Ornith-9B MTP GGUF:llama.cpp推测解码加速 Huihui-GLM-5.2-GGUF (huihui-ai) 移除安全过滤的GLM-5.2 GGUF,供研究实验用 Qwen3.6-27B-NVFP4 (NVIDIA) Qwen3.6-27B NVFP4 量化,面向 vLLM 部署与推理 BugTraceAI-CORE-Ultra-27B (BugTraceAI) 生成漏洞利用与安全工具,面向攻防研究者 Mythos-nano (squ11z1) 3B无审查推理模型,专注数学与竞赛编程 Mythos-nano (squ11z1) 轻量推理模型,专注数学与代码任务的本地运行 FastContext-1.0-4B-RL (Microsoft) 为编码代理提供仓库探索与精确文件引用 Huihui-gemma-4-12B-coder-abliterated (huihui-ai) 未审查版 Gemma 代码模型,用于编程与推理,已去除拒答 GLM-5.2 1M上下文开源模型,面向长文本处理与代码生成 DeepSeek-V4-Flash 284B MoE 架构,13B 激活参数,原生支持百万 Token 上下文,高效推理与强训练基线。 DeepSeek-V4-Pro 1.6T参数MoE旗舰,原生百万token上下文,开源模型新标杆。 Gemma-4-12B-it-LWQ6 (wepiqx) 混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成 Gemma-4-31B-StyleTune (Gryphe) Gemma 4 31B风格微调,陈词减60%,角色扮演与创意写作。 VibeThinker-3B (WeiboAI) 面向数学/代码/STEM的可验证推理3B小模型 FastContext-1.0-4B-SFT (Microsoft) 轻量仓库探索子代理,供编码代理按需调用,减少 token 消耗 prism-coder-14b (dcostenco) 基于 Qwen3 的 14B 代码模型 GGUF 量化,本地可跑 prism-coder-14b (mradermacher) 基于 Qwen3 的代码模型,GGUF 量化版,适合本地运行 DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA) 扩散多模态文本生成,3.8B活跃参数,NVFP4量化 Z-Image-Engineer-V6 (BennyDaBall) 4B 提示词增强与 Z-Image 文本编码器,本地双用途 Averroes-Q-Instruct (hayulalab) Qwen2 架构的阿/英指令模型 GGUF 量化 Gemma4-12B-Coder (yuxinlu1) 本地 Python 编程模型,离线解决算法问题 Quasar-Preview (silx-ai) 18B MoE预览模型,面向Bittensor SN24研究蒸馏 Delphi-25B (Marin Community) Delphi扩展律研究基座,25B参数,终版模型 Nex-N2-mini (nex-agi) 面向编码与工具调用的智能体模型 Qwen3.5-0.8B-OptiQ-4bit (mlx-community) 苹果芯片4-bit MLX 量化 Qwen3.5-0.8B Qwen3.5-2B-OptiQ-4bit (mlx-community) 4-bit混合精度MLX量化Qwen3.5-2B,苹果芯片推理 Qwen3.6-27B-MTPLX (Youssofal) Qwen3.6-27B 的 MLX 推理加速版供苹果芯片 Qwen3.6-27B-OptiQ-4bit (mlx-community) Apple Silicon的Qwen3.6-27B 4bit混合量化版 Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community) Apple Silicon 4-bit MLX混精量化+MTP投机解码 Mellum2-12B-A2.5B-Instruct (JetBrains) 直接回答的指令模型,用于交互聊天、代码和工具调用 Mellum2-12B-A2.5B-Thinking (JetBrains) 思考型助手,在<think>块中输出推理链后给出最终答案 Qwen3.5-9B (Qwen) Qwen3.5-9B MoQ量化版,MTP推测解码,适合本地快速生成 Qwen3.6-35B-A3B-NVFP4 (NVIDIA) Qwen3.6-35B-A3B FP4量化版,面向vLLM高效推理 BitCPM-CANN-8B (OpenBMB) 昇腾原生1.58-bit三元LLM,推理内存降6x,保持95.7%性能 aro-coder-4bit (ARO-Lang) 为ARO语言微调的代码生成器,4bit量化,供ARO DSL开发者使用 Hy-MT2-1.8B-GGUF (Tencent) 轻量多语言翻译模型,支持 llama.cpp 本地部署 Qwen3.6-27B (OBLITERATUS) 移除拒绝回路,能力保持,本地全栈部署 Ternary-Bonsai-8B (Prism ML) 三元1.58-bit量化8B模型,苹果芯片本地推理 Granite-4.1-30B (IBM) IBM Granite 30B GGUF量化, 本地部署与推理 Granite-4.1-3B-GGUF (IBM) IBM Granite 4.1 3B GGUF量化,本地推理与边缘部署 Granite-4.1-8B-GGUF (IBM) IBM Granite 4.1 8B的GGUF量化,用于本地推理 Bonsai-8B-mlx-1bit (PrismML) Apple Silicon 的 1-bit LLM,端侧极低内存推理 HRM-Text-1B (sapientinc) 1B预对齐前缀LM,用前缀条件做结构化输出与推理 Minimalism (salakash) 为开发者输出最少代码行的可运行代码 Leanly_AI (jackxinning) 通用问答模型,适合知识型对话与事实查询。 Nandi-Mini-600M (FrontiersMind) 600M参数早期检查点,面向低资源多语言部署