模型 / Hy3-GGUF (腾讯)

Hy3-GGUF (腾讯)

腾讯 Hy3 混合精度 GGUF,针对本地受限硬件极限压缩

作者 AngelSlim

许可 可商用任务 文本生成最近核对 2026-07-22
运行时
OLLAMA

Hugging Face 源仓库 ↗

快速上手示例

ollama run hf.co/AngelSlim/Hy3-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
腾讯Hy3的GGUF量化版,提供完整部署脚本和混合精度配方,支持MTP自推测解码,适合多卡服务器本地运行。
适合
H20 单卡/双卡本地推理 / 带自推测解码的低延迟生成
不适合
生产环境高并发在线服务

独立证据与社区反馈

5 个独立来源最近验证 2026-07-22

295B 总参、21B 激活的 MoE 架构,Apache 2.0 协议,是近年来综合性价比最高的开源权重模型之一,在 128GB 消费级硬件上可跑通,编码能力接近前沿闭源模型。

  • Apache 2.0 开源协议,允许商用和二次分发
  • 295B MoE 仅 21B 激活参数,可在 128GB 内存的消费级设备上本地运行
  • 免费 API 入口(OpenRouter),降低使用门槛
  • 前端编码与 3D 场景生成能力可对标甚至超越 Fable 5 等闭源模型
  • 上下文窗口偏小,长文本场景受限
  • GLM 5.2 在部分横向对比中仍更强
  • 预览版曾存在地理限制(EU/UK/SK 不可用),正式版已切换为 Apache 2.0

可信度腾讯 AngelSlim 团队提供,附 llama.cpp 补丁与量化配方

完整规格

规模
65536
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 Hy3
访问提示
标记为魔搭可用,具体仓库请自行核对

下载动量

30天下载 0 → 145.1k

观测时间线