模型 / Ornith-1.0-9B (DeepReinforce)

Ornith-1.0-9B (DeepReinforce)

Ornith-9B MTP GGUF:llama.cpp推测解码加速

作者 deepreinforce-ai

~5.4GB 4-bit许可 可商用任务 文本生成最近核对 2026-07-08

仅 safetensors · 无 pickle 加载风险

格式
4-bit
文件
~4.7GB
运行内存
~5.4GB–7GB
运行时
LLAMA-SERVER
下载
218

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf deepreinforce-ai/Ornith-1.0-9B-GGUF -c 262144

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
今天能用llama.cpp直接运行,自带多token预测加速,适合需要本地快速推理9B模型的开发者;注意需要llama.cpp b9616+和至少5GB显存。
对位
Qwen3.5-9B 基座, 对位 Llama-3-8B
适合
无需额外草稿模型的推测解码 / 低VRAM场景的批量生成吞吐优化
不适合
要求bitwise一致输出的评测

独立证据与社区反馈

2 个独立来源最近验证 2026-07-08

9B模型便于本地部署且基准成绩亮眼,但实际编码任务中表现不佳,无工具环境下幻觉严重

  • 可在本地或边缘设备上部署
  • 在SWE-Bench Verified上得分69.4,超过部分更大模型
  • 实际编码任务中表现不佳,仅发现几乎所有模型都能发现的bug
  • 无工具环境的对话中幻觉严重
  • 会幻觉工具调用及其输出

可信度RTX A6000 单卡 1.4-1.7x 解码加速,接受率 0.766 与 vLLM 一致,1.4 万次下载

完整规格

规模
9B · 256k · 下载 ~4.7GB · 显存最低 ~5.4GB · 推荐 ~7GB · 4-bit(估算)
授权
MIT · 可商用
框架
llama.cpp
工具调用
OpenAI-style (Qwen3 XML)
血统
量化自 Ornith-1.0-9B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 592.1k → 1023.2k

观测时间线