模型 / Warmly 0.8B (neureps)

Warmly 0.8B (neureps)

0.8B韩英图像字幕与对话,LoRA适配低内存设备

作者 neureps

仓库标识neureps/warmly-qwen35-08b-enko-gguf

显存未知许可 可商用任务 视觉理解最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
OLLAMA
下载
549

Hugging Face 源仓库 ↗

快速上手示例

ollama run hf.co/neureps/warmly-qwen35-08b-enko-gguf

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
0.8B的GGUF模型,支持图像描述和对话,可在低端设备运行,提供llama.cpp调用示例,适合韩语/英语场景的本地部署。
对位
仅文本同级: Qwen2.5-0.5B;VL同级稀少
适合
低内存设备视觉对话 / 韩/英图像字幕生成
不适合
高精度复杂推理任务

独立证据与社区反馈

12 个独立来源最近验证 2026-08-05

Qwen3.5 0.8B 在 1.1GB 级别的体量下知识储备出乎意料地丰富,整体表现明显超过同尺寸前代模型,但受限于规模,字符计数等基础推理任务仍会失败,不太适合严肃编程场景。作为完全开源、API 定价极低的小模型,它可以在 Orange Pi Zero 2W 这样的廉价板卡上运行(尽管速度很慢),适合做简单的 bot 逻辑或本地微调实验。

  • 体量仅 1.1GB,在 Orange Pi Zero 2W(约 £14 的板卡)上也能跑起来,虽然 token/s 很低
  • 完全开源,可自由部署和微调
  • API 输入定价仅 $0.01/M tokens,输出 $0.05/M tokens,在同尺寸模型中极具价格优势
  • 可在 Mac 上使用 LoRA 进行本地微调,零云端算力即可完成 text-to-SQL 等结构化任务
  • 知识面对于 1.1GB 的模型来说超出预期,用户感到惊喜
  • 相比前代 Qwen3 同尺寸模型,综合表现明显「越级」,属于 punching above weight
  • 可以做比 if/then/else 更智能的简单 bot 逻辑
  • 微调工作流可完全本地运行,无需云端 GPU
  • 无法通过 strawberry 测试(字母计数),即使提示逐字符思考也失败
  • 存在 tokenization 导致的自身缺陷不自知问题,字符级推理能力弱
  • 在 Orange Pi Zero 2W 等超低功耗设备上运行速度极低
  • 编程基准得分仅 1.0,远低于同系列大尺寸模型(27B 得分 33.4,122B 得分 31.6)
  • 不支持视觉(vision)输入
  • 与 opencode/ollama 的集成存在连接问题,可能让初次使用者觉得「完全不能用」

可信度基于Qwen3.5-0.8B蒸馏,card提供Gemma 4 12B评估数据

完整规格

规模
0.8B · 权重格式未知,无法估算显存
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
LoRA · 基于 Qwen3.5-0.8B-enko
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 5.5k → 2.6k

观测时间线