模型 / HRM-Text-1B (sapientinc)

HRM-Text-1B (sapientinc)

1B预对齐前缀LM,用前缀条件做结构化输出与推理

作者 sapientinc

~0.7GB 4-bit许可 可商用任务 文本生成最近核对 2026-07-22
格式
4-bit
文件
~0.6GB
运行内存
~0.7GB–0.9GB
运行时
transformers
下载
884

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
需手动安装最新transformers,有示例;HRM循环架构。
对位
对位SmolLM2-1.7B、Qwen2.5-0.5B等小型预训练LM
适合
Few-shot 直接答案提取(direct前缀) / 复合条件 CoT 推理(synth,cot前缀)
不适合
聊天对话与代码生成

独立证据与社区反馈

3 个独立来源 · 另 1 官方/转载最近验证 2026-07-22

社区对HRM-Text-1B采用自定义架构而非标准LLaMA/Qwen解码器感到好奇,极低训练成本(约$1k/40B tokens)和MATH基准表现引发讨论,但普遍持观望态度。

  • 极低成本预训练:40B tokens约$1k,16张H100约46小时完成
  • 非蒸馏/Llama系的全新1B规模架构,使用自定义hrm_text模型类
  • 在MATH基准上超越Llama 3.2 3B
  • 社区指出存在benchmark gaming的可能,即仅针对特定基准优化的风险

可信度下载884次,点赞112;训练数据开源(data_io),许可证Apache-2.0

完整规格

规模
1B · 4096 · 下载 ~0.6GB · 显存最低 ~0.7GB · 推荐 ~0.9GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
transformers
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 29.8k → 22.8k · likes +12

观测时间线