Kwai-Klear / GoLongRL
面向长上下文语言模型的强化学习训练数据,含9种奖励函数
关键规格
HF 热度484 下载 · 16 收藏观测于 2026-05-26
源仓库更新2026-05-21
采用判断
项目方资料核对 · 2 个来源 · 核验于 2026-07-22
Kwai-Klear 组织存在数据校验问题和访问门槛,采用 GoLongRL 前需核实具体数据集的许可和质量[1][2]
适合用来
- 长上下文强化学习与多任务对齐研究
采用前注意
本段综合依据
- Kwai-Klear (Klear team, Kuaishou Technology) ↗huggingface.co
- Kwai-Klear/Klear-AgentForge-8B-SFT · Hugging Face ↗huggingface.co
历史记录
1 次历史卡片 · 2026-05-26
研究依据
以下论文与本条目存在经人工复核的直接关系。论文本身不构成对它的推荐。