数据集 / HuggingFaceBio / carbon-pretraining-corpus

HuggingFaceBio / carbon-pretraining-corpus

DNA和RNA序列的基因组预训练语料,覆盖真核与原核物种。

作者
HuggingFaceBio
规模
1.80亿行 · 1.3 TB
模态
文本
任务
文本生成
授权
other · 许可待核
下载
2,856
收藏
17

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

项目方资料核对

该数据集以真核生物序列为主,非真核支系覆盖不足,采用前需评估目标生物类群是否匹配。

  • Carbon-3B 的预训练语料以真核生物基因组与转录组序列为主,原核生物、古菌等非真核支系的代表性偏低,在非真核任务上泛化能力可能受限。

截至 2026-07-22

观测时间线