数据集 / greghavens / kimi-k3-coding-and-debugging-traces

greghavens / kimi-k3-coding-and-debugging-traces

Kimi K3模型在真实仓库中完成编码与调试的轨迹数据。

HF 源仓库 ↗本站资料更新 2026-07-22

关键规格

作者
greghavens
规模
110 行 · 3 MB
模态
文本
任务
文本生成
授权
cc-by-4.0 · 许可标注允许商用
语种
en
HF 热度82 下载 · 19 收藏观测于 2026-07-22
源仓库更新2026-07-19

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

采用判断

项目资料与外部反馈 · 4 个来源 · 核验于 2026-07-22

该数据集仅含 3 条汇编编码任务的 Kimi K3 推理轨迹,规模极小且领域极度狭窄,轨迹本身带有大量回溯噪声与已知的幻觉内容,实用价值有限。[1][2][3]

适合用来

  • 提供真实模型在汇编编码任务上的完整推理轨迹,可用于研究推理过程中的回溯行为或 token 效率[1][3]

采用前注意

  • 轨迹包含大量自我质疑与回溯噪声(如反复出现"Wait, actually..."),信号质量较低,用于训练或评估时需额外清洗[1]
  • 底层模型 Kimi K3 存在事实性幻觉,推理内容中曾出现"Claude says this..."等跨模型混淆表述,可能污染轨迹中的推理逻辑[2]
  • 数据集仅包含 3 条任务,且全部为 x86-64 汇编编码,领域覆盖极窄,无法泛化到其他编程语言或任务类型[3]
  • Kimi K3 的基准评测方法存在争议——官方评测表混合了不同工具和 agent 的结果,且模型对保留的思考历史敏感,基于该数据集做评测需谨慎对待方法论差异[4]

历史记录

1 次历史卡片 · 2026-07-22