数据集 / greghavens / kimi-k3-coding-and-debugging-traces

greghavens / kimi-k3-coding-and-debugging-traces

Kimi K3模型在真实仓库中完成编码与调试的轨迹数据。

作者
greghavens
规模
110 行 · 3 MB
模态
文本
任务
文本生成
授权
cc-by-4.0 · 许可标注允许商用
语种
en
下载
82
收藏
19

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

项目资料与外部反馈

该数据集仅含 3 条汇编编码任务的 Kimi K3 推理轨迹,规模极小且领域极度狭窄,轨迹本身带有大量回溯噪声与已知的幻觉内容,实用价值有限。

  • 提供真实模型在汇编编码任务上的完整推理轨迹,可用于研究推理过程中的回溯行为或 token 效率
  • 轨迹包含大量自我质疑与回溯噪声(如反复出现"Wait, actually..."),信号质量较低,用于训练或评估时需额外清洗
  • 底层模型 Kimi K3 存在事实性幻觉,推理内容中曾出现"Claude says this..."等跨模型混淆表述,可能污染轨迹中的推理逻辑
  • 数据集仅包含 3 条任务,且全部为 x86-64 汇编编码,领域覆盖极窄,无法泛化到其他编程语言或任务类型
  • Kimi K3 的基准评测方法存在争议——官方评测表混合了不同工具和 agent 的结果,且模型对保留的思考历史敏感,基于该数据集做评测需谨慎对待方法论差异

截至 2026-07-22

观测时间线