Qwen / AgentWorldBench
评估语言世界模型的基准,数据来自真实环境轨迹与地面真值。
2个月前更新
本页记录当日收录项目。
评估语言世界模型的基准,数据来自真实环境轨迹与地面真值。
2个月前更新
包含1403个PDF文件和7010个测试用例,评估OCR系统转换PDF为markdown的能力。
6个月前更新
GLM-5.2模型生成的284个代理追踪文件,包含训练可用的工具模式。
2个月前更新
FABLE.5和Mythos的完整追踪数据集,已去重并保留来源信息。
2个月前更新
PyTorch问题与Triton内核实现配对的GPU延迟数据集,标签为内核运行时。
3个月前更新
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索