agents-last-exam / agents-last-exam
面向长周期专业工作的计算机使用代理评估基准的任务元数据
3个月前更新
项目方资料核对
- 将 AI 智能体评测从抽象代理问题转向长周期、有经济价值的真实工作流
- 基准仍在建设中,当前 1,500+ 任务距 5,000 目标差距较大,公开可用的参考任务仅 150 个
3 个来源 · 截至 2026-06-20
本页记录当日收录项目。
面向长周期专业工作的计算机使用代理评估基准的任务元数据
3个月前更新
3 个来源 · 截至 2026-06-20
对话语音代理端到端评估框架,基于机器人间音频对话评分
4个月前更新
用于音频大模型与代理训练的流式音频数据集,含六个任务子集
3个月前更新
Khasi语-英语平行语音与文本语料样本
4个月前更新
1 个来源 · 截至 2026-06-20
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索