工具 / lm-evaluation-harness

lm-evaluation-harness

  • cli
  • testing

跑标准基准测评语言模型的框架,Open LLM Leaderboard 的评测底座

EleutherAI 维护的语言模型少样本评测框架。核心是把「模型」与「任务」解耦:任务用 YAML 配置定义并可外部导入分享,模型后端按需装(lm_eval[hf]lm_eval[vllm]lm_eval[sglang] 等),同一套任务集可以在不同推理后端上跑出可比结果。CLI 自 v0.4 起拆成 run / ls / validate 子命令,支持 --config 读 YAML。Open LLM Leaderboard 的任务组直接内置在 leaderboard 任务组下。也支持 API 模型(批量与异步请求)与 hf-multimodal 等文本+图像输入的原型任务。

社区实测

社区公认的参考性开源 LLM 评测框架,在需要跑标准基准时常被首先推荐。

  • 提供标准化的 LLM 基准测试自动化流程
  • 覆盖 HuggingFace 排行榜相关的主流基准任务
  • 内置基准任务数量庞大,新手容易感到无从下手
  • 存在多个替代方案,在定制化与分析场景下不如 HF 的 lighteval 灵活

截至 2026-08-16

pip install "lm_eval[hf]"

← 返回工具库