lm-evaluation-harness
跑标准基准测评语言模型的框架,Open LLM Leaderboard 的评测底座
EleutherAI 维护的语言模型少样本评测框架。核心是把「模型」与「任务」解耦:任务用 YAML 配置定义并可外部导入分享,模型后端按需装(lm_eval[hf]、lm_eval[vllm]、lm_eval[sglang] 等),同一套任务集可以在不同推理后端上跑出可比结果。CLI 自 v0.4 起拆成 run / ls / validate 子命令,支持 --config 读 YAML。Open LLM Leaderboard 的任务组直接内置在 leaderboard 任务组下。也支持 API 模型(批量与异步请求)与 hf-multimodal 等文本+图像输入的原型任务。
社区实测
社区公认的参考性开源 LLM 评测框架,在需要跑标准基准时常被首先推荐。
- 提供标准化的 LLM 基准测试自动化流程
- 覆盖 HuggingFace 排行榜相关的主流基准任务
- 内置基准任务数量庞大,新手容易感到无从下手
- 存在多个替代方案,在定制化与分析场景下不如 HF 的 lighteval 灵活
来源
r/LocalLLaMA: LLM evaluation framework that supports HF leaderboard benchmarks?r/LocalLLaMA: What are the best evaluations benchmarksr/LocalLLaMA: How to evaluate an LLM?Open Source Alternatives to LM Eval Harness
截至 2026-08-16
pip install "lm_eval[hf]"