一文看懂Awesome-LLM-Eval:大模型评测资源宝库里到底有什么?
【免费下载链接】Awesome-LLM-EvalAwesome-LLM-Eval: a curated list of tools, datasets/benchmark, demos, leaderboard, papers, docs and models, mainly for Evaluation on LLMs. 一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表,主要面向基础大模型评测,旨在探求生成式AI的技术边界.项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-LLM-Eval
Awesome-LLM-Eval 是一个大模型评测(LLM Evaluation)资源宝库,以精选列表的形式收录了评测工具、基准数据集、排行榜、论文与大模型清单,主要面向基础大模型评测,旨在探求生成式 AI 的技术边界。本文带你快速看懂这个「宝库」里到底有哪些内容,以及新手该如何上手。
📦 一句话理解:Awesome-LLM-Eval 是什么
它围绕工具、数据集/基准、演示、排行榜、论文、模型六大类整理资源,还延伸出 LLMOps、训练框架、课程等板块,同时也是一篇大模型评测综述论文的官方开源仓库。对新手有三点友好设计:
- 中英双语:仓库同时提供
README_CN.md、README_EN.md和主文件README.md,可按语言阅读; - 表格化组织:每个条目都带简介、机构、适用场景,直接按名称检索即可;
- 持续更新:
News板块记录了每次新增内容的时间线,从 2023 年首个评测列表一直更新到 2025 年的「拟人化评测分类法」。
🌳 评测资源全景图:IQ、EQ、PQ 三大维度
仓库中最直观的一张图,就是 2025 版大模型评测分类树(文件位于docs/llm-eval-tree-2025.png)。它把「评测大模型」这件事拆成了三条主线:
| 维度 | 中文名 | 考察什么 | 代表基准 |
|---|---|---|---|
| IQ(智商) | 通用智能 | 推理、知识、数学 | MMLU-Pro、AIME、GSM8K、MATH、GPQA |
| EQ(情商) | 对齐能力 | 安全、公平、指令遵循 | HarmBench、IFEval、TrustLLM、AlignBench |
| PQ(专业商) | 专业素养 | 垂直领域能力 | MedBench、LawBench、HumanEval、SWE-bench |
这棵树还按时间轴(2020 → 2025)把各代模型(GPT-3、GPT-4、Llama、DeepSeek 等)和对应出现的基准连在一起,一眼就能看出大模型评测领域「每个模型时代解决了什么新问题」。
🧰 评测工具清单:快速上手的工具箱
Tools 板块收录了 20 多个大模型评测工具,新手重点看这几个:
- OpenCompass(司南)——上海 AI 实验室的一站式大模型评测平台,覆盖 5 大能力维度、50 多个数据集、约 30 万道题目,支持万亿参数模型分布式评测,中文场景首选;
- lighteval——Hugging Face 出品的轻量级评测框架,支持 CPU/GPU 与分布式评测,兼容 Open LLM Leaderboard 上的全部基准;
- DeepEval——像 Pytest 一样给 LLM 输出做「单元测试」,内置 G-Eval、幻觉、答案相关性等指标;
- HELM——斯坦福提出的综合评测方法,从语言能力、知识、推理、公平性、安全性多角度打分;
- lm-evaluation-harness——EleutherAI 的经典任务评测工具,适合批量跑客观题基准。
选型捷径:中文场景选 OpenCompass,英文开源模型选 lighteval,自建评测流水线选 DeepEval。
📊 基准数据集:9 大场景一站直达
Datasets / Benchmark 板块细分为 9 个场景,几乎覆盖大模型评测的所有方向:
| 场景 | 评测重点 | 代表数据集 |
|---|---|---|
| 通用 | 知识、推理、数学 | MMLU-Pro、TrustLLM、LV-Eval、FELM |
| 垂直领域 | 医疗、金融、法律、电信 | MedBench、Fin-Eva、LAiW、LawBench |
| RAG 评估 | 噪声鲁棒、负向拒答、幻觉 | BERGEN、CRAG、RGB、ARES |
| Agent 能力 | 工具调用、任务规划、记忆 | AgentBench、SuperCLUE-Agent |
| 代码能力 | 补全、理解、调试 | McEval、HumanEval-XL、DebugBench |
| 多模态 | 图表理解、视觉语言 | ChartVLM、ReForm-Eval、LVLM-eHub |
| 长上下文 | 100K+ 长文本理解 | InfiniteBench、BAMBOO |
| 推理速度 | 首 token 时延、吞吐 | llmperf、llm-inference-bench |
| 量化压缩 | 训练后量化效果 | LLM-QBench |
两个值得细看的细节:
- RAG 评估聚焦噪声鲁棒性、负向拒答、信息整合、反事实鲁棒性四项能力,是构建 RAG 应用时的直接参考;
- 长上下文方向的 InfiniteBench 平均数据长度超过 10 万 token,是目前少见的 100K+ 基准。
🏆 排行榜汇总:大模型排名一站直达
Leaderboards 板块收录了 40 余个主流大模型评测排行榜,包括 Hugging Face Open LLM Leaderboard、Chatbot Arena、C-Eval、SuperCLUE、HELM、LawBench、MathEval 等,不需要逐个平台搜索。
更有价值的是仓库内维护的热门模型性能-成本对比表:横向对比 GPT-4o、Claude 3、Gemini 1.5、Llama 3、DeepSeek-V2 等模型的基准均分、吞吐量(tokens/秒)、输入输出价格与性价比,商用选型时可直接查阅。
🧬 大模型清单:一张可视化演化树
LLM-List 板块将模型分为五类:预训练 LLM、指令微调 LLM、对齐 LLM、开源 LLM、热门 LLM,并配有详细的参数量、层数、注意力头、预训练 token 数、是否 RLHF 等参数表。
这张「LLM 演化树」按时间线还原了从 Word2Vec、BERT、GPT-1/2 到 LLaMA、PaLM、GPT-4 的模型血缘,开源与闭源两条路线一目了然,适合想系统了解大模型发展脉络的读者。
📚 论文、课程与生态资源
宝库不只有工具和数据,还有学习资源:
- Papers:30 余篇大模型评测经典论文,涵盖评测综述、G-Eval、HELM 全要素评测等;
- Courses:大模型课程 Notebook 合集、Full Stack LLM Bootcamp 等学习路线;
- LLMOps:LangChain、LlamaIndex、Dify、LiteLLM、promptfoo 等 25 余个大模型运维工具;
- Frameworks for Training:DeepSpeed、PyTorch、ColossalAI、MindSpore 等训练框架;
- Other Awesome Lists:LLM 压缩、多模态、高效大模型等相关资源合集,方便延伸阅读。
🚀 快速上手:三步开始使用
第 1 步,克隆仓库
git clone https://gitcode.com/gh_mirrors/aw/Awesome-LLM-Eval第 2 步,选语言读 README:中文读者从README_CN.md入手,英文读者从README_EN.md入手。
第 3 步,按场景检索:在文件中直接搜索 RAG、Agent、Long Context 等关键词,即可定位对应基准清单。
两个使用小贴士:
- 许可证区分对待——
LICENSE.txt为 MIT 协议(代码与列表),LICENSE-DATA.txt为 CC BY-NC-SA 4.0(数据部分),商业使用前请留意; - 建议关注
News板块,大模型评测领域更新很快,定期回看能掌握最新基准动态。
❓ 新手常见疑问
这个仓库适合零基础读者吗?适合。它是「查阅型」资源库,不需要跑代码,所有条目都以表格 + 简介形式呈现,按需查找即可。
必须把所有基准都跑一遍吗?不必。建议「1 个通用基准 + 1 个场景基准」(如 RAG 或代码)作为第一轮模型对比的起点,之后再按业务需求扩展。
【免费下载链接】Awesome-LLM-EvalAwesome-LLM-Eval: a curated list of tools, datasets/benchmark, demos, leaderboard, papers, docs and models, mainly for Evaluation on LLMs. 一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表,主要面向基础大模型评测,旨在探求生成式AI的技术边界.项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-LLM-Eval
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考