- 文档
- 大模型
- 人工智能
【免费下载链接】Awesome-LLM
Awesome-LLM: a curated list of Large Language Model
本文以 Awesome-LLM 仓库中 paper_list/evaluation.md 为绝对主体,系统梳理 2022—2023 年围绕 ChatGPT 与 GPT 系列模型展开的评测类论文脉络,覆盖通用任务求解、翻译、摘要、鲁棒性、一致性、信息抽取、忠实性、涌现能力与记忆等评测维度,并结合 README.md 中「LLM Evaluation」与「LLM Leaderboard」两个章节沉淀的评测框架与榜单资源,帮助读者建立从「读论文」到「选工具、跑评测」的完整知识链路。
一、专题背景:为什么「LLM 评测」值得单列一个论文方向
在大语言模型快速迭代的 2022—2023 年,模型能力边界、评测方法学与评测资源成为学术界与工业界共同关注的焦点。Awesome-LLM 将评测(Evaluation)作为独立的论文子方向,与对齐(paper_list/alignment.md)、检测(paper_list/detection.md)、思维链(paper_list/chain_of_thougt.md)等方向并列,说明评测已经形成一个有自己方法论、工具链与论文谱系的成熟领域。
从 README.md 的里程碑论文(Milestone Papers)表格可以看到评测方法学的演进脉络:BIG-bench(2022-06)开创了大规模跨任务能力量化的先河;斯坦福 HELM(Holistic Evaluation of Language Models,2022-11)则首次提出「整体评测」理念,强调在多个指标(准确率、鲁棒性、校准、公平性等)上对模型进行透明、可复现的横评。这两篇里程碑工作与 paper_list/evaluation.md 中 2022—2023 年的评测论文共同构成了该子方向的文献骨架。
此外,仓库 README.md 的LLM Evaluation小节(README 第 400—416 行)明确列出了lm-evaluation-harness、lighteval、simple-evals、HELM、MixEval、instruct-eval、Giskard、LangSmith、Ragas、OLMO-eval等评测框架,LLM Leaderboard小节(README 第 151—186 行)则汇总了 Chatbot Arena、LiveBench、Open LLM Leaderboard、AlpacaEval 等公开榜单。论文清单、评测框架、公开榜单三者互为表里,共同构成完整的 LLM 评测生态。
二、2022 年:GPT-3 时代的新闻摘要评测
清单中的第一篇论文标志着「以生成式大模型为评测对象」这一范式的开端:
- News Summarization and Evaluation in the Era of GPT-3(2022-09):该研究在 GPT-3 时代系统评估大模型在新闻摘要任务上的表现,并同步探讨了「摘要质量如何被评估」这一方法学问题。它的意义在于:当评测对象从判别式模型切换到生成式大模型后,传统基于参考摘要的 ROUGE 类指标是否仍然可靠,成为评测方法学必须回答的问题。
这一时期评测对象仍以 GPT-3 为主,评测手段多为标准的任务数据集,尚未形成针对对话式模型的专门评测体系。
三、2023 年:ChatGPT 评测风暴——按能力维度的系统评估
2023 年 1 月起,清单以每月数篇的密度涌现出围绕 ChatGPT 的评测论文,覆盖了几乎每一个 NLP 能力维度。下面按主题维度组织解读(完整论文链接见 paper_list/evaluation.md 原文)。
3.1 通用任务求解能力与整体能力边界
这一组论文回答的核心问题是:「ChatGPT 能否像通用问题求解器一样胜任各类 NLP 任务?」
- Is ChatGPT a General-Purpose Natural Language Processing Task Solver?(2023-02):对 ChatGPT 的通用任务求解能力进行系统检验。清单特别标注了该工作的局限:>由于 API 不可用,没有进行大规模数据集评测,也没有进行 few-shot in-context learning 评测。这既是该论文的方法学边界,也是那个时期评测工作的普遍困境。
- ChatGPT: Jack of all trades, master of none(2023-02):该论文在多种任务上对比 ChatGPT 与微调后的专用模型,结论倾向认为 ChatGPT 在各类任务上「门门通、样样松」——即在零样本/少样本场景表现良好,但难以匹敌针对单一任务微调的最优模型。这一结论深刻影响了后续对「通用模型 vs 专用模型」评测范式的讨论。
- A Comprehensive Capability Analysis of GPT-3 and GPT-3.5 Series Models(2023-03):从系列模型演进视角(而非单一模型快照)对比 GPT-3 与 GPT-3.5 各版本的能力变化,属于「模型迭代能力追踪」型评测。
- Sparks of Artificial General Intelligence: Early experiments with GPT-4(2023-03):对 GPT-4 的早期能力实验,被视为从「任务评测」走向「智能形态探索」的标志性工作,评测对象不再局限于文本任务,而是延伸至推理、创造力、多模态感知等更广泛的智能维度。
- Could a Large Language Model be Conscious?(2023-03)与Susceptibility to Influence of Large Language Models(2023-03):这两篇将评测对象从「任务能力」扩展到「认知与安全属性」——前者讨论模型是否可能具备意识(评测模型自我报告与心理属性),后者评测模型受外部信息诱导影响的倾向,开启了 LLM「心理—社会属性」评测的讨论。
3.2 翻译与多语言能力
- Is ChatGPT A Good Translator? A Preliminary Study(2023-01):早期对 ChatGPT 翻译能力的初步研究。清单特别标注了其评测规模限制:>由于没有可用的 API,他们只随机选取了 50 个句子进行评测。这一细节揭示出 2023 年初评测工作普遍面临的资源约束——评测样本量受 API 可用性严重制约,样本代表性因此存疑。
3.3 文本摘要能力
摘要能力是生成式 LLM 最直接的评测场景之一,清单中收录了三篇:
- Benchmarking Large Language Models for News Summarization(2023-01):将多个 LLM 放在同一新闻摘要基准上进行横向对比,是「LLM 摘要评测基准化」的代表作。
- Exploring the Limits of ChatGPT for Query or Aspect-based Text Summarization(2023-02):评测更细分的摘要场景——查询式摘要(query-based)与方面式摘要(aspect-based),探索 ChatGPT 在细粒度、受控摘要任务上的能力上限。
- News Summarization and Evaluation in the Era of GPT-3(2022-09):即 2022 年那篇,共同构成摘要评测的完整闭环。
3.4 与人类专家的对比评测
生成式模型评测绕不开「以人为参照系」这一维度,清单收录了两篇代表性工作:
- How Close is ChatGPT to Human Experts? Comparison Corpus, Evaluation, and Detection(2023-01):构建了 ChatGPT 与人类专家输出的对比语料(comparison corpus),并同时给出评测(evaluation)与检测(detection)两套视角,配套公开了项目(chatgpt-comparison-detection)。该论文在 paper_list/detection.md 中被重复引用,说明「对比—评测—检测」是一体两面的研究链条。
- ChatGPT Outperforms Crowd-Workers for Text-Annotation Tasks(2023-03):将 ChatGPT 与人类众包标注员(crowd-workers)进行对比,结论倾向认为 ChatGPT 在文本标注任务上表现优于众包工人。该论文直接挑战了「人类标注是金标准」的传统假设,为 LLM 辅助数据标注提供了评测依据(该条目在清单中出现两次)。
3.5 鲁棒性、一致性与可信度
这一组论文把评测重心从「平均能力」转向「能力稳定性与可信度」:
- On the Robustness of ChatGPT: An Adversarial and Out-of-distribution Perspective(2023-02):从对抗样本(adversarial)与分布外(out-of-distribution)双视角评测 ChatGPT 的鲁棒性。
- How Robust is GPT-3.5 to Predecessors? A Comprehensive Study on Language Understanding Tasks.(2023-03):关注 GPT-3.5 相对于其前代模型的鲁棒性变化,属于跨版本鲁棒性对比。
- Consistency Analysis of ChatGPT(2023-03):评测模型对同一输入在不同条件下的输出一致性——一致性(consistency)是可信 LLM 的关键属性,也是当时较少被系统研究的角度。
- Can ChatGPT Understand Too? A Comparative Study on ChatGPT and Fine-tuned BERT(2023-02):将生成式 ChatGPT 与判别式微调 BERT 在「理解类」任务上对比,探讨生成式模型是否具备与专用编码器相当的理解能力。
3.6 信息抽取、忠实性与知识生成
评测不仅关注「能不能答对」,更关注「答案是否忠实于事实」:
- Evaluating ChatGPT's Information Extraction Capabilities: An Assessment of Performance, Explainability, Calibration, and Faithfulness(2023-04):对 ChatGPT 信息抽取能力进行四维评测——性能(performance)、可解释性(explainability)、校准(calibration)与忠实性(faithfulness),是目前评测维度设计最完整的工作之一。
- Why Does ChatGPT Fall Short in Answering Questions Faithfully?(2023-04):专门分析 ChatGPT 在问答中「不忠实」的原因,直指幻觉(hallucination)问题在评测中的核心地位。
- Beyond Factuality: A Comprehensive Evaluation of Large Language Models as Knowledge Generators(2023-10):将评测对象从「问答正确性」升级为「知识生成」——评估 LLM 作为知识库生成器的表现,并配套开源了 CONNER 评测代码。这篇 2023 年最晚的论文代表了评测视角从任务能力向知识能力的延伸。
3.7 涌现能力与记忆
- Are Emergent Abilities of Large Language Models a Mirage?(2023-04):对「涌现能力」这一概念提出方法论质疑,论证所谓的涌现现象可能是评测指标选择的产物而非模型固有的质变。该论文是对里程碑论文「Emergent Abilities of Large Language Models」(见 README.md 里程碑表格)的方法学回应,评测方法学本身成为被评测的对象。
- Emergent and Predictable Memorization in Large Language Models(2023-04):从记忆(memorization)角度评测 LLM 对训练数据的记忆程度,并论证部分记忆行为是可预测的,为隐私与版权视角的评测提供依据。
3.8 语言专项能力:语法纠错、情感分析与 NLG 评测
- Is ChatGPT a Highly Fluent Grammatical Error Correction System? A Comprehensive Evaluation(2023-04):对 ChatGPT 作为语法纠错(GEC)系统的流利度与正确性进行全面评测。
- Is ChatGPT a Good Sentiment Analyzer? A Preliminary Study(2023-04):评测 ChatGPT 在情感分析任务上的表现。
- Is ChatGPT a Good NLG Evaluator? A Preliminary Study(2023-03):一个颇具反身性的问题——让 LLM 去当其他生成模型的「评测器」(NLG evaluator),探索 LLM 作为自动评估器的可行性,为「以 LLM 评 LLM」的评测范式埋下伏笔。
- ChatGPT: potential, prospects, and limitations(2023-02,FITEE 期刊):属于综述性评估,从潜力、前景与局限三个维度总结 ChatGPT 的能力画像。
四、评测方法学的时代局限:API 稀缺与样本代表性
清单中两处醒目的 >标注,揭示了 2023 年初 LLM 评测研究共同面对的现实约束:
- 「Is ChatGPT A Good Translator?」仅随机选取 50 个句子评测,因为当时没有可用的 API;
- 「Is ChatGPT a General-Purpose NLP Task Solver?」无法进行大规模数据集评测,也无法进行 few-shot in-context learning 评测,同样归因于缺乏 API。
这两条标注是评测论文质量评估的重要背景信息:早期评测普遍面临样本量小、评测维度受限的问题,其结论的外推范围因此有限。这也解释了为什么 README 会单列LLM Evaluation框架与LLM Leaderboard榜单章节——随着 API 生态成熟与开源框架完善,评测的规模与标准化水平才得以大幅提升。读者在引用早期评测结论时,应当将样本规模与方法学约束一并纳入考量。
五、评测生态配套:框架与榜单(来自 README 的补充)
paper_list/evaluation.md 的Useful Resources小节目前为空,仓库 README.md 的LLM Evaluation与LLM Leaderboard两个章节恰好补全了评测生态的另一半——工具与榜单。
5.1 评测框架速查(README 第 400—416 行)
| 框架 | 定位 |
|---|---|
| lm-evaluation-harness | EleutherAI 出品的 few-shot 评测框架,LLM 评测的事实标准之一 |
| lighteval | Hugging Face 内部使用的轻量评测套件 |
| simple-evals | OpenAI 的评测工具集 |
| OLMO-eval | Ai2 用于开源语言模型评测的仓库 |
| MixEval | 基于既有基准混合构建的本地快速评测套件,兼容开源与闭源模型 |
| HELM | 斯坦福整体评测框架,强调评测透明度与多维指标 |
| instruct-eval | 针对 Alpaca、Flan-T5 等指令微调模型的留出任务量化评测 |
| Giskard | 面向 LLM 应用(尤其 RAG)的测试与评测库 |
| LangSmith | LangChain 生态的评测、人机协作、日志与监控统一平台 |
| Ragas | 面向 RAG 管线的评测框架 |
5.2 公开榜单速查(README 第 151—186 行)
- Chatbot Arena Leaderboard:匿名、随机对战(crowdsourced)的众包式评测平台;
- LiveBench:主打抗污染(contamination-free)的高难度基准;
- Open LLM Leaderboard:Hugging Face 跟踪、排名与评估开源 LLM 的公开榜单;
- AlpacaEval:面向指令跟随模型的自动评测器。
README 的<details>折叠区还收录了 CompassRank、MathEval、OlympicArena、LawBench、InfiBench、PubMedQA、SuperBench、VisualWebArena、We-Math 等垂直领域与专项能力榜单(完整清单见 README.md 第 156—186 行)。这些资源与论文清单互为印证:论文提供方法学,框架提供执行手段,榜单提供横向参照。
六、如何使用这份清单:给研究者的阅读路径
建议按以下路径使用 paper_list/evaluation.md:
- 建立时间线:先按 2022 → 2023 的顺序通读,观察评测对象从 GPT-3 到 GPT-3.5/GPT-4 的迁移,以及评测维度从单一任务能力到鲁棒性、一致性、忠实性、知识生成的扩展;
- 锁定能力维度:根据自己的研究问题(翻译、摘要、信息抽取、鲁棒性等)在对应主题小节中精读;
- 注意方法学标注:重点关注清单中 >
标注的样本规模与 API 限制信息,评估结论的可信边界;
- 配套工具落地:将论文结论与 README 中的
lm-evaluation-harness、HELM、Ragas等框架以及 Chatbot Arena、LiveBench 等榜单结合,设计自己的评测实验; - 交叉引用关联清单:涉及「AI 生成文本检测」的评测可对照 paper_list/detection.md,涉及评测中的人类偏好数据集可参见 README.md 中「Awesome LLM Human Preference Datasets」条目。
七、小结
paper_list/evaluation.md 以 2022—2023 年 25 篇论文勾勒出 LLM 评测方向的完整轮廓:从 GPT-3 时代的新闻摘要评测,到 ChatGPT 时代的通用能力、翻译、摘要、鲁棒性、一致性、信息抽取、忠实性、涌现能力、记忆、语法纠错、情感分析与 NLG 评测,评测对象与评测维度都在快速扩展。与之配套的 README.md 则提供了评测框架、公开榜单与数据集资源,使该子方向具备了「论文—工具—榜单」三位一体的完整生态。对于希望系统进入 LLM 评测领域的研究者与工程师,这份清单是一份可直接展开深入阅读的起点。
- 文档
- 大模型
- 人工智能
【免费下载链接】Awesome-LLM
Awesome-LLM: a curated list of Large Language Model
相关推荐
Rust程序设计语言中文版:如何构建并发安全的Rust应用程序
Rust程序设计语言中文版:如何构建并发安全的Rust应用程序 Rust程序设计语言中文版提供了强大的并发安全特性,帮助开发者构建高效且安全的多线程应用程序。通
如何安装Valthrun-CS2:5分钟快速上手开源CS2外部雷达工具
如何安装Valthrun CS2:5分钟快速上手开源CS2外部雷达工具 想要在《反恐精英2》中获得战术优势,但又担心被VAC检测?Valthrun CS2可能是
从零开始:如何用Surya打造你的专属文档智能识别系统
从零开始:如何用Surya打造你的专属文档智能识别系统 想象一下,你正在处理一份复杂的税务表格,手写的数学笔记需要数字化,或者企业技术文档需要快速归档。传统的O
计算机视觉深度学习
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考