文章主要内容总结背景与问题:现有大型语言模型(LLMs)评估依赖静态基准测试,存在数据污染和排行榜过拟合问题,导致基准分数无法可靠反映模型真实能力,引发“评估危机”。LLMEval-3框架:提出动态评估框架,核心包括三部分:数据集构建:建立含22万道研究生级别题目的私有题库,通过人工筛选和LLM驱动的扩充确保抗污染性和多样性,覆盖13个一级学科和50多个二级学科。公平测试:每次评估从题库中随机抽取1000道未见过的题目,通过JWT安全传输和双层防作弊架构(访问控制+流程控制)确保评估唯一性和防操纵性。公平排名:采用校准的“LLM作为评判者”机制(GPT-4o作为评判模型,与人类专家一致性达90%),结合相对评分系统(以Doubao-1.5-Thinking-Pro为SOTA参考)实现动态条件下的稳定比较。纵向研究与发现:对近50个主流模型进行20个月的纵向评估(积累15万+数据点),发现:所有模型在知识记忆任务上收敛于约90%的性能天花板,开源模型与闭源模型性能接近。模型在特定领域(如文学、医学)存在持续差距,“思维”模式优化增益有限。静态基准与动态评估排名差异显著,静态基准存在严重数据污染。相对排名系统在多轮重采样和不同样本量下稳定性极高。