☰
Assessing the Reliability and Validity of Large Language Models for Automated Assessment of Stude...
2026/10/1 2:33:31 网站建设 项目流程

文章主要内容和创新点

主要内容

本文研究了5个先进大型语言模型(LLMs)——Claude 3.5、DeepSeek v2、Gemini 2.5、GPT-4和Mistral 24B在高等教育真实场景中自动评估学生论文的可靠性和有效性。研究以67篇意大利语的大学心理学课程学生论文为样本,采用包含“相关性(Pertinence)、连贯性(Coherence)、原创性(Originality)、可行性(Feasibility)”四个维度的评分标准,每个模型对每篇论文进行三次重复评分以评估模型内稳定性。

结果显示:

  • 人机评分一致性极低且不显著(通过加权二次Kappa系数衡量);
  • 模型内三次重复评分的可靠性较弱(Kendall’s W中位数<0.30);
  • 存在系统性评分偏差,例如模型普遍高估“连贯性”分数,且对依赖语境的维度(如相关性、可行性)处理不一致;
  • 模型间一致性分析显示,在“连贯性”和“原创性”上有中等一致性,但在“相关性”和“可行性”上几乎无一致性。

研究认为,当前LLMs难以复制人类在需要学科洞察力和语境敏感性的任务中的判断,评估开放式学术作品时,人类监督仍至关重要。

创新点
  1. 真实教育场景验证:聚焦高等教育真实课堂的学生论文(心理学领域、意大利语),而非标准化数据集或人工设计任务,更贴近实际教学评估需求。
  2. 多维度与多模型对比:采用四维度评分标准(涵盖内容、结构、

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询