☰
Improving Crash Data Quality with Large Language Models: Evidence from Secondary Crash Narratives...
2026/10/6 7:48:00 网站建设 项目流程

文章主要内容总结

本文聚焦于利用先进自然语言处理(NLP)技术提升交通事故数据质量,以肯塔基州二次事故识别为案例,系统评估了三类模型的性能:零样本开源大型语言模型(LLMs)、微调的Transformer模型以及传统逻辑回归(基线模型)。

研究使用2015-2022年共16,656份人工审核的事故描述数据(其中3,803份确认为二次事故),以2015-2021年数据校准模型,2022年1,771份数据作为测试集。结果显示:

  • 微调的Transformer模型表现最优,其中RoBERTa的F1分数达0.90,准确率95%;
  • 零样本LLMs(如LLaMA3:70B)F1分数达0.86,但推理时间长(如LLaMA3:70B需139分钟);
  • 传统逻辑回归表现最差(F1=0.66)。

研究还发现中型LLMs(如DeepSeek-R1:32B)可在降低运行时间的同时接近大型模型性能,并提出了隐私保护部署、集成方法、增量处理等实际应用建议,为交通部门提升事故数据质量提供了可复制方案。

文章创新点

  1. 系统对比三类模型性能:首次针对二次事故识别,全面评估零样本LLMs、微调Transformer与传统模型的准确性、效率及数据需求,揭示不同模型的权衡关系。
  2. 突出微调Transformer的优势:证明微调后的RoBERTa等模型在平衡精确率和召回率上的优越性,且推理效率远高于零样本LLMs。
  3. 探索中型LLMs的潜力

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询