☰
Can LLMs Generate User Stories and Assess Their Quality?
2026/9/25 4:34:30 网站建设 项目流程

文章主要内容总结

本文研究了大型语言模型(LLMs)在敏捷开发框架中自动生成用户故事(User Stories, US)以及评估其语义质量的能力。具体内容如下:

  1. 研究背景:需求获取是需求工程中极具挑战性的环节,而高质量需求对软件开发至关重要。现有自动化工具多关注需求的句法质量,语义质量(如语言清晰度、内部一致性)的评估仍依赖人工,耗时且低效。LLMs在自然语言处理任务中表现优异,有望自动化需求工程相关活动。

  2. 研究方法:

    • 使用10个最先进的LLMs,模拟基于访谈的需求获取过程(复制Ferrari等人的实验),生成13958条用户故事,并与人类(领域专家和学生)生成的用户故事对比。
    • 从覆盖率(与基准用户故事的语义重叠)、多样性(生成内容的差异度)、可检测性(是否易被识别为AI生成)三个维度评估LLMs生成用户故事的质量。
    • 基于Quality User Story(QUS)框架,让LLMs在不同指导条件(无手册、部分手册、完整手册)下评估用户故事的语义质量,并与人工标注结果对比。
  3. 主要结果:

    • LLMs生成的用户故事在覆盖率和风格质量上与人类相似,但多样性和创造力较低,满足验收标准的频率更低(与模型规模无关)。
    • 当提供清晰的评估标准(完整手册)时,LLMs(尤其是Claude 3 Opus)能可靠评估用户故事的语义质量,可减少大规模评估中的人工工作量。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询