大模型剧情对话的效果评估
叙事状态、角色知识和可调用的任务工具里,最难的通常不是把主路径跑通,而是明确谁能改状态、失败后留下什么,以及怎样复现判断。下面只围绕一个可落地的做法展开。
把主观评价变成可讨论的样本
主观体验仍然重要,但要明确评价对象、上下文和分歧原因。再加上任务完成情况、状态一致性或错误类型等可检查维度。
放到这个主题里,模型负责措辞和有限范围内的选择,任务状态、奖励和剧情分支必须由权威状态机写入。 上下文按角色设定、当前任务、最近对话和禁用信息分层组装;工具调用只暴露查询和受约束的提案接口,不直接修改存档。
验证不要只看一次结果
保留匿名样本和评价规则,复看意见不一致的案例,避免只保留支持既有方案的反馈。
用同一段任务状态复跑对话,检查角色不会泄露未解锁信息,工具请求也不会越过任务前置条件。
留下可接手的记录
对话评审应保留模型版本、角色设定快照、任务状态样本和争议判定。下一次更新时,团队能回看角色失真的具体上下文,而非只比较主观印象。