A Simple “Try Again“ Can Elicit Multi-Turn LLM Reasoning
2026/9/14 20:00:30 网站建设 项目流程

文章主要内容总结

本文聚焦大型推理模型(LRMs)在多轮问题解决中的局限性,指出当前单轮强化学习(RL)训练虽能提升模型单轮推理能力,但会导致模型在多轮交互中重复答案、难以根据反馈修正推理,进而提出作为观测的单值反馈(Unary Feedback as Observation, UFO)框架,以解决这一问题。

研究发现,通过多轮RL训练引入简单的单值反馈(如“再试一次”),可在保持单轮性能的同时,显著提升模型的多轮推理能力。具体而言,UFO将静态单轮数据集转化为多轮交互场景,通过马尔可夫决策过程(MDP)建模问题解决过程,仅用“错误时需重试”的单值反馈作为环境观测。此外,为鼓励模型以更少轮次得出正确答案并在失败时尝试多样化推理,设计了包含轮次奖励衰减(鼓励高效性)和答案重复惩罚(鼓励多样性)的奖励机制。

实验结果显示,UFO框架使多轮推理准确率提升达14%,且该能力可迁移至跨领域任务。

创新点

  1. 揭示单轮RL训练的局限性:发现单轮RL训练会削弱模型的多轮交互推理能力,导致重复输出相同答案(70%的失败案例中,模型在5轮交互中答案完全一致)。
  2. 提出UFO框架:利用简单的单值反馈(如“再试一次”),将静态单轮数据集转化为多轮训练场景,无需额外标注或复杂环境,即可实现多轮RL训练。
  3. 设计针对性奖励机制:通过轮次奖励衰减(鼓励用更少轮次解决问题)和答案重复惩罚(减少重复推理),

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询