文章主要内容总结
本文聚焦多模态大型语言模型(MLLMs)中的“物体幻觉”问题(即模型生成图像中不存在的物体等事实错误输出),深入探究了模型先验知识在中间层对视觉信息的抑制机制。研究发现,中间层的视觉事实知识与原始输入和纯文本输入的概率分布差异(通过JS散度量化)具有相似的演化趋势。基于此,作者提出了一种无需训练的解码方法——EVA(Decoding by Extracting Visual FActs),该方法包含两个核心部分:
- 动态目标层选择:通过计算中间层原始输入与纯文本输入的JS散度,选择散度最大的中间层作为目标层(该层含最丰富的视觉事实知识);
- 视觉事实知识解码:对比目标层中原始输入与纯文本输入的输出分布,提取视觉事实知识,并将其按比例整合到最终层的输出中,以纠正幻觉。
实验在POPE、MME、CHAIR等多个基准测试上验证了EVA的有效性,结果显示其在InstructBLIP、MiniGPT-4、LLaVA-1.5、Qwen-VL等模型上均能显著降低幻觉率,且兼容贪婪搜索、核采样、束搜索等多种解码策略。
创新点
- 机制发现:首次揭示中间层中视觉事实知识的演化趋势与原始/先验概率分布的JS散度演化趋势高度一致,为中间层视觉知识的提取提供了理论依据;
- 方法创新:提出EVA方法,无需额外训练,通过动态选择中间层并提取视觉事实知识来纠正最终输出,具有模型无关性,可无缝集成到多种MLLMs中; <