☰
Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression
2026/10/5 6:45:20 网站建设 项目流程

文章主要内容和创新点

主要内容

本文聚焦多模态大型语言模型(MLLMs)在基于图像的回归任务(如图像质量评估、美学评估、AI生成图像质量评估等)中的应用,指出当前方法的局限性:现有方法通过预设输出词汇(如“优秀”“良好”)和通用任务提示(如“如何评价这张图像?”)微调MLLMs,假设其能模拟人类评分行为,但实际性能与仅用图像训练的模型相当,未能利用文本输入的语义理解能力。

针对这一问题,本文提出基于Transformer分类的回归(RvTC)方法,通过灵活的“分箱(bin)”策略替代词汇约束的分类,并证明数据特定提示(含图像语义信息的文本)能显著提升模型性能。实验表明,在AVA数据集上,加入图像相关的“挑战标题”(如“三分法则”“户外微距拍摄”)后,模型相关性从0.83提升至0.90,创最新纪录。同时,通过控制实验区分了语义理解与统计偏差的影响,证实性能提升主要来自跨模态理解而非数据集固有偏差。

创新点
  1. 提出RvTC方法:用基于分箱的分类替代词汇约束的分类,通过增加分箱数量(而非复杂的分布建模)减少离散化误差,仅用图像输入就在4个基准数据集上达到或刷新当前最优性能。
  2. 强调数据特定提示的价值:证明通用任务提示无法发挥跨模态能力,而含图像语义信息的数据特定提示(如AVA数据集的“挑战标题”)能显著提升回归性能,揭示MLLMs跨模态理解的潜力。
  3. 区分语义理解与统计偏差:通过AVA和AGIQA-3k数据集的控制实验,证实性能提升主要源于跨模态语

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询