【VR】Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retri
2026/7/23 16:56:15 网站建设 项目流程

note

  • Partially Relevant Video Retrieval任务描述:文本只描述长视频中的一小段内容,但系统要把整条未剪辑视频召回出来。
  • DreamPRVR 用轻量扩散模型先“想象”出整条视频的全局语义,再用它约束局部片段匹配,避免只因某几个相似画面就召回错误视频。DreamPRVR 用 Triplet ranking loss + InfoNCE 对比损失,联合训练文本编码器、视觉侧投影与后续检索模块,从而把文本和视频特征对齐到可比较的空间。对应loss:
    • Triplet ranking loss:要求正确文本–视频相似度,比错误文本–视频至少高一个 margin。
    • InfoNCE loss:在 batch 内拉近正文本–视频,推远负文本和负视频。
  • 思路:“先看全局,再看局部”:
    • 先生成全局 Register:从整条视频特征出发;用轻量扩散模型反复去噪、提纯;得到少量代表整条视频整体语义的 global registers。
    • 再增强局部帧/片段特征:将 global registers 与 frame/clip tokens 做注意力融合;让每个局部片段理解“这整条视频到底在讲什么”;从而压制偶然相似但上下文不匹配的局部高分。
    • 文本负责监督扩散方向:同一视频的多条文本描述被视为互补语义;构造更稳定的文本潜空间,指导 Register 学到可靠全局语义。
  • 总结:文本 embedding和【视频的帧级 + clip级 embedding】计算相似度

文章目录

  • note
    • 一、研究动机
    • 二、论文核心
      • 1. 文本语义结构学习
      • 2. 截断扩散驱动的寄存器生成
      • 3. 寄存器增强的视频表示
      • 4. 联合优化目标
    • 三、实验结果与分析
      • 1. 检索性能对比
      • 2. 效率分析
      • 3. 消融实验
      • 4. 可视化分析
    • 四、总结

一、研究动机

《Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval》(DreamPRVR)是针对**部分相关视频检索(PRVR)**任务提出的创新方法

PRVR任务的目标是:根据给定的文本查询(仅描述视频中部分片段),从未修剪的长视频库中检索出包含相关片段的视频。现有PRVR方法存在两个关键缺陷:

  1. 全局上下文感知不完整:传统方法(如基于多示例学习MIL的范式)仅关注“最佳匹配片段”,忽略视频整体语义,导致查询模糊时易被局部相似但全局无关的视频误导(产生局部尖峰激活,检索失败);
  2. 全局语义建模不足:现有方法要么将全局上下文作为“训练正则化项”(推理时不优化视频嵌入),要么用简单的池化/单步映射提取全局特征,无法从冗余、含噪声的未修剪视频中解耦出可靠的全局语义。

此外,文本查询本身存在不确定性(同一视频的多个查询共享全局主题但表述不同),现有方法盲目分离所有查询(仅用多样性损失),忽略了同视频查询的互补性,进一步加剧了语义空间的混乱。

二、论文核心

DreamPRVR提出“先想象(粗粒度全局寄存器生成)、后聚焦(细粒度跨模态对齐)”的粗细粒度表示学习范式,核心是通过扩散引导的全局寄存器(Register)捕获视频整体语义,再用寄存器增强局部视频特征的细粒度学习。

1. 文本语义结构学习

(Textual Semantic Structure Learning)
为解决文本查询的不确定性并构建结构化潜在空间,结合两种损失:

  • 查询相似性保持损失(QSP Loss):将同一视频的查询视为“互补正视图”,拉近同视频查询的距离,同时推远不同视频的查询(保留同视频查询的语义一致性,增强视频间区分度);
  • 查询多样性损失(L_div):分离不同视频的查询(丰富语义多样性)。
    两者联合优化文本潜在空间,使其既紧凑(同视频查询)又可分(不同视频查询)。此外,通过文本扰动采样器(TPS)在文本均值特征上注入可控噪声,建模查询的不确定性,为寄存器生成提供语义对齐的文本监督

2. 截断扩散驱动的寄存器生成

(Register Generation via Truncated Diffusion)
寄存器是可学习的全局语义令牌,用于编码视频的整体上下文,生成过程分两步:

  • 概率变分采样器(PVS):从视频特征中提取视频中心分布(而非随机噪声)作为扩散的初始状态——通过轻量级编码器将视频特征映射为高斯分布的均值μᵥ和方差σᵥ,采样得到初始寄存器r_T(避免随机噪声的语义无关性);
  • 扩散寄存器估计器(DRE):以文本扰动特征为监督,通过轻量级MLP扩散模型对初始寄存器r_T进行迭代去噪细化(T=10步),逐步生成纯净的全局寄存器r₀(捕获视频整体语义,抑制局部噪声)。

3. 寄存器增强的视频表示

(Register-Augmented Video Representation)
将生成的全局寄存器r₀与视频的帧/片段特征拼接,通过寄存器增强的高斯注意力块(RAB)融合:

  • 设计非对称注意力掩码:视频令牌可关注“其他视频令牌+寄存器”(利用全局上下文增强局部特征),寄存器仅关注视频令牌(避免寄存器被局部噪声干扰);
  • 丢弃融合后的寄存器,仅用增强后的视频特征计算跨模态相似度(聚焦细粒度对齐)。

4. 联合优化目标

总损失为:
L total = L sim + L tssl + L pvs + λ d r e L dre L_{\text{total}}=L_{\text{sim}}+L_{\text{tssl}}+L_{\text{pvs}}+\lambda_{dre} L_{\text{dre}}Ltotal=Lsim+Ltssl+Lpvs+λdreLdre
其中:

  • L sim L_{\text{sim}}Lsim:跨模态相似度损失(Triplet+InfoNCE,用于细粒度对齐);
  • L tssl L_{\text{tssl}}Ltssl:文本语义结构损失(QSP+L_div,优化文本潜在空间);
  • L pvs L_{\text{pvs}}Lpvs:PVS的KL损失(约束视频中心分布接近标准高斯,满足扩散前提);
  • L dre L_{\text{dre}}Ldre:扩散去噪损失(确保寄存器生成与文本监督对齐)。

三、实验结果与分析

论文在ActivityNet Captions、Charades-STA、TVR三个PRVR基准数据集上验证性能,核心结果如下:

1. 检索性能对比

DreamPRVR在所有数据集的R@K(K=1/5/10/100)和SumR(总和召回率)上均优于现有SOTA方法:

  • ActivityNet Captions:SumR=156.1(优于GMMFormerV2的154.9、HLFormer的154.9);
  • Charades-STA:SumR=80.0(优于HLFormer的78.7、GMMFormerV2的78.2);
  • TVR:SumR=193.1(优于MGAKD的190.5、ARL的185.9)。

证明扩散引导的全局寄存器能有效提升PRVR的检索准确性,尤其在处理长视频和模糊查询时优势显著。

2. 效率分析

DreamPRVR的参数(36.14M)和训练/推理时间与现有方法(如HLFormer、GMMFormerV2)相当:

  • 训练时间/epoch:33609ms(略高于HLFormer的31463ms,源于扩散迭代的开销);
  • 推理时间(特征提取):4001ms;检索时间:3686ms(与GMMFormerV2相近)。

由于视频特征可离线预计算,扩散生成的寄存器在检索阶段无额外成本,实际部署效率高。

3. 消融实验

逐一移除核心组件,验证各模块的必要性:

  • 无寄存器(w/o registers):SumR下降(如ActivityNet从156.1→153.4),证明全局上下文的重要性;
  • 用自适应池化代替扩散生成(w/ AP):SumR进一步下降(151.9),说明简单池化无法从噪声视频中提取可靠全局语义;
  • 无DRE(w/o DRE,单步映射):SumR=150.6,证明迭代扩散细化对寄存器纯化的关键作用;
  • 无PVS(w/o PVS,随机初始化):SumR=154.9,说明视频中心的初始化比随机噪声更利于生成语义相关的寄存器;
  • 移除各损失(w/o L_pvs/L_dre/L_tssl):SumR均下降,证明文本结构学习、PVS约束、扩散监督的协同作用。

4. 可视化分析

  • 文本潜在空间(t-SNE):仅用L_div时查询分散,加入QSP Loss后同视频查询聚集、不同视频查询分离,空间更结构化(图4);
  • 寄存器生成过程(t-SNE):初始寄存器无语义,迭代细化后形成清晰的视频聚类(图6),证明扩散去噪能有效捕获全局语义;
  • 时间注意力得分:DreamPRVR抑制了无关视频的局部尖峰,相关视频的峰值与真实片段对齐(图5),说明寄存器能引导模型关注全局相关的局部内容。

四、总结

DreamPRVR的核心创新是将扩散生成模型全局寄存器结合,通过“粗粒度想象全局语义、细粒度聚焦局部对齐”的范式解决PRVR的全局感知缺陷。实验证明其在性能和效率上的优势,为PRVR提供了一种“生成-判别联合”的新思路。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询