☰
ReconVLA:作为有效机器人感知器的重建视觉-语言-动作模型
2026/10/11 16:27:33 网站建设 项目流程

作者:Wenxuan Song1^11,Ziyang Zhou1^11,Han Zhao2,3^{2,3}2,3,Jiayi Chen1^11,Pengxiang Ding2,3^{2,3}2,3,Haodong Yan1^11,Yuxin Huang1^11,Feilong Tang4^44,Donglin Wang2^22,Haoang Li1^11

机构:1^11香港科技大学(广州),2^22西湖大学,3^33浙江大学,4^44蒙纳士大学
https://arxiv.org/pdf/2508.10333

摘要

近年来,视觉-语言-动作(Vision-Language-Action, VLA)模型的进展使得机器人智能体能够将多模态理解与动作执行相结合。然而,我们的实证分析表明,当前的VLA模型难以将视觉注意力分配到目标区域,其视觉注意力往往处于分散状态。为了引导视觉注意力准确定位到正确的目标上,我们提出了ReconVLA,这是一种采用隐式定位(implicit grounding)范式的重建VLA模型。以模型的视觉输出为条件,一个扩散Transformer(diffusion transformer)旨在重建图像的注视区域(gaze region),该区域对应于被操作的目标物体。这一过程促使VLA模型学习细粒度的表示并准确地分配视觉注意力,从而有效地利用特定任务的视觉信息并执行精确的操作。此外,我们从开源机器人数据集中策划了一个包含超过10万条轨迹和200万个数据样本的大规模预训练数据集,进一步提升了模型在视觉重建方面的泛化能力。在仿真和真实世界中的大量实验证明了我们隐式定位方法的优越性,展示了其精确操作和泛化的能力。项目主页:https://zionchow.github.io/ReconVLA/。

1. 引言

近年来视觉-语言模型(VLMs)的进展展示了它们有效桥接感知和语言模态的潜力。基于这些进展,视觉-语言-动作(VLA)模型通过整合多模态理解,将这种能力扩展到了动作执行领域。得益于数十亿的参数量以及在大规模机器人数据集上的预训练,这些模型在实现可泛化技能方面展现出了巨大的希望。

准确的视觉定位(visual grounding)是实现VLA精确抓取的基础,尤其是在杂乱的环境和长视野(long-horizon)任务中。为了分析预测动作期间的视觉定位行为,我们可视化了视觉输入上的注意力图。结果表明,传统的VLA模型通常表现出分散的视觉注意力(如图4第1行所示),无法精确聚焦于目标物体,这可能导致操作错误的物体。这一发现提出了一个关键问题:VLA模型如何改进视觉注意力分配并进一步提升视觉定位能力?

以往用于VLA的视觉定位方法通常以显式方式输入已定位的图像,或以思维链(Chain-of-Thought, CoT)的方式输出边界框。这些方法增强了对目标区域的感知并提高了空间意识,但它们并没有从根本上改进注意力分配。受重建视觉指令微调的启发,我们引入了一个辅助视觉重建模块,该模块实现为一个轻量级的扩散Transformer。该模块以VLA模型的视觉输出为条件,旨在从噪声中重建目标操作区域。这一过程促使VLA模型学习包含区域特定信息的细粒度表示,从而将视觉注意力集中在正确的区域。

如图1所示,这种机制类似于人眼的注视行为,即眼睛感知到一个清晰聚焦的小区域,而周围区域保持模糊。因此,目标操作区域被称为注视区域(gaze region)。

然而,与它们的VLM主干网络类似,传统的VLA模型在视觉-语言理解任务上进行微调,并以自回归的方式生成动作,缺乏视觉生成能力。为了解决这一限制,我们策划了一个包含超过10万条轨迹和200万个数据样本的预训练数据集。我们选择了几个开源机器人数据集,并设计了一种通过Grounding DINO进行自动数据处理的方法,以生成完整图像和目标操作区域图像的配对。在这个大规模数据集上的预训练显著增强了模型在视觉生成方面的泛化能力。

通过利用上述技术,我们开发了重建视觉-语言-动作模型(ReconVLA)。它以当前图像、语言指令和机器人本体感知作为输入。在训练期间,输入图像的注视区域通过冻结的视觉分词器处理为潜在token,这保留了详细的视觉信息并实现了高保真重建。为了更好地学习潜在信息,我们训练了一个扩散Transformer,学习在重建token的引导下恢复潜在token。扩散去噪有效地对视觉观察的条件分布进行了建模。

长视野任务中的实验表明,我们的隐式定位方法比其他视觉定位范式更有效。此外,视觉注意力的可视化证明,我们的ReconVLA表现出具有方向性的视觉注意力并实现了精确操作。消融研究证明了通过大规模预训练实现的泛化能力。与其他流行方法的全面比较表明,ReconVLA产生了卓越的性能。最后,真实世界的实验评估了对未见物体的泛化能力,证明了ReconVLA具有促进VLA在真实世界部署的潜力。

总结来说,我们的主要贡献如下:

  • 我们提出了ReconVLA,这是一种具有隐式定位范式的重建VLA模型。注视区域的重建促使模型进行精确的视觉注意力分配和细粒度表示学习,从而增强视觉定位能力并执行精确操作。
  • 我们构建了一个大规模的机器人预训练数据集,包含超过10万条轨迹和200万个数据样本。在该数据集上的预训练增强了模型视觉重建能力的泛化。
  • 在仿真和真实世界中的大量实验显示了我们隐式定位方法的优越性,以及对未见目标精确操作和泛化的能力。

2. 相关工作

以动作为中心的视觉-语言-动作模型。建立在预训练VLM的基础进展之上,VLA学习在动作的监督下生成可执行的动作。其中,RoboFlamingo使用显式策略头对序列历史信息进行建模;Open-VLA是第一个具有大规模机器人预训练的开源VLA模型;VLAS通过音频扩展了模态;UniVLA从网络规模的视频中学习以任务为中心的潜在动作。这些模型仅对动作输出进行监督,而我们的ReconVLA将视觉输出作为辅助任务进行监督,从而增强了视觉感知。

用于操作的生成方法。之前的研究探索了用于机器人控制的图像或视频生成模型。Unipi首先生成未来图像并从中提取动作;SuSIE使用图像编辑扩散模型生成子目标并使用与语言无关的策略执行它们;CLOVER使用误差测量生成视觉计划来指导闭环策略;GR-1首次将生成方法与VLA结合,利用大规模视频预训练来预测未来图像和机器人动作;3D-VLA进一步整合深度信息作为视觉-语言-动作推理和规划的指导;GEVRM以闭环方式为目标条件策略生成未来图像。这些方法预测未来帧以从动力学中学习,从而增强模型的规划能力。相比之下,我们的方法重建当前图像的目标区域以实现精确的感知和操作。

用于操作的视觉定位方法。显式定位方法通常将已定位的图像作为额外输入以充当辅助观察(图2a)。例如,RoboGround采用LISA作为高级分割器,根据指令提取目标物体和背景,并将其作为观察的一部分输入VLA模型。类似地,VIP使用YOLOv11分割目标物体,然后将其放大并提供给基于Transformer的策略。然而,这些模型依赖外部专家模型,并没有从根本上增强策略本身的视觉定位能力。ECoT和GraspVLA(图2b)采用思维链方法,按顺序输出边界框和动作,这同时训练了定位能力,并通过因果注意力为动作输出提供了更丰富的信息。与这些先前的方法相比,我们的ReconVLA直接从视觉输出中重建目标操作区域(图2c),从而在鼓励模型学习目标区域细粒度表示的同时隐式地执行定位。这一过程模仿了人眼自发聚焦于视野内显著区域的能力。


3. 方法

3.1 预备知识

为了建立我们方法的基础,我们首先形式化机器人操作上下文中VLA模型的典型公式和架构。给定一对图像和文本指令(I,S)(I, S)(I,S),VLA模型A\mathcal{A}A预测动作A=A(I,S)A = \mathcal{A}(I, S)A=A(I,S)。

架构:一个常规的VLA主要由大语言模型LLMLLMLLM、视觉编码器E\mathcal{E}E、分词器TTT和动作反分词器QQQ组成。元组(I,S)(I, S)(I,S)分别被E\mathcal{E}E和TTT处理为图像tokenhIh_IhI​和文本tokenhSh_ShS​。这些token随后被输入到LLMLLMLLM中以生成动作tokenaaa。最后,动作反分词器QQQ将aaa映射为用于机器人控制的可执行动作AAA。整个过程可以表示为:
A=Q(a)=Q(LLM(hI,hS))=Q(LLM(E(I),T(S)))(1)A = Q(a) = Q(LLM(h_I, h_S)) = Q(LLM(\mathcal{E}(I), T(S))) \quad (1)A=Q(a)=Q(LLM(hI​,hS​))=Q(LLM(E(I),T(S)))(1)

具体而言,动作token以自回归的方式生成:
p(a)=∏i=1NpLLM(ai∣a1∼i−1,hI,hS)(2)p(a) = \prod_{i=1}^N p_{LLM}(a_i | a_{1 \sim i-1}, h_I, h_S) \quad (2)p(a)=i=1∏N​pLLM​(ai​∣a1∼i−1​,hI​,hS​)(2)
其中iii表示第iii个动作token,NNN表示动作token的总数。

3.2 重建视觉-语言-动作模型

观察到分散的注意力,我们的目标是引导VLA的视觉注意力聚焦到正确的目标上。我们的理念是构建一个辅助视觉监督,通过设置重建视觉信号来实现。该监督信号作为条件,引导扩散去噪过程以重建目标操作区域。

正式地,我们在此框架下提出重建视觉-语言-动作模型(ReconVLA)。

重建目标:当人类操作物体时,会接收到场景的全局视图。然而,视觉感知主要集中在其中的一小部分,即打算操作的区域。这种行为被称为注视(gaze)。类似地,我们ReconVLA的重建目标是目标操作区域,我们称之为注视区域。注视区域不仅有助于模型在多个可操作区域中聚焦正确目标,还增强了对这些区域的详细感知。此外,该机制通过聚焦并切换到不同的子目标,隐式地促进了长视野任务中的子任务规划。

损失函数:ReconVLA的整体训练目标包括:(i) 由演示数据监督的自回归动作预测,以及 (ii) 由注视区域的视觉特征监督的重建项,即LReconVLA=LVLA+LVisual\mathcal{L}_{ReconVLA} = \mathcal{L}_{VLA} + \mathcal{L}_{Visual}LReconVLA​=LVLA​+LVisual​,其中LVLA\mathcal{L}_{VLA}LVLA​是交叉熵损失,LVisual\mathcal{L}_{Visual}LVisual​是重建tokenhRh_RhR​和重建目标I′I'I′之间的度量。

潜在视觉重建:为了从具有空间信息冗余的RGB输入中构建区域特定的视觉监督信号,我们设计了一个去噪过程来重建具有注视区域低级特征的token。这一过程鼓励模型充分捕捉内在特征,而不是克隆显式的RGB值。

图3说明了我们的ReconVLA利用视觉分词器FFF提取目标场景tokenz0=F(I′)z_0 = F(I')z0​=F(I′)。具体而言,我们采用连续变分自编码器(VAE)作为视觉分词器FFF,因为它具有视觉保真度并能捕捉细粒度的图像特征。去噪器DDD尝试预测噪声,并在重建tokenhR=LLM(hI)h_R = LLM(h_I)hR​=LLM(hI​)的条件下从噪声tokenztz_tzt​中恢复z0z_0z0​。重建目标函数遵循扩散过程形式化如下:
LV(hR,I′)=Et,ϵ[∣∣P(zt;hR,t)−ϵ∣∣](3)\mathcal{L}_{V}(h_R, I') = \mathbb{E}_{t, \epsilon}[||\mathcal{P}(z_t; h_R, t) - \epsilon||] \quad (3)LV​(hR​,I′)=Et,ϵ​[∣∣P(zt​;hR​,t)−ϵ∣∣](3)
其中ttt表示扩散时间步。去噪器DDD由带有自注意力模块的Transformer编码器块堆叠而成,以捕捉噪声token和重建token之间的相关性。

为了确保VLA模型处理与指令目标相对应的视觉token,必须保证图像token关注指令token。因此,我们在图像token之前 prepend 了一组指令token,使图像token能够通过因果注意力融合这些前缀文本的信息。实验结果表明,这种交错格式在不降低模型固有语言建模能力的情况下实现了我们的目标。

实现细节:在本文中,我们基于预训练的视觉-语言模型LLaVA-7b构建ReconVLA,该模型使用Qwen2-7b作为LLM主干,并使用siglip-so400m-patch14-384作为视觉编码器。

3.3 视觉预训练

VLA模型的重建能力固有受限,因为其VLM主干主要在视觉-语言理解任务上进行训练。为了增强其定位和重建特定区域的能力,我们在大规模机器人数据集上设计了针对重建任务的预训练过程。

数据集:为了建立基础的重建能力,我们基于大规模开源机器人数据集BridgeData V2,以及高质量仿真数据集LIBERO和CALVIN构建了预训练数据集。给定图像-文本对,我们微调了Grounding DINO(最先进的开放词汇目标检测器),以分割出机器人被指示交互的注视区域。裁剪后的图像和原始图像以配对方式组织。通过这种方式,我们获得了一个包含超过10万条轨迹和200万个样本的带标注视觉预训练数据集。

预训练:在预训练过程中,我们同时对重建损失和动作损失执行梯度反向传播,以保持优化目标的一致性。这一过程赋予了我们的VLM通用的视觉重建能力,并促进了模型在多样化环境和任务中的部署。预训练后,我们在特定任务上微调模型,以精确地将视觉-语言理解和视觉重建能力与相应动作空间上的操作能力对齐。

4. 实验

在本节中,我们构建实验以回答以下问题:

  • 我们的隐式定位方法是否优于其他视觉定位范式?(见4.2节)
  • 注视机制是否有助于视觉定位并进一步提升精确操作?(见4.3节)
  • 我们提出的预训练阶段是否改善了视觉生成的泛化能力,ReconVLA中提出的其他关键设计如何影响整体性能?(见4.4节)
  • 与其他竞争性方法相比,ReconVLA能否有效管理长视野任务?(见4.5节)
  • ReconVLA能否在真实世界任务中实现对未见目标的泛化操作?(见4.6节)

4.1 仿真环境

CALVIN基准测试建立在PyBullet仿真器之上,涉及一个Franka Panda机械臂操作场景。CALVIN包含34个任务和4个不同的环境(A、B、C和D)。CALVIN长视野挑战是一个包含五个子任务的序列任务。我们报告每个子任务的成功率以及所有五个任务的平均完成长度。该方法在500次rollouts中进行评估以确保公平比较。CALVIN的指标是每个子任务的成功率和所有连续5个子任务的平均长度。

4.2 范式比较

我们在相同的基线上实现了图2中的不同视觉定位范式,以进行公平比较。

  • 显式定位 (EG):我们选择微调的YOLOv11作为检测器,在每个时间步识别目标物体。然后我们从图像中裁剪出识别出的物体区域并调整其大小。随后,调整大小后的图像和原始图像被联合输入到VLA模型中,以指导物体操作。
  • 思维链定位 (CG):对于数据准备,我们使用检测器预处理图像以获取边界框的坐标。然后,我们重新格式化训练数据集,并将输出修改为CoT格式:Bbox [x1 x2 y1 y2] + 动作序列。输入保持为原始图像。通过这种方式,VLA模型学习定位目标物体并输出带有定位信息的动作。

结果:如表1所示,EG获得了比基线相对更高的成功率。这表明将显式定位作为输入有助于更好地理解空间关系。然而,完整图像和裁剪图像的简单拼接引入了视觉信息冗余,限制了模型性能。CG的性能甚至更差。这表明坐标形式的边界框不足以有效指导模型精确操作目标位置。此外,直接同时输出精确坐标和动作值对VLA模型提出了训练挑战。

我们的隐式定位方法获得了最高的成功率,这证明了我们方法优于其他范式。从训练机制的角度来看,优势源于我们的隐式定位学习框架,它使模型能够精确关注目标物体的视觉信息,从而实现精确操作。从架构的角度来看,我们的模型直接监督视觉输出,消除了对额外输入或输出的需求。这种设计产生了一个简单而有效的训练和推理流程。

4.3 深入分析

为了更好地探索注视机制的影响,我们对视觉注意力及其对细粒度操作任务的影响进行了定性实验。

注意力可视化:图4表明,LVisual\mathcal{L}_{Visual}LVisual​的实现使得注意力能够与注视区域(对应于目标物体)紧密对齐。对于指令“把西瓜放进黄碗里”,基线的注意力高度分散,第三视角图像的注意力主要集中在无关位置,导致任务失败。相比之下,ReconVLA成功地将注意力集中在正确的目标(即西瓜)上。这表明我们的方法带来了精确的视觉定位,从而促进了任务的成功。

精确操作:在所有任务中,“叠方块”任务是最具挑战性的,它要求机器人举起一个方块并将其精确地叠放在另一个方块上。虽然我们的基线在此任务上仅达到59.3%的成功率,但我们的注视机制实现了高达79.5%的成功率,提升了20.2%。这一显著改善突显了我们的注视机制通过精确视觉定位对动作准确性的增强作用。

4.4 消融研究

我们在表2中对使用重建部分、注视区域和大规模机器人数据集预训练的提议技术进行了消融研究。我们观察到,预训练导致成功率显著提高。这是因为,在未见过的测试环境中,定位目标物体并执行重建本质上具有挑战性,并对模型的生成能力提出了泛化挑战。在大规模数据集上的预训练大幅增强了模型在视觉重建过程中的泛化能力。此外,重建要操作的注视区域被证明比重建整个图像更有效。这引导模型的视觉注意力聚焦于目标物体,从而避免操作错误的目标。值得注意的是,被训练重建整个图像的模型仍然优于基线,这可归因于整体视觉注意力的增强。然而,在未见过的场景中,重建具有像素冗余的整个图像是极具挑战性的,这进一步限制了性能的提升。

4.5 与最先进方法的比较

比较方法:我们将我们的模型与预测未来图像的生成方法(UniPi, SuSIE, CLOVER, 3D-VLA, GR-1, Vidman, GEVRM)以及大型VLA模型(RoboFlamingo, VLAS, OpenVLA, UniVLA)进行了比较,如第2节所述。

结果:在基础的ABCD→DABCD \rightarrow DABCD→D任务中,我们的ReconVLA实现了具有竞争力的性能,成功完成了5个连续任务中平均4.23个,第一个任务的成功率为98.0%。这表明我们的注视机制提供了灵活的规划能力,以在长视野任务中实现更好的操作调度。ABC→DABC \rightarrow DABC→D任务挑战了对未见背景的泛化能力。我们的方法超越了所有生成方法,包括在最后一个子任务上比流行的GR-1高出20%以上的成功率。这表明,除了预测未来图像的生成模型外,增强对当前观察的感知对于机器人操作同样具有价值。在参数量相当的情况下,我们的方法在最后一个子任务上比OpenVLA高出20.6%,比UniVLA高出7.6%,这表明了我们隐式定位学习策略的有效性。

4.6 真实世界多任务实验

设置:我们使用带有1自由度平行夹爪的6自由度AgileX PiPer机械臂进行了真实世界实验。此外,我们使用RealSense D515深度相机作为基座眼(Eye-on-Base),并使用ORBBEC Dabai深度相机作为手部眼(Eye-on-Hand)以获取视觉输入。

任务:我们选择了四个代表性任务:把水果放进碗里、叠碗、翻转杯子、收拾桌子。为了增强模型的泛化能力,每个任务都包含目标物体和背景颜色的变化。我们平均每个任务收集150条轨迹。对于评估,每个模型在每个任务上进行20次试验,并使用成功率作为性能指标。对于未见任务,我们将目标物体替换为未见过的物体。

结果:在四个真实世界任务中,ReconVLA始终优于流行的OpenVLA和强大的PD-VLA,在每种情况下都取得了最高的成功率。特别是,ReconVLA在“把水果放进碗里”和“叠碗”任务中取得了接近或超过90%的成功率。OpenVLA在执行细粒度操作任务(如翻转杯子和收拾桌子)时表现出有限的效果,而我们的ReconVLA通过精确的视觉定位实现了显著的性能提升。

在未见任务中(目标物体不在训练数据中),OpenVLA和PD-VLA方法的成功率均接近0%。得益于大规模混合数据预训练,我们的ReconVLA仍能成功定位目标物体并完成预期动作,展示了我们方法在视觉泛化能力方面的优势。

5. 结论

在本文中,我们分析并揭示了传统VLA中分散的视觉注意力问题,这限制了精确操作。随后,我们提出了一种重建视觉-语言-动作模型(ReconVLA),这是一种在隐式定位范式下训练的新型框架。我们的ReconVLA成功实现了准确的视觉注意力分配,并进一步增强了操作技能。我们进一步为ReconVLA构建了一个大规模预训练数据集,以使其在多样化场景和未见物体上实现泛化。在仿真和真实世界中的大量实验表明了我们隐式定位方法的优越性。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询