☰
近300篇工作调研!WAM 模型的训练策略:数据、预训练与后训练的种种。
2026/9/30 2:46:53 网站建设 项目流程

教机器人拉开抽屉,一种常见的办法,是先采集一批操作示范。训练数据里除了画面,还要记录机械臂怎样移动、夹爪何时闭合,让模型学会根据眼前的场景和任务指令生成动作。

要把这种能力推广到更多物体、场景和机器人,往往还需要扩大示范数据的覆盖。问题也随之而来:机器人要操作,场景要布置,数据要整理,每一步都有成本。

另一方面,人类每天都在产生大量操作视频。拉开抽屉、折叠衣物、移动工具,这些画面记录了丰富的运动与交互,却没有现成的机器人控制标签。这些视频里的经验,能不能也用来训练机器人?

一个自然的思路是,先让模型预测接下来的画面。物体往哪里移动,接触后发生什么变化,都可以从视频自身获得监督。接下来,再利用机器人数据,将学到的状态变化与可执行动作联系起来。这样,模型就有机会从机器人示范之外,获得更广泛的运动经验。

这也引出了世界动作模型 WAM 的研究思路:让未来预测参与动作学习与生成。VLA 根据观测与指令生成动作,世界模型 WM 建模环境的变化,而 WAM 进一步研究这两种能力怎样配合,以及预测是否真的能改善控制。

来自MBZUAI、Caltech、Amazon FAR、University of Virginia、Georgia Tech、New York University和UC Berkeley的研究团队,在 《World-Action Models for Robot Learning and Control: A Survey》 中系统梳理了这条路线。从 WM、VLA 与 WAM 的概念区别,到架构设计、数据与训练,再到实际应用和评估,这篇综述讨论的是同一个问题:视频中学到的知识,怎样才能成为机器人执行任务的本领。

综述信息

  • 论文标题: World-Action Models for Robot Learning and Control: A Survey

  • 论文链接:https://arxiv.org/abs/2609.16074

  • Homepage:https://rcl-robotics.github.io/Awesome-World-Action-Models/

  • GitHub:https://github.com/RCL-Robotics/Awesome-World-Action-Models

原文链接:近300篇工作调研!WAM 模型的训练策略:数据、预训练与后训练的种种。

先讲清楚 World Model、Vision-Language-Action Model、World-Action Model

WM:先给定动作,再预测后果

WM(World Model)在强化学习和机器人领域更多指代动作条件世界模型 AC-WM(Action-Conditioned World Model)的形式,根据当前状态和给定动作,预测接下来可能出现的状态。预测与动作选择通常各有分工:世界模型描述后果,规划器或策略负责作出选择。

图 1|动作作为输入条件,世界模型预测执行后的状态。

VLA:从所见与指令,直接生成动作

VLA(Vision-Language-Action Model)直接根据观测与指令生成动作。场景、任务指令以及可用的机器人状态,为机械臂移动、夹爪开合等控制输出提供条件。通常使用大语言模型 LLM 或视觉语言模型 VLM 作为骨干,可采用动作专家生成连续动作片段。

图 2|一种采用视觉语言模块与动作专家的 VLA 架构。

WAM:把未来状态与动作放在一起建模

WAM(World-Action Model)将预测性的世界表征与可执行动作生成,联系在共同的学习或推理过程中。模型需要学习潜在的运动规律和交互规律,并学习什么动作能够对应这种变化。

图 3|WAM 将未来预测与动作生成联系起来:上方为联合预测,下方通过逆动力学从预期变化推断动作。

WAM 好在哪里?

VLA 如何泛化?

先看 π0.5 和 EgoScale 怎样利用机器人示范之外的数据。π0.5 从预训练 VLM 出发,将机器人动作示范、人工标注的高层子任务,以及图像描述、问答和定位等视觉语言数据共同用于训练。它先预测接下来要完成的子任务,再生成具体动作。这里的“类思维链”对应的是子任务标签等语义监督,并非完整的推理过程标注。预训练时,骨干学习文本和离散动作 token;后训练再加入连续动作专家,通过流匹配学习控制。

EgoScale 则把扩展重点放在人类操作视频上。它主要通过相机运动与手部姿态估计,将第一视角视频转成相对手腕运动和重定向后的手部关节动作,用这些估计标签进行监督预训练,再通过人机对齐数据与机器人示范完成迁移。这两个例子分别突出语义与任务知识的迁移,以及人类动作经验的扩展。前者让已有视觉语言能力更好地服务于任务分解和执行,后者尝试让动作学习获得更大的数据规模。实际模型可以同时受益于这两种方式。

  • π0.5:https://www.pi.website/download/pi05.pdf

  • EgoScale:https://arxiv.org/html/2602.16710v1

VLA 的 Scale 瓶颈

对上述方法而言,扩大数据来源之后,还需要构建相应的动作与任务监督。机器人轨迹需要采集,高层子任务需要标注,人类视频则需要可靠的动作提取与本体对齐。自动处理可以降低人工成本,但遮挡、相机运动和手部估计误差仍会影响监督质量。

VLA 的另一项局限来自预训练目标。常见的图文对齐、视觉问答等任务主要提供语义监督,对连续运动、接触变化和动作后果缺少直接的预测约束。这些控制相关的知识往往需要通过后续动作训练补足,使 VLA 的泛化仍受高质量动作数据规模的制约。

为什么需要 WAM?

视频预测提供了一种更直接的学习任务:根据前面的画面预测后面的画面或特征,真实发生的后续内容就是监督信号。这样,模型可以先学习物体的运动和交互,不必为每段视频准备关节轨迹、末端位姿或手部动作标签。

无论是第一视角的人类演示,还是第三视角的互联网视频,都可以为这种学习提供材料。第一视角视频常包含手物交互,第三视角视频也记录了丰富的物体运动与场景变化,但两者都不直接等同于目标机器人的控制数据。WAM 的价值在于,让世界表征的学习可以先利用这些视频,再用具身数据完成动作对齐。

WAM 模型的架构设计哲学

从模型结构的角度看

WAM 通常包含语言接口、视觉编码器、预测骨干和动作解码器。根据世界预测与动作生成是否共享骨干,现有架构主要分为端到端系统与双系统。

图 4|从观测和任务指令,到世界预测与动作输出的主要组件。

端到端系统在统一骨干中处理视觉、语言和动作,联合优化世界预测与控制。其设计思路是让两类任务共享表示,使动作学习能够利用预测所需的动态知识。共享模型容量与优化过程,也意味着需要协调视觉预测与动作监督的权重,兼顾两类任务的学习需求。

双系统分别设置世界模块与动作模块,保留各自的网络参数,通过交叉注意力或共享注意力交换信息。视频与动作可以采用不同的表示和网络结构,再通过中间特征建立联系。这为世界骨干的复用和动作模块的适配提供了灵活性,同时也增加了接口设计的要求,包括特征选择、时序对齐及注意力交互方式。

两类架构对多模态差异采取了不同的处理方式:端到端系统侧重统一表示与联合优化,双系统则保留模块分工,通过接口完成预测与控制的衔接。

图 5|WAM 架构的两条分类轴线:模型结构与预测—动作建模关系。

从训练目标的角度看

世界预测与动作生成主要通过联合预测和逆动力学两类目标建立联系。

联合预测将动作与未来观测作为共同的建模目标。机器人轨迹既提供动作监督,也提供执行后的视觉结果,使模型能够学习动作与环境变化之间的对应关系。它强调预测与控制的一致性:生成的动作应当与预测的状态变化相符。

逆动力学将控制问题分解为预期状态变化与动作实现两部分,以当前状态和预测状态为条件推断动作。未来状态由此成为预测与控制之间的接口,将环境变化的表征与具体机器人的动作空间分开。这种分解要求预测的变化能够由目标机器人实现,并保留足以推断动作的状态信息。

模型结构描述参数与计算如何组织,训练目标描述未来状态与动作如何关联。两者可以交叉组合:

训练目标与部署流程也可以分别设计。未来预测可以用于训练动作表征,也可以参与执行时的动作生成。部分架构通过解码路径的设计,在训练中保留视觉预测目标,部署时直接输出动作,以降低在线计算开销。

WAM 模型的训练策略:数据、预训练与后训练

数据来源

模型结构确定后,还要考虑用什么数据训练。综述将数据来源分为三类,它们提供的监督各有侧重。

互联网视频覆盖大量物体、场景和运动,适合学习通用视觉时序表示。它的规模大,但动作、任务和相机变化往往混在一起,不能把所有视觉变化都当成机器人的行为。

第一视角演示更集中地呈现操作意图和手物交互。用于视频自监督时,可以不提取显式手部动作;用于动作监督预训练时,则需要姿态估计、传感设备或其他动作提取方法。同一批视频能够支持不同的学习目标。

具身轨迹把观测、本体状态、动作和执行结果配对,为动作条件预测和控制学习提供直接监督。Open X-Embodiment、DROID、BridgeData 等数据集承担了这部分作用,也是通用视频经验适配具体机器人的重要依据。

图 6|大规模视频提供广泛经验,具身轨迹提供动作与结果之间的对应。

预训练阶段

学习时空变化。一段操作视频记录了物体的运动与交互,却未必包含控制信号。预训练可以先利用画面本身提供的监督,通过预测后续视频或潜在特征,学习物体如何移动、接触后如何变化。

建立动作表征。从这些变化中学习动作,是接下来需要解决的问题。有动作标签时,模型可以直接学习离散或连续的动作表征;没有标签时,则可从连续画面中提取潜在动作,利用更多视频积累行为经验。这些潜在表示还需要与具体机器人的控制空间对齐。

对齐预测与控制。前向动力学学习动作会带来什么变化,逆动力学学习实现预期变化需要什么动作。它们可以与视频生成、动作生成目标配合训练,使模型预测的状态变化与生成的控制信号保持一致。

图 7|WAM 的预训练:学习时空变化、构建动作表征,并建立视频与控制之间的对应关系。

后训练阶段

适配目标机器人。预训练获得的运动与交互经验,还需要适配具体机器人的传感器、动作空间和任务。策略微调利用目标机器人的示范或交互数据,通过更新整体或局部参数,建立预测状态与可执行动作之间的对应关系。

扩展训练场景。有限示范通常只覆盖部分环境与操作情形。世界模型可以在保留动作对应的前提下,改变已有轨迹的背景、外观或光照;也可以合成新的交互轨迹,再补充相应的动作标签,为策略提供更丰富的训练经验。

通过交互改进策略。策略还可以在世界模型中尝试示范之外的动作,通过强化学习,根据任务回报调整行为。这些模拟交互降低了真实试错的需求,但训练收益仍需通过真实执行检验,并利用执行反馈修正预测与控制中的偏差。

图 8|WAM 的后训练:适配动作、扩展数据,并利用交互经验继续改进策略。

WAM 模型的未来方向与挑战

视频里的人手把瓶盖一拧,动作干净利落。换成机械夹爪,自由度、接触方式都变了,模型还得建立新的动作对应。如果每换一种机器人,就要重新补上一大批示范,视频预训练的优势便打了折扣。跨本体迁移需要解决的,正是用更少的数据完成适配,同时保住已经学到的运动与交互知识。

动作对齐了,也不代表预测就足够可靠。物体换个视角还能不能对上,被遮挡后是否仍保留正确的位置,都会影响下一步操作。三维结构、多视角约束和物体持续性,需要进入模型对世界的表示,而不能只靠生成画面的连贯感来支撑。

更麻烦的是,**预测误差还可能被策略利用。**世界模型负责描述动作后果,策略追求更高回报;一旦模拟结果过于乐观,策略就可能学出一套“模拟里很漂亮、现实里行不通”的行为。让两者分别按各自目标学习,再通过规划或模拟交互协作,为处理这种矛盾提供了一条路线。模型里的高分,终究得拿到真实机器人上兑现。

任务变长以后,还会暴露出记忆问题。机器人不必记住每一帧画面,但得记住抽屉是否已经打开、物体被放到了哪里、刚才的尝试为什么失败。哪些经历值得留下,又该怎样进入下一步预测,比单纯延长观测窗口更值得研究。

说到失败,这部分数据也不该白白浪费。成功示范教会模型怎样完成任务,抓空、碰偏、操作中断则暴露了它尚未掌握的部分。把实际结果与先前预测对照起来,才能分清需要修正的是世界模型,还是动作策略。神经模拟器可以增加尝试机会,真实反馈负责纠偏,让这些失误成为下一轮学习的材料。

还有一道关,往往要等到上机才显得格外尖锐:时间。更长的预测、更多候选方案,都要付出计算代价。可机器人正在接触物体,环境不会等它算完。预测时域、重规划频率和动作生成速度,必须放进同一个控制周期里权衡。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询