Zero-WAM——基于人类视频的上下文世界-动作建模:面对未见任务,给一段人类示范视频作为prompt,不微调直接输出对应的机器人未来视频和可执行动作
2026/9/11 20:14:48 网站建设 项目流程

前言

在机器人学习中,零样本跨任务泛化——即策略必须完成训练阶段从未见过的操作任务——依然是核心挑战

  1. 对于大语言模型来说,只需在上下文中描述一个新任务,模型便能在不更新参数的情况下完成该任务
    这种上下文学习”(in-context learning, ICL)形式,将泛化问题转化为任务描述问题
    详见本博客中的解读《
    ChatGPT技术原理解析:从RL之PPO算法、RLHF到GPT4、instructGPT
  2. 为实现跨任务泛化,作者将这一范式引入机器人操作领域,并指出,对操作任务而言最自然的任务描述是人类视频:与语言不同,人类视频能够提供关于目标任务演化过程的丰富视觉线索

由此,蚂蚁灵波与港科大联合提出 Zero-WAM,这是一种因果视频-动作模型,可以通过在上下文中跟随人类视频引导来执行未见过的任务

  1. 为解决任务丰富的人机配对数据稀缺问题,作者提出了一条自动化数据构建流水线,将按任务采样的机器人轨迹转换为语义匹配的人类视频,从而构建出 HumanGen 数据集,其中包含 8.6K 个任务、共74.2K 对人机 ICL 样本
  2. 针对模型训练,作者进一步提出“上下文未来片段预测”(in-context futurechunk prediction, IFP)目标,用以抑制策略从已见任务中学习到的捷径,并迫使策略从视频提示中抽取任务信息

本文

  • 进一步见证,大模型对具身智能的直接提升,预示着具身智能进一步朝GPT3时刻迈进
    不管之前有多少家公司吹嘘自己的工作,或某工作被某媒体吹嘘达到了GPT3或ChatGPT时刻,那都是扯淡,当然了,Zero-WAM也只是朝GPT3时刻迈进,其也无法宣称达到了GPT3时刻
  • 且也进一步证明,如果你学好了大模型,再干具身智能,便已经具备了至少一半的必备基础/能力

顺带说一句,其实蚂蚁灵波之前推出的LingBot系列模型一直都有关注,印象比较深刻的两点是:1 数据规模大、2 泛化到各种本体上,此外并无太多其他更深刻的印象

而本次他们和港科大联合推出的Zero-WAM,使得蚂蚁灵波成为具身大脑领域中影响力更大的一方了,且和通义千问一样,愿意持续开源,Repect

太长不看版:为了方便大家 最快速度的理解Zero-WAM,我用大白话 给大家解释一下

  1. 因为Zero-WAM 想针对一个未见的新任务,通过先人类做一遍示范,然后机器人便可以照着这个人类示范直接做出来
  2. 而要练就这个能力,则需要模型学会根据人类操作视频 匹配对应的机器人操作视频 故需要人类和机器做各种同一任务的对比数据集
  3. 那同一个任务下,是根据人类操作视频生成对应的机器人操作视频呢,还是反过来,根据机器人操作视频生成人类操作视频?
    ————
    事实是,根据机器人操作视频,依托视频生成模型:生成人类操作视频之后,有了大量的人-机匹配操作数据集之后
    便可以在训练的时候 让模型Zero-WAM 根据
    人类操作视频去生成对应的机器人操作视频
    而机器人操作视频 本身大量存在,且是真实的、真的值,故可以做ground truth

第一部分 Zero-WAM: In-Context World-Action Modelingfrom Human Videos for Open-Ended Task Generalization

1.1 引言与相关工作

1.1.1 引言

如原论文所述,零样本跨任务泛化对于通用机器人操作至关重要:机器人应当仅依赖部署时可用的信息,就能推断在一个从未练习过的任务中应如何行动

  1. 受上下文学习(in-context learning, ICL)[1,2] 的启发——在该范式中,模型无需更新参数,仅根据输入上下文即可解决新的问题,作者将机器人任务泛化视为:通过部署阶段提供的上下文来指定一个未见过的任务。这一视角为开放式的任务泛化提供了一条路径:策略可以从上下文中推断出期望的任务,并将其转化为可执行的机器人行为
  2. 近期的视觉-语言-动作(VLA)模型 [3,4,5,6,7,8,9,10] 和视频-动作模型 [11,12,13,14,15,16] 已经显著拓展了机器人策略的能力,但二者在很大程度上都依赖语言作为任务接口

    然而,语言往往对操作任务描述不足:空间约束、中间状态以及时间结构都难以用语言完整表达,即使是十分详细的文字说明,也无法直接提供场景应如何随时间演化的视觉证据
  3. 人类示范视频则为预期任务提供了一种自然的“上下文内”规格说明 [17,18]。通过直接呈现期望的视觉状态变化及其时间演化过程,这类视频为场景应如何变化提供了具体的视觉证据

    尽管人类视频本身并不能直接转化为可执行的机器人动作,但它为策略提供了一个视觉参照,使其能够从中推断出期望的任务演化过程,并通过机器人自身的形体与动力学特性将其实现

然而,要大规模利用人类示范视频面临两个关键挑战

  1. 首先,大规模且任务多样的人类—机器人配对数据仍然稀缺,并且人工收集成本高昂 [19,20,21]
    从人类视频指令中学习,需要与之在语义上对应、同时保留可执行动作的机器人轨迹,但此类配对数据在大规模条件下几乎不可获得
  2. 其次,在已见任务上训练得到的策略可能会学到“捷径”,从而忽略上下文中的人类视频

    具体来说,往往仅凭机器人自身的历史信息和文本指令,就可以预测下一段机器人的视频—动作片段。因此,模型在熟悉的训练任务上可能表现良好,却并未真正学会利用人类视频;而在测试阶段,当需要通过视频来明确一个未见过的任务时,模型反而会对视频利用不足

为了解决这些挑战,来自1Robbyant(即蚂蚁灵波), 2HKUST (GZ), 3HKUST的研究者提出了 Zero-WAM,这是一种因果视频动作模型,能够在上下文中遵循人类视频指令,实现机器人任务的零样本泛化

  • 其paper地址为:Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
  • 其项目地址为:robbyant-research.github.io/Zero-WAM
    其GitHub地址为:github.com/robbyant-research/Zero-WAM

具体而言,Zero-WAM 在单一策略中支持两种任务指定形式:自然语言指令和人类演示视频。在任一形式的指令给定后,模型会自回归地预测未来的机器人视频以及可执行动作。人类视频使 Zero-WAM 能够将这些预测建立在示范所体现的视觉状态变化之上,从而提供关于预期任务演化的额外信息,而这些信息仅从语言和机器人历史本身是无法获得的

此外,作者做了两个创新

第一个是数据层面的创新,即造出配对数据

为了解决基于人类视频指令的训练扩展问题,更是提出了一种“上下文内(in-context)人类视频生成”流程,该流程利用按任务采样的机器人轨迹来构造在语义上匹配的人类操作视频

  1. 每个生成的人类视频都会与其对应的机器人轨迹配对,机器人轨迹保留可执行的机器人动作,从而形成一个人类-机器人上下文内学习(ICL)对
    由此得到的HumanGen数据集包含7.42 万个人类-机器人 ICL 对,覆盖 8,600 个任务
  2. 且作者进一步通过将公开的机器人轨迹重新划分为6,000 多个操作任务,并在任务层面进行轨迹采样,对机器人预训练数据进行任务均衡的筛选与整理
    该过程在每个训练 epoch 中大约产生 40 万条机器人轨迹,作者将其称为Task-diverse VA

    此番任务均衡采样,目的是
    一方面为上下文内人类视频生成流程提供任务丰富的源机器人轨迹
    另一方面也防止视频-动作预训练被少数任务中大量重复的遥操作轨迹所主导

HumanGen与 Task-diverse VA 相结合,为因果视频-动作预训练提供了可扩展的人类视频任务规范以及多样化的机器人视频-动作动力学

下图图 2 总结了最终的数据构成以及上下文内人类视频生成流程(还没太看明白,没事,下文还会进一步详述)

第二个是训练层面的创新——解决"模型走捷径"的问题,即说白了,标准下一片段预测只靠局部机器人历史就能蒙对(尤其训练里见过的任务),模型完全可以无视上下文里的人类视频照样训练得很好——但测试时遇到新任务就不会用视频了

  1. 故为确保 Zero-WAM 使用上下文中的真人视频信息,而不是依赖机器人历史和文本中的捷径,作者还提出了一种“上下文未来片段预测”(In-context Future Chunk Prediction,IFP)目标
  2. 相比之下,IFP 从当前的机器人视频表征中,监督预测多个跨步采样的未来机器人视频片段,从而促使模型编码由真人视频所传达的更长期任务演化过程

从而让训练目标强制模型从视频里取信息,而不是抄机器人历史的近路

总之,总结如下

1.1.2 相关工作

1.1.3 数据创新:包含上下文内的人体视频生成流程、上下文内 HumanGen 数据集

零样本机器人任务泛化不仅需要一种能够迁移到未见任务上的指令接口,还需要在训练数据层面覆盖多样的任务动力学,而不是单纯增加机器人轨迹的数量

作为工程基础,作者

  1. 首先通过在任务层面对公开的机器人预训练数据进行重新采样,整理出任务多样化的 VA 数据(Task-diverse VA data)
  2. 在相同的任务级采样基础上,提出了“上下文内人类视频生成流程(in-context human video generation pipeline)”,用于将按任务采样得到的机器人视频转换成人类视频指令
  3. 生成的人类-机器人 ICL(in-contextlearning)配对构成了 HumanGen,其中包括预训练 ICL(外部)、预训练 ICL(内部)、仿真 ICL,以及真实世界 ICL
    图 2 总结了这一数据构成以及用于生成 HumanGen 数据的整套流程

接下来,逐一具体的阐述以上三点

首先,重新采样

任务多样化的 VA 数据(VAdata)来自公开的机器人视频-动作(Video-Action, VA)预训练数据集,包括 AgiBot [23]、InternData-A1 [24]、Open-X-Embodiment [4]、RoboCOIN [25] 和RoboMIND [26]。这些源数据集与 LingBot-VA [11] 所使用的公开 VA 预训练数据集相同

尽管这些数据集包含大量机器人轨迹并覆盖广泛的任务类型,但其中许多轨迹来自对同一任务的反复远程操作。如果直接使用这种原始分布进行预训练,模型将过度受冗余轨迹影响,从而无法充分受益于源数据集中本就存在的任务多样性

为了解决这一问题

  1. 作者对每个数据集重新按任务进行划分,其中每个任务由“操作动作与对象”的组合唯一确定
    当原始数据集中提供任务标签时,作者直接使用其元数据获取任务标签;若元数据不足,则从机器人轨迹中解析得到任务标签
  2. 随后,从每个任务中采样一个有上限的轨迹数量,并根据各源数据集任务内部多样性(intra-task diversity)的不同对这一采样上限进行调整

在五个源数据集中,每个训练 epoch作者共采样到 6,000 多个任务以及约 40 万条对应的机器人轨迹。这个经过均衡的视频-动作语料库能够有效地将一个通用领域的视频生成模型适配为自回归式的机器人视频-动作模型

其次,对于上下文内的人体视频生成流程

人体视频示范通过可视状态变化直接传达任务语义,相比机器人示范更容易获取,并且不依赖测试时所使用的具体机器人形态。因此,扩展富含任务信息的人机“上下文学习”配对数据,是实现跨任务泛化的一条有效途径

  1. 然人工手动收集这类成对的人类与机器人动作数据十分困难,且当任务种类需要高度多样化时,成本会变得尤为高昂
    因此,作者从机器人预训练语料库出发,并且再次在任务层面上对示例轨迹进行采样,按照『上文重新采样』的方法执行,这样就获得了一大批带有可执行动作标注的机器人视频
  2. 随后,引入了一条基于上下文的人类视频生成流程,将这些机器人轨迹转换为具有相同任务语义的人类操作视频

    为了增加人机 ICL(in-context learning,上下文学习)配对中视觉对齐的多样性,生成的人类视频在背景、视角、环境风格、物体实例以及物体摆放位置等方面均有所变化,同时保持相同的任务语义

图 2 底部部分展示了用于生成人体视频指令的、基于上下文的人体视频生成流程

  1. 对于每一段采样得到的机器人视频,作者首先使用一个 VLM(Gemini 3.1 Pro [27] 或 Qwen3.6-Plus [28])进行任务分析
    VLM 会抽取任务级信息,包括任务名称、初始物体状态、物体状态变化以及最终物体状态
  2. 同时,它还会生成一个图像编辑prompt,将机器人视频的第一帧转换为对应的人类操作场景中的初始观测图像
    通过该图像编辑提示注入前文描述的视觉对齐变化,同时保持任务语义不变

    在给定机器人第一帧和图像编辑prompt的情况下,图像编辑模型(Nano Banana 2 [29] 或 Qwen-Image-2.0 [30])会为对应任务生成初始的人类观测图像
  3. 随后,将这一编辑后的人类观测图像前面提取的物体状态信息一并输入 VLM,由其生成视频生成提示,描述人手应如何操纵这些物体以完成该任务该提示会被发送给视频生成模型(Wan 2.7 [31] 或 Kling AI 3.0 [32])以合成人体操作视频
  4. 最后,VLM 会对每个生成视频在任务语义保留程度和物理合理性方面进行评估,合格的人体视频将与其对应的原始机器人轨迹配对,作为 ICL 样本

最后,对于上下文内 HumanGen 数据集

HumanGen 是一个由人类-机器人 ICL(In-Context Learning,上下文内学习)对组成的数据集,这些对是通过上下文内人类视频生成流程构建的。每一对都包含一个生成的人类视频指令以及其对应的机器人轨迹和可执行动作

HumanGen 按数据来源进行组织,分为:预训练 ICL(外部)、预训练 ICL(自建)、仿真ICL 和真实世界 ICL。与用于构建 Task-diverse VA 数据时采用的多任务多样性采样原则一致,源机器人视频是按“任务”而非按“原始轨迹出现频率”进行采样,从而避免 ICL 数据被少数任务的大量重复执行所主导

  1. 预训练 ICL(外部)。该子集基于与“任务多样 VA 数据”相同的五个公开机器人视频-动作数据集构建而成:AgiBot [23]、InternData-A1 [24]、Open-X-Embodiment [4]、RoboCOIN [25] 和RoboMIND [26]

    这些数据集覆盖多样的机器人形态、场景和物体,总计包含超过 45 种机器人形态
    作者按任务从每个数据集中采样机器人轨迹,并利用“上下文内人类视频生成流程”将其转换为与之语义匹配的人类视频

    具体而言,作者
    从 AgiBot 采样了 3,354 个任务和 6,660 条轨迹
    从 InternData-A1 采样了 261 个任务和 12,515 条轨迹
    从 Open-X-Embodiment 采样了438 个任务和 9,290 条轨迹
    从 RoboCOIN 采样了 512 个任务和 6,513 条轨迹
    从 RoboMIND采样了 497 个任务和 6,210 条轨迹


    总体来看,Pre-train ICL(External)共包含 5,062 个任务和 41,188 对人类-机器人 ICL 样本
    对于该子集,作者有意在视觉对齐上进行多样化:在场景环境、桌面背景、物体实例与摆放方式等方面强制引入变化,并在第一人称与第三人称视角之间进行平衡
    ———
    由于在这些视觉变化下任务语义仍得以保持,模型被迫去学习对场景、物体和视角变化不敏感的人类-机器人任务对应关系,从而提升其在视觉多样 ICL 提示下的鲁棒性
  2. 预训练 ICL(内部数据)。为了进一步提升任务覆盖度,作者从自有的机器人数据集中按任务采样机器人的轨迹
    该子集涵盖多种机器人形态,例如双臂 Franka 和 Galaxea R1 Pro,包含 3,522 个任务和 30,247 个人机 ICL 对

    在使用情境内人类视频生成流程为该子集生成对应的人类视频时,作者降低第三人称视角的比例,并减少场景、物体以及物体摆放变化的频率
    这样在保持任务多样性的同时,能够生成在视觉上更加对齐的 ICL 样本
  3. 仿真环境下的 ICL
    为了在仿真中支持跨任务评估,作者为 50 个 RoboTwin 任务 [22] 生成了 ICL 数据。该子集包含 2,500 个 ICL 样本,每个任务 50 个样本
    其中,43 个任务用于后训练(共 2,150 个训练样本),其余 7个任务被保留为未见任务,用于零样本跨任务评估
  4. 真实世界的 ICL
    真实世界 ICL 包含在人形双臂 Franka 评估平台上收集的人机配对数据
    它涵盖了 252 个人机 ICL 配对,分布在作者评估中使用的三个真实世界任务族上:来自 30组物体到容器放置训练任务组合的 120 个配对、来自 16 组三物体顺序操作训练任务组合的96 个配对,以及用于双桌腿插入的 36 个配对

    该子集用于后训练,以便模型能够拟合评估机器人运动学,从而进行跨任务评估

总结一下,表 1 将 HumanGen 与现有的任务级人机配对数据集进行了比较,其统计数据均来自各自的官方论文

  • 不同于以往依赖人工采集人类数据的数据集,HumanGen 利用基于 in-context 的人类视频生成流程,从机器人轨迹中自动生成在语义上匹配的人类视频,从而实现大规模构建人机 ICL(in-context learning)配对数据
  • HumanGen 还融合了多种数据来源(公开数据、内部数据、仿真数据和真实世界数据),涵盖显著更多的机器人形态,包含来自第一视角和第三人称视角的人类数据,并提供在视觉对齐程度上多样化的配对数据
    更为重要的是,HumanGen 在任务覆盖范围上显著更广,而这正是实现零样本跨任务泛化的关键因素

1.2 Zero-WAM:上下文零样本世界动作建模

在零样本跨任务操作中,机器人必须在不进行微调的情况下执行一个全新的任务

作者通过一个在大规模人机ICL(in-context learning,上下文学习)对齐数据以及任务均衡的机器人视频-动作数据上预训练的世界动作模型(World Action Model,WAM)来追求这一能力:在部署阶段,Zero-WAM 使用语言指令或人类视频示范作为任务规范,从而驱动对未见任务的执行

1.2.0 预备知识

第一,对于视频生成的流匹配

对于视频生成,flow matching [35] 在干净视频与高斯噪声之间的一条连续路径上学习一个速度场

给定一个干净视频、噪声,以及流动时间,加噪后的视频和目标速度为

在给定条件的情况下,flow-matching 损失为

在推理时,通过从噪声开始并将学习到的速度场积分回来生成视频

第二,对于因果视频-动作建模

作者遵循 LingBot-VA 系列工作 [11,12] 提出的因果视频-动作框架,在该框架中,每一个控制步都是一个因果预测问题:在给定任务条件和历史观测的情况下,模型预测机器人的下一段视频片段,以及与其在时间上对齐的、可执行的动作片段

  • 每个机器人轨迹被分块为,其中是一个视频块,是时间对齐的动作块。作者在整个方法中使用分块级别的符号表示
  • 在实现中,每个视频或动作块在进入Transformer 之前都会被编码为模态特定的表征,并且注意力掩码作用在这些分词后的表征上。且使用表示任务条件,它可以是语言指令或相同任务的人类视频指令

    在分块索引处,因果模型预测下一个视频块以及对齐的动作块


    这一联合预测被分解为先进行视频预测,然后进行动作解码



    其中,预测下一个视频片段,而作为一个逆动力学模型,从预测的下一个机器人视频片段中解码可执行的动作

    训练期间,模型被提供真实轨迹前缀,并在下一个视频-动作片段上进行监督
    对于来自任务多样化V A 数据的轨迹,条件是语言指令,
    对于来自HumanGen 数据的轨迹,条件是其中是相同任务的人类视频指令,而是语言指令

第三,对于混合Transformer 设计

作者在混合Transformer(MoT)设计下,将实现为视频Transformer和动作Transformer。每种模态都有其各自的参数,包括独立的QKV 投影、FFN 和输出头,而视频和动作表征保持在同一序列中,并仅通过共享的注意力层进行交互。在该序列中,动作块表征被放置在未来视频表征之后,从而使动作解码能够关注预测的未来机器人视频,这与上述分解方式的要求一致

第四,对于模型实例化

遵循 LingBot-VA,作者通过Wan-2.2-TI2V-5B[36](一种双向文本/图像到视频生成模型)转换为上述因果视频动作策略,来实例化 Zero-WAM

基于这一框架,本节其余部分将介绍 Zero-WAM 特有的两个组件:作为上下文任务规约的人类视频,以及基于上下文的未来片段预测

1.2.1 以人类视频作为任务规范

对于一个未曾见过的任务,仅用语言完整描述期望的行为往往很困难,而且指令还必须进一步被“落地”为策略从未观测过的任务动态

  1. 因此,作者采用人类视频作为一种上下文中的任务规范形式,直接展示期望的动态:在部署时,一段演示该未见任务的人类视频即作为指令

    为了教会策略遵循这一接口,作者在 HumanGen 数据集上进行训练,该数据集通过在任务层面采样源机器人轨迹构建而成。每个语义匹配的样本对都包含一个生成的人类视频,作为视觉任务规范,以及其对应的机器人轨迹,用于提供监督的未来视频和动作片段

    由于人类视频与匹配的机器人轨迹在具身形态、视角、背景和物体摆放上可能存在差异,模型必须学习任务层面的对应关系,而不是从人类视频中逐帧复制动作

在训练过程中,作者在人为视频片段、机器人视频片段和动作片段的分词表示上应用teacher-forcing 注意力掩码。人类视频被添加在机器人轨迹之前,并作为机器人视频预测的前缀token

  • 在片段索引处,video Transformer从上下文预测下一个机器人视频片段

  • 对于下一个机器人动作片段的预测,action Transformer根据机器人域历史和预测的下一个机器人视频片段来预测,遵循「上节1.2.0」中的逆动力学分解

    它不会直接关注人类视频所传达的任务语义已经被吸收进预测的下一个机器人视频片段中,因此动作解码简化为标准的逆动力学

    动作预测条件因此与标准的机器人视频-动作训练保持不变:

RoPE [37] 用于ICL 人类视频的偏移。ICL 人类视频和多视角机器人视频由同一个VAE 编码器编码,因此共享相同的视觉潜在空间。在token 序列中,作者通过高度轴RoPE 坐标来区分ICL 人类视频与机器人视频:机器人视频潜变量保持其原始坐标,而人类视频潜变量在高度轴上通过一个偏移量进行平移

表示视觉潜变量在时间、垂直和水平方向的坐标,并令为多视角机器人视频潜在布局。作者将 RoPE 坐标指定为

该偏移将人类视频的潜在表示放置在机器人视频潜在表示的坐标范围之外,从而在人类视频(用于 ICL)与机器人视频在同一序列中交互时,避免它们之间的表征混淆

1.2.2 基于上下文的未来片段预测

对于in-context 样本,模型应该从人类视频h 中推断任务的演化,并将其迁移到机器人域。然而,在对已见任务进行teacher-forcing 训练时,紧接着的下一个机器人视频片段往往可以通过外推最近的机器人历史(x≤i)来预测。这会产生一种捷径,使得模型在不学习使用in-context 人类视频的情况下就能降低训练损失

  1. 当模型在未见任务上进行评估时,这种捷径会导致模型继续依赖机器人历史,并在恰恰需要该信号来指定新任务时,未能充分利用ICL 信号

    为对抗这种捷径,作者从Next Forcing [14] 的多片段预测中汲取灵感,引入in-context future chunk prediction (IFP):这是一种仅用于训练的辅助目标,要求模型从当前的机器人视频表征中预测多个跨步的未来机器人视频片段
  2. 为时间步幅,K 为需要预测的未来片段数量。第k 个未来目标机器人视频片段为,其中目标索引定义为

    为了预测这些目标,作者添加了个IFP 模块,其中负责在流匹配目标下对第个跨步未来视频块进行去噪

    每个IFP 模块与视频分支中的单个Transformer 层具有相同的结构,并从最后一个video Transformer 层进行初始化
  3. IFP 在由主分支生成的当前机器人视频表征上运行。在下预测当前机器人视频片段时,作者从主视频Transformer 的M 个中间层收集机器人视频的隐藏表征

    表示的收集到的特征表征,其中是在流动时间的加噪片段

    然后将这些多层表征拼接起来,并通过一个轻量级的MLP 投影P fuse 将它们投射回单层隐藏维度:

    每个IFP 模块Gk 在融合的当前表示、干净的机器人视频/动作历史以及语言指令的条件下,预测其跨步的未来块



    IFP 损失将上述流匹配目标应用于每一个按步长抽取得到的目标,其中用 w_k 表示第 k 个未来视频片段目标的损失权重:

重要的是,IFP 模块并未直接以人类视频提示h 为条件。它们获取任务信息的唯一途径是通过,而该表示是在主机器人视频Transformer 与上下文中的人类视频交互后提取的。如果IFP 模块被直接以h 为条件,那么辅助分支就可以学习一个独立的、以人类视频为条件的未来预测器,而不必迫使主机器人视频Transformer 去编码上下文中的任务信息;由于IFP 模块在推理时会被移除,那么部署的策略将无法从这种辅助监督中获得任何收益

因此,作者只以为条件来训练IFP,使未来损失能够监督由主分支产生的当前机器人视频表示。多个未来片段以时间步长并行预测,在不在训练中引入未来片段预测之间时间依赖的情况下,提高了预测难度

1.2.3 训练与推理

首先,对于训练数据混合

作者在由任务多样化的 VA 和 HumanGen 数据构成的混合数据上训练 Zero-WAM:任务多样化 VA 提供多种机器人领域的视频—动作动态数据,而 HumanGen 则提供以可执行机器人动作为基础的人类视频任务规范。这两类数据并非按原始数据集规模比例进行采样,而是使用设定的采样权重进行抽取

其次,对于训练目标

  1. 对于每个目标下一个视频块,采样噪声和流时间,并形成

  2. 在给定任务条件的情况下,下一片段视频的损失为

  3. 对于动作片段预测,作者在动作空间中使用类似的流匹配目标。给定高斯噪声和流时间,构造



    并优化

  4. 对于任务多样的VA 样本,条件是仅语言,c = ℓ,损失为



    对于HumanGen 样本,视频预测以为条件,并结合上下文未来片段预测(IFP)进行增强。动作损失仍然以ℓ为条件,因为动作Transformer 并不直接关注人体视频:

最后,对于推理

在测试时,IFP 模块被移除,Zero-WAM 支持两种任务指定模式

  • 在仅语言模式下,模型以文本指令为条件,即
  • 在ICL 模式下,人类视频被编码一次,其tokens 被缓存为前缀记忆,因此模型以为条件,其中语言指令是可选的

在这两种模式下,模型首先生成下一个机器人视频块,然后解码对齐的动作块

// 待更

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询