RT-2 模型详解
RT-2 (Robotic Transformer 2)
基本信息
项目 | 内容 |
全称 | Robotic Transformer 2 |
机构 | Google DeepMind |
论文 | [RT-2: Vision-Language-Action Models](https://robotics-transformer.github.io/) |
架构 | Transformer (VLM-based) |
动作类型 | 离散 Token |
训练方式 | 模仿学习 (Imitation Learning) |
模型架构图
输入图像 ──→ ViT Encoder ──→ 图像Token ──┐
├──→ 共享Token序列 ──→ LLM (PaLM/S隔) ──→ 输出Token
文本指令 ──→ Text Embed ──────────────────┘
↑
动作Token也加入词表
输出Token ──→ 判断是动作Token还是文本Token ──→ 动作Token ──→ DeQuantize ──→ 连续动作
公式列表
公式 1:图像 Token 化
$$I_{token} = \text{ViT}(I_{raw})$$
项目 | 内容 |
**输入** | 原始图像 $I_{raw} \in \mathbb{R}^{H \times W \times 3}$ |
**输出** | Token 序列 $I_{token} \in \mathbb{R}^{N \times D}$ |
**作用** | 把图像切成 patch,转换成向量 |
场景:相机拍摄一帧画面
输入: [224, 224, 3] 的RGB图像
输出: 196个token, 每个token 768维向量
比喻:切披萨</