☰
RT-2 模型详解
2026/10/9 5:34:41 网站建设 项目流程

RT-2 模型详解

RT-2 (Robotic Transformer 2)

基本信息

项目

内容

全称

Robotic Transformer 2

机构

Google DeepMind

论文

[RT-2: Vision-Language-Action Models](https://robotics-transformer.github.io/)

架构

Transformer (VLM-based)

动作类型

离散 Token

训练方式

模仿学习 (Imitation Learning)

模型架构图

输入图像 ──→ ViT Encoder ──→ 图像Token ──┐
                                           ├──→ 共享Token序列 ──→ LLM (PaLM/S隔) ──→ 输出Token
文本指令 ──→ Text Embed ──────────────────┘
                                           ↑
                                      动作Token也加入词表

输出Token ──→ 判断是动作Token还是文本Token ──→ 动作Token ──→ DeQuantize ──→ 连续动作

公式列表

公式 1:图像 Token 化

$$I_{token} = \text{ViT}(I_{raw})$$

项目

内容

**输入**

原始图像 $I_{raw} \in \mathbb{R}^{H \times W \times 3}$

**输出**

Token 序列 $I_{token} \in \mathbb{R}^{N \times D}$

**作用**

把图像切成 patch,转换成向量

场景:相机拍摄一帧画面

输入: [224, 224, 3] 的RGB图像
输出: 196个token, 每个token 768维向量

比喻:切披萨</

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询