【HumanScale】重新定义预训练数据
2026/7/23 4:28:41 网站建设 项目流程


问题提出与实验设计:
预训练阶段更缺动作对齐还是世界覆盖?北大HumanScale给出反直觉回答:第一视角人类视频可能是更好的预训练数据源。作者固定模型架构、预训练时长、后训练数据,只替换预训练数据源,将HumanNet的5000h第一视角视频与同等规模机器人数据直接对比,后训练用AgibotWorld的15个任务,分Seen和Unseen评测。

核心结果与数据差异:
Seen任务两类预训练差距不大(loss 0.0067 vs 0.0071);Unseen任务人类视频loss降至0.0204,机器人数据为0.0254,差距约20%。人类视频呈清晰scaling曲线(100h→5000h持续下降,R²达0.86/0.94),机器人数据更早饱和。同样100h,人类视频含45000条轨迹,机器人仅8000条,信息密度差异显著。

作者判断与真实机器人验证:
作者划分:预训练重coverage,后训练重alignment。机器人数据局限源于固定工作台、有限物体等结构性约束。真实AgiBot实验:人类视频预训练模型ID成功率92.5%,OOD 90.0%;无预训练基线ID仅40.0%,OOD完全失效(0.0%),且预训练模型损失比基线低约2.4倍。

边界与总结:
需注意:真实实验对比的是“有无人类视频预训练”,未与机器人数据预训练做同平台部署对比;结论基于WAM架构,迁移至VLA待验证。但HumanScale首次定量证明预训练阶段更广的数据覆盖比更强运动学对齐更重要。

🔗相关资料
论文:HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining
arXiv:https://arxiv.org/abs/2606.20521

✍️文章转载于知乎@梦落花
原文链接:https://zhuanlan.zhihu.com/p/2054905612228678573

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询