
视觉和语言领域的基础模型利用互联网规模的数据和可扩展的训练方案,展现出了强大的泛化能力。相比之下,机器人策略在部署到未知的真实世界场景时,其鲁棒性、可靠性和泛化能力仍然面临着根本性的挑战。一个关键的限制因素是缺乏大规模、多样化且高质量的机器人数据。与视觉语言数据集不同,物理机器人数据的收集成本高昂且耗时,并行化难度也更大。这些挑战造成了视觉语言基础模型所依赖的数据和训练机制与目前机器人学习模型所依赖的数据和训练机制之间存在着根本性的差距。
本论文研究了可扩展且可泛化的机器人基础模型构建方法,旨在改进机器人学习系统获取、表示和利用数据的方式。论文认为,构建稳健的机器人基础模型需要三个互补方向的共同努力:(i)有效利用异构数据源,包括互联网规模的视觉语言数据、探索性或次优的感觉运动轨迹以及高质量的演示数据;(ii)开发数据高效且可泛化的策略模型;(iii)设计可扩展的真实世界数据采集系统,以降低获取演示数据的成本。
基于以上视角,本论文提出了一系列算法和系统方面的贡献,旨在构建机器人基础模型,涵盖从演示学习到更高层次的感知运动技能和任务推理,设计更具泛化的机器人策略,以及开发可扩展的真实世界数据采集系统。首先,论文介绍了MaskDP,这是首个将世界建模和基于探索性感知运动轨迹的决策预测统一起来的框架,从而支持多种下游行为。其次,论文提出了MOKA,它利用预训练的视觉语言模型,通过将任务映射到一组结构化的视觉关键点和路径点来实现机器人操作。第三,论文介绍了OTTER,这是一种视觉语言-动作策略,它将预训练的视觉语言表示与动作预测相结合,在保持跨指令、对象和环境的泛化能力的同时,实现了精确且数据高效的控制。此外,本论文还回顾了早期通过单次模仿进行上下文策略学习的尝试,其中策略以演示作为上下文条件。最后,它介绍了 Vitamin,这是一个可扩展且便携的系统,它利用改进的触觉传感和远程操作界面来收集高质量的真实世界演示,从而能够学习接触丰富的操作任务。
这些研究成果共同展示了如何通过结合异构数据源、可泛化的学习算法和可扩展的数据采集系统来实现可扩展的机器人学习。总而言之,本论文将表征学习、策略学习和数据收集融会贯通,推动机器人基础模型在实际应用场景中实现可靠的性能。

论文题目:Generalizable and Scalable Robot Learning in the Physical World
作者:Justin Wong
类型:2026年博士论文
学校:University of California, Berkeley(美国加州大学伯克利分校)
请索引第147篇博士论文
![]() | ![]() |
















内容中包含的图片若涉及版权问题,请及时与我们联系删除





评论
沙发等你来抢