近年来,基于仿真的强化学习已经产生了许多性能卓越的机器人控制器,其策略在仿真环境中训练,并可零样本部署到腿式、灵巧型和空中机器人系统上。然而,在新机器人上复现这种方法却十分困难:这项工作涉及一个端到端的流程,其各个阶段都依赖于成熟度和开放程度不一的基础设施,而这些基础设施中封闭或分散的部分往往比其上运行的算法本身更能成为瓶颈。

本论文开发了流水线各阶段所需的开放式基础设施。在基础阶段,即训练必须基于对硬件的精确模拟模型才能有效进行之前,我们构建了一个精心整理的机器人描述库,用于一个开放的物理引擎和一个系统辨识工具箱,该工具箱能够根据特定硬件校准这些模型。在训练阶段,奖励和最终策略之间的迭代循环决定了项目的进度,我们贡献了一套开放的、GPU加速的强化学习基础设施,涵盖了从用于快速原型开发的最小抽象库到跨多个机器人和任务系列的基于管理器的代码库框架,在该框架下,单个仿真到实际的配方可以在几周内迁移到六个机器人平台。在任务先验阶段,即当仅靠奖励设计不足以满足需求时所需的人类指导,我们证明了专家指法标注能够使灵巧的双手钢琴演奏从乐谱中学习,并且我们开发了逆运动学基础设施,可以将人体运动捕捉、远程操作和视频数据转换为机器人参考轨迹。

这些阶段产生的成果已被外部研究团队、机器人制造商和其他模拟器项目采用,并成为后续研究的基础,例如人形机器人运动模仿、基于视频的钢琴演奏以及远程操控全身控制。各章节中记录的开放式端到端基础设施,正是使得这种从模拟到现实的方法能够在不同实验室中得到复现的关键所在。

论文题目From Simulation to Reality: An End-to-End Pipeline for Reproducible Robot Learning

作者Kevin Zakka

类型:2026年博士论文

学校:University of California, Berkeley(美国加州大学伯克利分校


下载论文https://t.zsxq.com/8Zh4J

请索引第148篇博士论文

图片
图片



微信群

内容中包含的图片若涉及版权问题,请及时与我们联系删除