Offline Actor-Critic Reinforcement Learning Scales to Large Models

2024年02月08日
  • 简介
    我们展示了离线的演员-评论家强化学习可以扩展到大型模型,如Transformer,并遵循类似于监督学习的扩展规律。我们发现,在包含132个连续控制任务的大型数据集上,离线演员-评论家算法可以胜过强大的监督行为克隆基线,用于多任务训练,其中包含次优和专家行为。我们引入了一个基于Perceiver的演员-评论家模型,并阐述了使离线RL与自我和交叉注意力模块一起工作所需的关键模型特征。总的来说,我们发现:i)简单的离线演员评论家算法是逐渐远离当前行为克隆范例的自然选择,ii)通过离线RL,可以从次优演示或自动生成的数据中学习掌握许多领域的多任务策略,包括真实的机器人任务。
  • 作者讲解
  • 图表
  • 解决问题
    研究离线演员-评论家强化学习在大规模模型上的可扩展性,并验证其在多任务训练中的表现。
  • 关键思路
    通过离线演员-评论家强化学习算法,可以从多个子优化和专家行为的大型数据集中学习多任务策略,包括真实机器人任务。
  • 其它亮点
    实验表明,离线演员-评论家强化学习算法可以优于强大的监督学习基线,可以逐渐摆脱行为克隆的主导范式。通过Perceiver-based演员-评论家模型,阐明了使离线强化学习与自我和交叉注意力模块配合工作所需的关键模型特征。
  • 相关研究
    相关研究包括:Offline Reinforcement Learning: Tutorial, Review, and Perspectives; Learning to Learn with Feedback and Local Plasticity; Offline Reinforcement Learning: A Survey.
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问