- 简介我们展示了离线的演员-评论家强化学习可以扩展到大型模型,如Transformer,并遵循类似于监督学习的扩展规律。我们发现,在包含132个连续控制任务的大型数据集上,离线演员-评论家算法可以胜过强大的监督行为克隆基线,用于多任务训练,其中包含次优和专家行为。我们引入了一个基于Perceiver的演员-评论家模型,并阐述了使离线RL与自我和交叉注意力模块一起工作所需的关键模型特征。总的来说,我们发现:i)简单的离线演员评论家算法是逐渐远离当前行为克隆范例的自然选择,ii)通过离线RL,可以从次优演示或自动生成的数据中学习掌握许多领域的多任务策略,包括真实的机器人任务。
-
- 图表
- 解决问题研究离线演员-评论家强化学习在大规模模型上的可扩展性,并验证其在多任务训练中的表现。
- 关键思路通过离线演员-评论家强化学习算法,可以从多个子优化和专家行为的大型数据集中学习多任务策略,包括真实机器人任务。
- 其它亮点实验表明,离线演员-评论家强化学习算法可以优于强大的监督学习基线,可以逐渐摆脱行为克隆的主导范式。通过Perceiver-based演员-评论家模型,阐明了使离线强化学习与自我和交叉注意力模块配合工作所需的关键模型特征。
- 相关研究包括:Offline Reinforcement Learning: Tutorial, Review, and Perspectives; Learning to Learn with Feedback and Local Plasticity; Offline Reinforcement Learning: A Survey.


提问交流