Nash Learning from Human Feedback

2023年12月01日
  • 简介
    这篇文章讨论了如何通过人类反馈进行强化学习,以使大型语言模型(LLMs)更符合人类偏好。通常,RLHF的第一步是从人类反馈中学习奖励模型,通常是通过预训练的LLM生成的文本对之间的偏好来表达。随后,LLM的策略通过强化学习算法进行优化,以最大化奖励模型。然而,当前奖励模型的固有限制是它们无法完全表示人类偏好的丰富性以及它们对采样分布的依赖性。 在本研究中,我们介绍了一种使用成对人类反馈进行LLMs微调的替代流程。我们的方法涉及初始学习偏好模型,该模型在给定提示的情况下针对两个输入进行调整,然后通过追求一种策略,该策略始终生成优选于任何竞争策略生成的响应,从而定义了该偏好模型的纳什均衡。我们将这种方法称为从人类反馈中的纳什学习(NLHF)。 在表格策略表示的情况下,我们提出了一种基于镜像下降原理的新算法解决方案Nash-MD。该算法产生一系列策略,最后一次迭代收敛于正则化的纳什均衡。此外,我们探讨了策略的参数表示,并引入了用于深度学习架构的梯度下降算法。为了展示我们方法的有效性,我们提供了涉及文本摘要任务的LLM微调的实验结果。我们认为NLHF为偏好学习和策略优化提供了一个引人注目的途径,有可能推动将LLMs与人类偏好相一致的领域的发展。
  • 作者讲解
  • 图表
  • 解决问题
    NLHF试图通过人类反馈来对大型语言模型进行微调,解决当前奖励模型无法完全表达人类偏好且依赖于采样分布的问题。
  • 关键思路
    NLHF采用偏好模型和纳什学习来微调模型,通过优化生成的回应来定义偏好模型的纳什均衡。
  • 其它亮点
    NLHF提出了一种新的微调方法,使用偏好模型和纳什学习来定义纳什均衡。作者提出了一种基于镜像下降的算法Nash-MD,可以处理表格策略表示,也可以使用深度学习架构。实验表明NLHF在文本摘要任务上的微调效果良好。
  • 相关研究
    当前领域中的相关研究包括使用RLHF进行微调的研究,如Preference Elicitation for Language Generation with Latent Variable Models和Learning to Learn from Human Preferences。
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问