这篇文章讨论了如何通过人类反馈进行强化学习,以使大型语言模型(LLMs)更符合人类偏好。通常,RLHF的第一步是从人类反馈中学习奖励模型,通常是通过预训练的LLM生成的文本对之间的偏好来表达。随后,LLM的策略通过强化学习算法进行优化,以最大化奖励模型。然而,当前奖励模型的固有限制是它们无法完全表示人类偏好的丰富性以及它们对采样分布的依赖性。
在本研究中,我们介绍了一种使用成对人类反馈进行LLMs微调的替代流程。我们的方法涉及初始学习偏好模型,该模型在给定提示的情况下针对两个输入进行调整,然后通过追求一种策略,该策略始终生成优选于任何竞争策略生成的响应,从而定义了该偏好模型的纳什均衡。我们将这种方法称为从人类反馈中的纳什学习(NLHF)。
在表格策略表示的情况下,我们提出了一种基于镜像下降原理的新算法解决方案Nash-MD。该算法产生一系列策略,最后一次迭代收敛于正则化的纳什均衡。此外,我们探讨了策略的参数表示,并引入了用于深度学习架构的梯度下降算法。为了展示我们方法的有效性,我们提供了涉及文本摘要任务的LLM微调的实验结果。我们认为NLHF为偏好学习和策略优化提供了一个引人注目的途径,有可能推动将LLMs与人类偏好相一致的领域的发展。
提问交流