Self-Training for Sample-Efficient Active Learning for Text Classification with Pre-Trained Language Models

2024年06月13日
  • 简介
    主动学习是一种迭代标记过程,用于获取少量标记数据的子集,从而使得能够训练监督学习模型,例如文本分类。虽然由于预训练语言模型的改进,主动学习在近年来取得了相当大的进展,但通常被忽视的未标记数据部分中存在未开发的潜力,尽管它的数量通常比通常的少量标记数据要大得多。在这里,我们研究了如何利用自训练(self-training)这种半监督方法,其中模型用于从未标记数据中获取伪标签,以提高文本分类的主动学习效率。从对四种先前自训练方法的广泛复制开始,其中一些在主动学习或自然语言处理的上下文中首次进行评估,我们设计了HAST,一种新的有效自训练策略,在四个文本分类基准测试中进行了评估,在其中三个数据集上,使用仅25%的数据,它优于复制的自训练方法,并达到了与以前实验相当的分类结果。
  • 作者讲解
  • 图表
  • 解决问题
    本文旨在探讨如何利用自训练(self-training)这一半监督学习方法,提高文本分类中主动学习(active learning)的效率。同时,研究人员还试图挖掘通常被忽视的未标记数据的潜力,以此来解决标记数据不足的问题。
  • 关键思路
    本文提出了一种新的自训练策略HAST,并通过在四个文本分类基准测试数据集上的实验,证明了该方法的有效性。相比之前的自训练方法,HAST 在三个数据集上的表现都有所提升,同时只使用了 25% 的数据。
  • 其它亮点
    本文首先对四种自训练方法进行了复现,并在其中一些方法首次在主动学习或自然语言处理领域进行了评估。然后,研究人员提出了一种新的自训练策略 HAST,并在四个文本分类基准测试数据集上进行了实验。实验结果表明,HAST 方法在三个数据集上的表现优于已有的自训练方法,并且只使用了 25% 的数据。本文开源了实验代码。
  • 相关研究
    近年来,主动学习和半监督学习在文本分类领域都有广泛的应用。在半监督学习方面,自训练是一种常见的方法。本文对四种自训练方法进行了复现和比较,并提出了一种新的自训练策略 HAST。此外,本文还使用了四个文本分类基准测试数据集,包括 20 Newsgroups、Reuters-21578、WebKB 和 AG News。
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问