- 简介长上下文的利用对于大型语言模型来说是一个巨大的挑战,因为它们的上下文窗口长度受到限制。虽然可以通过微调来扩展上下文窗口,但这将导致训练和推理时间的显著成本,并对LLM的原始能力产生不利影响。在本文中,我们提出了Activation Beacon,它将LLM的原始激活压缩成更紧凑的形式,从而使其能够使用有限的上下文窗口感知更长的上下文。Activation Beacon被引入作为LLM的即插即用模块。它在完全保留LLM在短上下文上的原始能力的同时,扩展了在处理长上下文方面的新能力。此外,它使用短滑动窗口来处理长上下文,从而在训练和推理中实现了竞争性的内存和时间效率。Activation Beacon是通过基于具有多样化压缩比的信标混合条件的自回归任务来学习的。由于这种处理方式,它可以仅使用短序列数据在短短的10K步内高效地训练,这在单个8xA800 GPU机器上不到9小时。实验研究表明,Activation Beacon能够将Llama-2-7B的上下文长度扩展100倍(从4K到400K),同时在长上下文生成和理解任务上实现了优异的结果。我们的模型和代码将在BGE代码库中提供。
-
- 图表
- 解决问题如何解决大语言模型在处理长上下文时受限于上下文窗口长度的问题?
- 关键思路提出一种名为Activation Beacon的模块,将LLM的原始激活压缩为更紧凑的形式,以便在有限的上下文窗口内感知更长的上下文。Activation Beacon作为插件模块引入LLM,完全保留LLM在短上下文上的原始能力,同时扩展了在处理长上下文时的新能力。此外,它使用短滑动窗口来处理长上下文,在训练和推理中实现了竞争性的内存和时间效率。
- 其它亮点Activation Beacon能够将Llama-2-7B的上下文长度扩展100倍(从4K到400K),同时在长上下文生成和理解任务上实现了优越的结果。实验中使用的数据集和代码将在BGE存储库中提供。
- 近期的相关研究还包括:1.《XLNet: Generalized Autoregressive Pretraining for Language Understanding》 2. 《Longformer: The Long-Document Transformer》


提问交流