- 简介我们提出 GRAPE(群表示位置编码,Group RepresentAtional Position Encoding),这是一种基于群作用的统一位置编码框架。GRAPE 将两类机制整合在一起:(i) 在 $\mathrm{SO}(d)$ 中的乘法旋转(乘法型 GRAPE);以及 (ii) 来自一般线性群 $\mathrm{GL}$ 中幺模作用的加法 logits 偏置(加法型 GRAPE)。在乘法型 GRAPE 中,位置 $n \in \mathbb{Z}$(或 $t \in \mathbb{R}$)的作用形式为 $\mathbf{G}(n)=\exp(n\,ω\,\mathbf{L})$,其中 $\mathbf{L} \in \mathbb{R}^{d \times d}$ 是一个秩为 2 的反对称生成元,由此得到一种相对的、可组合的、保持范数不变的映射,并具有闭式矩阵指数表达。当 $d/2$ 个平面取标准坐标对且谱呈对数均匀分布时,该方法恰好还原了 RoPE。通过学习可交换子空间以及紧致非交换混合结构,这一几何框架得以严格扩展,分别以每注意力头 $O(d)$ 和 $O(r d)$ 的代价捕捉跨子空间的特征耦合。在加法型 GRAPE 中,加法 logits 源于秩为 1(或低秩)的幺模作用,恰好包含了 ALiBi 和遗忘变压器(Forgetting Transformer, FoX)作为特例,同时保持精确的相对位置律和流式缓存能力。总体而言,GRAPE 为长上下文模型中的位置几何提供了有理论依据的设计空间,将 RoPE 和 ALiBi 统一为其特例。项目主页:https://github.com/model-architectures/GRAPE。
-
- 图表
- 解决问题论文旨在解决现有位置编码方法在长上下文建模中的局限性,统一解释并扩展当前主流的位置感知机制(如RoPE和ALiBi),提供一个更具表达性和理论一致性的框架。这个问题虽然不是全新的,但如何从群作用的角度统一现有方法并系统扩展仍是一个未被充分探索的新方向。
- 关键思路提出GRAPE(Group RepresentAtional Position Encoding)框架,基于群作用将位置编码分为两类:乘法式旋转(Multiplicative GRAPE)和加法式logit偏置(Additive GRAPE)。前者通过SO(d)中的李群指数映射实现相对位置编码,后者利用GL中的单幂作用恢复ALiBi和FoX等机制。关键创新在于用统一的数学语言——群表示论——来建模位置信息,使RoPE和ALiBi成为其特例,并支持可学习的子空间耦合结构。
- 其它亮点Multiplicative GRAPE精确还原RoPE,并通过可学习的交换/非交换子空间扩展其几何表达能力;Additive GRAPE完整涵盖ALiBi与FoX,保持相对性与缓存流式处理能力;整个框架具有闭式解、理论可解释性强、计算高效(O(d)或O(rd))等特点;代码已开源(GitHub项目页:https://github.com/model-architectures/GRAPE),为后续研究提供了可扩展的设计空间。
- 1. RoFormer: Enhanced Transformer with Rotary Position Embedding 2. Attention with Linear Biases (ALiBi): A Simple Method for Long Context 3. FoX: Forgetting in Transformers with Unipotent Actions 4. Nyströmformer: A Nyström-Based Algorithm for Approximating Self-Attention 5. Transformer-XH: Multi-head Attention with Dynamic Positional Encodings


提问交流