我们提出Kimi Linear,这是一种混合线性注意力架构,在包括短上下文、长上下文以及强化学习(RL)扩展在内的多种场景下,首次在公平比较中超越了全注意力机制。其核心是Kimi Delta Attention(KDA),一种表达能力强的线性注意力模块,它在Gated DeltaNet基础上引入了更精细的门控机制,从而更有效地利用有限状态RNN的内存。我们定制的分块算法通过采用一种特殊的“对角加低秩”(Diagonal-Plus-Low-Rank, DPLR)转移矩阵变体,实现了高硬件效率:相比通用DPLR公式大幅减少了计算量,同时更贴近经典的Delta学习规则。
我们基于KDA与多头潜在注意力(Multi-Head Latent Attention, MLA)的层间混合结构,预训练了一个拥有30亿激活参数、总计480亿参数的Kimi Linear模型。实验表明,在完全相同的训练配置下,Kimi Linear在所有评估任务上均显著优于全MLA模型,同时将KV缓存使用量最多减少75%,并在处理100万长度上下文时实现最高达6倍的解码吞吐量提升。这些结果表明,Kimi Linear可以作为全注意力架构的一种即插即用替代方案,在性能和效率方面均表现更优,尤其适用于输入和输出长度更长的任务。
为支持后续研究,我们开源了KDA内核及vLLM实现,并发布了预训练模型和经过指令微调的模型检查点。