生成式大型语言模型(generative Large Language Models, LLM)作为一种强大的算法范式,在语言处理任务中迅速崛起,使得高效(efficient的LLM推理成为一项重要的系统挑战。然而,LLM服务正变得越来越消耗资源,LLM模型规模的增长速度远远超过了硬件内存的增长速度,而应用程序也需要更长的上下文长度、更复杂的推理以及多轮agentic工作流。此外,LLM生成过程中固有的顺序依赖性意味着工作负载严重受限于内存带宽,从而为LLM推理造成了严重的内存瓶颈。这些挑战导致内存密集型LLM与内存受限的硬件平台之间日益加剧的瓶颈,限制了LLM的普及应用。

为了应对这一挑战,本论文提出了几种内存高效(memory-efficient的LLM推理算法,以支持处理具有长上下文长度的大型模型。首先,论文对LLM推理进行了性能分析和建模(第二章),指出LLM推理的主要瓶颈在于内存带宽而非计算能力,并发现随着上下文长度的增长,内存流量的主要来源从模型权重转移到了键值缓存。在此分析的基础上,论文第三章介绍了如何量化模型权重(quantizing model weights以使其适应内存受限的GPU,第四章则提出了通过量化键值缓存激活来加速长上下文推理工作负载的方法。随后,论文概述了旨在仅从内存加载重要上下文来加速LLM推理的算法,并通过两个目标应用进行了验证:共享前缀工作负载(第五章)和推理工作负载(第六章)。最后,第七章总结了本论文的主要贡献,并展望了未来的研究方向。

论文题目Memory-Efficient LLM Inference Algorithms

作者Coleman Hooper

类型:2026年博士论文

学校:University of California, Berkeley(美国加州大学伯克利分校


下载论文https://t.zsxq.com/IYhiE

请索引第143篇博士论文

图片
图片



微信群

内容中包含的图片若涉及版权问题,请及时与我们联系删除