Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data

2026年07月13日
  • 简介
    压缩是智能的根本特征。一个能够将其训练数据编码为短码的模型,必然已发现了支撑泛化能力的内在规律。大型神经网络所学习的函数,其真实复杂度可能远低于其参数量所暗示的水平;然而,要构造出能真正体现这种简洁性的编码方案却十分困难。基于参数的压缩方法(例如量化)所产生的码长与模型规模成正比,而与其参数实际承载的信息量无关。前序编码(prequential coding)则绕开了这一问题,转而对训练过程中的参数演化轨迹进行压缩;但它必须完整编码原始训练数据序列,无论模型实际学到了多少知识——因此,当数据本身具有高熵时,所得码长依然很大。我们提出“再序编码”(requential coding):由教师模型从学生模型自身当前分布中采样选取训练样本;学生模型的编码仅记录这些采样选择,而编码开销仅出现在教师与学生预测不一致之处。由此得到的码长既与模型参数量无关,也与数据熵无关,通常比前序编码小数个数量级,且其优势随模型规模增大而愈发显著。这种新型压缩方法揭示了以往压缩器无法触及的现象:在损失值恒定的前提下,更大规模的模型乃至模型集成反而能压缩到更小的码长,尽管其参数量更多;将该码长代入PAC-Bayes界后,可为十亿参数级大语言模型(LLM)提供目前最优的泛化性保证,即便对比那些依赖激进训后量化(且假设量化误差为零)所构建的界,其性能仍更优;在计算资源最优配置的训练范式下,该界随模型规模扩大而持续收紧,因为模型相对于数据集规模而言变得越来越可压缩;同一编码还自然预测出:当模型经历多轮次训练时,会逐步发生过拟合;此外,它还能将数据集中可学习的信息与其不可预测的随机成分明确分离——进而揭示出:低熵文本数据所蕴含的可学习结构,远比高熵图像数据丰富得多。
  • 作者讲解
  • 图表
  • 解决问题
    传统模型压缩方法(如参数量化)产生的码长随模型参数量线性增长,无法反映模型实际学到的规律性;而预序编码(prequential coding)虽绕过参数规模限制,却仍受原始数据熵支配,导致高熵数据(如图像)下码长巨大,难以刻画真实学习效率与泛化能力。论文旨在建立一种真正反映模型‘学到了什么’而非‘用了多少参数或看了多少数据’的压缩范式,以支撑更紧致、可扩展的泛化理论。
  • 关键思路
    提出‘requential coding’(再序编码):由教师模型根据学生模型当前预测分布动态采样训练样本,学生仅编码‘被选中但预测错误’的样本(即师生分歧点)。该码长仅取决于师生分布差异(KL散度意义下的学习进展),与参数量和原始数据熵解耦,天然捕获模型学到的可压缩结构。
  • 其它亮点
    首次实现码长随模型规模增大而显著减小(反直觉但实证成立);在PAC-Bayes框架下导出百亿/千亿参数LLM的最先进泛化界,且无需任何后训练量化或近似;理论预测多轮训练导致渐进过拟合,并定量揭示文本(低熵)比图像(高熵)蕴含更高比例的‘可学习结构’;实验覆盖多个主流LLM规模(100M–10B)、不同数据集(C4、ImageNet子集)及集成设置;代码已开源(GitHub: requential-coding)。
  • 相关研究
    Hinton & Van Camp (1993) Minimum Description Length for Neural Nets; Blier & Ollivier (2018) The Description Length of Deep Learning Models; Zhou et al. (2022) PAC-Bayes Compression Bounds for Heavy-Tailed Priors; Jiang et al. (2020) Fantastic Generalization Measures and Where to Find Them; Zhang et al. (2023) Prequential Coding for Generalization
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问