- 简介深度神经网络能够编码复杂的表征,但如何解构其内部知识仍是一项挑战。鉴于学习与压缩之间存在内在联系,网络压缩为分析这类知识提供了一条颇具前景的研究路径。然而,现有的常规压缩启发式方法往往受限于尺度对称性问题和架构偏差。为解决这些问题,我们提出了“希尔伯特算子渐进编码框架”(HOPE),这是一种用于逐步解构已训练网络权重中表征的数学框架。 HOPE将网络压缩从离散域迁移至连续函数构成的希尔伯特空间中。该框架将单个神经元建模为秩-1 的希尔伯特–施密特算子,从而将剪枝(pruning)与神经元融合(neuron merging)统一为低秩子空间投影操作。在此基础上进一步拓展,HOPE引入了“宏模块剔除”(macro block eviction)机制,将多层结构(例如完整的残差路径)纳入同一统一度量体系之下。这一统一范式使得模型可在不同层间——无论其类型或规模如何——做出无偏倚的架构决策。HOPE是一种无需数据、亦无需人工设定超参数的框架。我们通过若干原理验证型实验(涵盖模型压缩与微调任务),展示了该理论在实际应用中的潜力。
-
- 图表
- 解决问题深度神经网络内部知识的可解释性与可解构性问题:如何在不依赖数据和超参数的前提下,客观、统一地量化并压缩不同层、不同类型神经元所承载的表征信息,避免传统剪枝方法因权重尺度对称性和架构先验导致的偏差。这是一个尚未被系统解决的新问题。
- 关键思路提出HOPE(Hilbert Operator for Progressive Encoding)框架,将网络权重建模为Hilbert空间中的连续算子(单秩Hilbert-Schmidt算子),将剪枝、神经元融合、残差路径移除等操作统一表述为低秩子空间投影;首次将网络压缩从离散权值操作提升至连续函数空间的几何投影,并通过宏块驱逐(macro block eviction)实现跨层结构(如残差连接)的无偏度量与压缩。
- 其它亮点完全数据无关(data-free)且无需任何超参数(hyperparameter-free);在模型压缩与微调任务上完成概念验证实验(具体数据集未在摘要中披露,未提及开源代码);理论严格——基于泛函分析与算子理论构建,提供可证明的渐进编码保证;未来方向包括HOPE驱动的可解释性可视化、算子级知识蒸馏、以及向Transformer架构的泛化。
- 1. The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks (ICLR 2019) 2. Picking Winning Tickets Before Training by Preserving Gradient Flow (ICML 2020) 3. Neural Tangent Kernel: Convergence and Generalization in Neural Networks (NeurIPS 2018) 4. Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding (ICLR 2016) 5. Channel Pruning for Accelerating Very Deep Neural Networks (ICCV 2017)


提问交流