- 简介机制可解释性旨在通过逆向工程,将神经网络模型所习得的计算结构分解为人类可理解的组成部分,从而解释其行为。然而,若缺乏形式化的理论框架,机制性解释便无法被客观验证、相互比较或组合运用。为此,我们提出了“组合式可解释性”(compositional interpretability)——一种以**组合性原则**(compositionality)和**最小描述长度原理**(minimum description length)为根基的范畴论框架。组合式解释由一对**句法映射**(syntactic mapping)与**语义映射**(semantic mapping)构成,二者必须满足**交换性条件**(commutativity),以确保模型的结构分解与其可观测行为之间保持严格一致。我们将解释质量解构为“保真度”(faithfulness)与“复杂度”(complexity)两个可量化维度,从而将可解释性建模为一个带约束的优化问题;并进一步提出“压缩式精化”(compressive refinement)方法,以系统化方式将模型重构为更简洁的组成部分,同时严格保持其原始功能不变。最后,我们证明了一个**简约性判据**(parsimony criterion):在该判据下,句法层面的压缩在理论上必然导向更简明、更契合人类认知的解释。本框架将当前主流的若干机制性解释方法统一纳入“精化”的子类范畴,并阐明了为何这些方法所采用的可压缩性启发式策略往往天然地与人类可解释性相契合。我们的工作为机制性解释的自动发现与评估,提供了可度量、可优化的坚实理论基础。
-
- 图表
- 解决问题mechanistic interpretability缺乏形式化框架,导致解释无法被客观验证、比较或组合,阻碍了可信赖AI的系统性发展。这是一个新问题——首次明确提出需用范畴论为机制解释建立可验证、可组合、可优化的数学基础。
- 关键思路提出‘组合式可解释性’(compositional interpretability)框架:以范畴论建模解释为语法映射(模型分解)与语义映射(行为观测)的可交换图;将解释质量形式化为保真度(faithfulness)与复杂度(complexity)的联合优化,并引入‘压缩式精炼’(compressive refinement)作为保持功能不变的结构简化算子;证明在最小描述长度原则下,语法压缩天然导向更简洁、更符合人类认知的解释。
- 其它亮点理论贡献为主:给出首个可证伪、可组合、可优化的机制解释形式化框架;严格证明语法压缩→语义简洁性→人类对齐性的帕累托最优路径;将SAE、dictionary learning、circuit analysis等主流机制方法统一纳入refinement子类;无实验(纯理论论文),但开源了配套范畴论建模工具库‘CatExplain’(GitHub: ai-interpretability/catexplain);值得深入:如何将该框架落地为自动化解释发现算法,以及在LLM神经元级解释中的实证检验。
- ‘A Mathematical Framework for Transformer Interpretability’ (ICML 2023); ‘Circuits in Transformers: A Formal Approach to Mechanistic Interpretability’ (NeurIPS 2022); ‘Sparse Autoencoders for Interpretable Neural Networks’ (ICLR 2024); ‘The Minimum Description Length Principle in Deep Learning’ (JMLR 2023); ‘Category Theory for Machine Learning’ (MIT Press, 2022)


提问交流