随着人工智能系统在各领域逐步成为重要组成部分,对模型可解释性的需求日益迫切,由此催生了可解释人工智能这一研究方向。现有研究主要围绕黑盒模型解释的生成与评估展开,而如何借助解释评估结果直接改进模型性能,仍是一个亟待填补的关键空白。同样值得关注的是,解释过程本身具备通过训练反馈提升模型质量的潜力——XAI技术既可增强模型的可解释性,也可用于改善其性能表现。基于这一视角,西班牙格拉纳达大学的研究人员提出面向学习动力学的变换选择性隐藏输入评估(T-SHIELD)正则化方法族,其核心思想是通过遮蔽输入特征迫使模型在特征缺失的条件下完成泛化,从而提升模型质量。在该框架下,作者进一步提出XAI-SHIELD(简称X-SHIELD)正则化方法,利用解释结果筛选待遮蔽的特定特征。与传统方法相比,X-SHIELD正则化可无缝嵌入目标函数,在增强模型可解释性的同时提升其性能。在多组基准数据集上的实验验证表明,X-SHIELD在性能提升与整体可解释性改善方面均具有显著效果。通过对比施加与未施加X-SHIELD正则化的模型,上述改进得到了充分验证;本文还进一步分析了各项设计选择背后的理论依据。研究结果表明,X-SHIELD正则化为构建可靠的人工智能正则化方案提供了一条颇具前景的技术路径。相关成果已发表于《机器智能研究(英文)》2026年第3期。

 

图片来自Springer

 

全文下载:

X-SHIELD: Regularization for eXplainable Artificial Intelligence

Iván Sevillano-García, Julián Luengo & Francisco Herrera

https://link.springer.com/article/10.1007/s11633-025-1576-y

 

全文导读

 

人工智能技术近年来取得了突飞猛进的发展,深刻改变了研究人员应对现实世界复杂问题的方式。技术进步的同时,对模型可解释性的诉求也同步增长,可解释人工智能(XAI)研究领域应运而生。关于XAI的一般性定义可表述为:面向特定受众,可解释人工智能是指能够输出细节或推理依据,从而使自身运作机制清晰易懂的人工智能系统。

 

认识到可解释性的需求后,研究人员已提出大量XAI技术,例如基于反事实的解释方法;基于特征重要性生成解释的方法,如局部可解释模型无关解释(Local Interpretable Model-agnostic Explanations, LIME)、沙普利加性解释(SHapley Additive exPlanations, SHAP)等,这些都是模型无关的方法;以及模型依赖类方法,如DeepLIFT、集成梯度(Integrated Gradients)等。这些技术旨在生成能够揭示模型决策过程的解释,从而辅助人类理解。关于XAI技术的系统性梳理,读者可参阅相关综述文献。另一方面,该领域还涌现出多种致力于拆解黑盒模型复杂性的研究。这些研究不仅致力于使这些模型对人类可理解,也凸显了忽视XAI视角可能带来的潜在风险。近年来,关于XAI 2.0发展的新挑战与技术路线图也相继发表。

 

从受众与应用目的出发,学界提出了XAI的双视角划分:红色XAI(Red XAI,即研究、评估与开发)与蓝色XAI(Blue XAI,即责任、法律、信任与伦理)。红色XAI从开发者视角出发,利用可解释性改进人工智能系统;蓝色XAI则侧重于面向终端用户提升可解释性。红色XAI体现了可解释性在不同目标的AI模型设计中的重要价值。XAI技术能够在提升模型可解释性的同时改善其性能表现。

 

在这一背景下,研究人员观察到:尽管获取模型解释的方法层出不穷,但在各类解释方法之间进行择优选择的系统化方法论仍有待商榷。目前已提出多种定性与定量的解释评估方案,其中尤其值得关注的是Robust评估向量化局部线性解释(Robust Evaluation Vectorized Local-linear-Explanation, REVEL)框架——这是一个理论自洽的量化评估体系,可用于度量局部线性解释(Local Linear Explanations, LLEs)所生成解释的多维度属性。然而,迄今为止,从解释中提取的这些度量信息尚未被用于在增强可解释性的同时提升模型性能。

 

因此,一旦定义了解释的质量度量准则,研究人员就应当能够将这一质量准则引入模型的学习过程。这一过程的核心在于将质量偏好系统性地内嵌于模型本身。通过这种方式,学习算法将不再仅以准确率或性能为优化目标,而是同时兼顾输出结果的清晰度与可解释性,最终实现用户友好的设计目标。具体实现路径包括:优化训练流程、调整模型参数,乃至重新设计模型架构,使模型天然倾向于生成满足既定质量度量准则的解释。

 

正则化技术已成为实现上述目标的常用手段。通过在目标函数中引入额外项,正则化能够确保模型满足特定的期望准则。权重衰减(Weight Decay)、随机失活(Dropout)、数据增强(Data Augmentation)、早停(Early Stopping)等均为典型的正则化方法,相关文献对此有详细论述。从这一思路出发,若能量化解释质量,研究人员便可借助这些度量信息改进模型。基于这一范式,Weber等人对提升基于XAI的模型质量的各类理论方法进行了系统回顾与分类。

 

针对现有技术所面临的挑战与机遇,本文聚焦于在增强模型可解释性的同时提升其性能这一核心目标,提出T-SHIELD正则化方法族。该方法族通过遮蔽输入数据中的部分特征,迫使模型在特征减少的条件下完成学习,从而达到提升模型质量的目的。在该方法族框架下,作者进一步提出X-SHIELD方法——该方法借鉴XAI思想,筛选出重要性最低的特征进行遮蔽。本文详细探讨了T-SHIELD与X-SHIELD的理论基础,阐述了输入特征选择机制如何同时改善模型性能与可解释性。作为一种基于XAI的模型改进方法,X-SHIELD与红色XAI的研究范式高度契合。

 

图1.jpg 

图1 T-SHIELD工作流程

 

为验证X-SHIELD正则化方法对模型的增强效果,作者开展了全面的实验分析,重点考察该方案在可解释性方面的增益。实验评估为X-SHIELD正则化的有效性提供了实证依据,也为其实际应用价值提供了实践视角。

 

本文的组织结构如下:第2节为相关研究背景,阐述人工智能系统可解释性需求增长的原因,并介绍正则化技术如何改善人工智能模型的各项质量准则。第3节详细描述T-SHIELD正则化方法族与X-SHIELD正则化方法,给出所提方法的形式化定义与直观解释。第4节介绍实验设置,包括基准数据集与实现细节。第5节呈现实验结果,从性能角度评估正则化的有效性,并讨论不增强模型可解释性的转换T这一选择的重要性。最后,第6节总结全文贡献,强调人工智能可靠性的重要意义,并对未来研究方向进行展望。

 

 

全文下载:

X-SHIELD: Regularization for eXplainable Artificial Intelligence

Iván Sevillano-García, Julián Luengo & Francisco Herrera

https://link.springer.com/article/10.1007/s11633-025-1576-y

BibTex:

@Article {MIR-2024-11-506,

author={Iván Sevillano-García, Julián Luengo, Francisco Herrera },

journal={Machine Intelligence Research},

title={X-SHIELD: Regularization for eXplainable Artificial Intelligence},

year={2026},

volume={23},

issue={3},

pages={528-544},

doi={10.1007/s11633-025-1576-y}}

 

纸刊免费寄送
Machine Intelligence Research

MIR为所有读者提供免费寄送纸刊服务,如您对本篇文章感兴趣,请点击下方链接填写收件地址,编辑部将尽快为您免费寄送纸版全文!

说明:如遇特殊原因无法寄达的,将推迟邮寄时间,咨询电话010-82544737

收件信息登记:

https://lcn76mgd97vz.feishu.cn/share/base/form/shrcnsQ6cmRjqoxPF5WDowSBFVr

内容中包含的图片若涉及版权问题,请及时与我们联系删除