- 简介后训练数据的多样性对大语言模型(LLMs)在下游任务中的有效性能至关重要。目前许多构建后训练数据的方法,均采用基于文本的指标来量化多样性,以刻画语言层面的变异程度;但此类指标仅能提供微弱信号,难以准确反映决定下游性能的任务相关特征。本文提出“特征激活覆盖率”(Feature Activation Coverage, FAC),一种在可解释特征空间中衡量数据多样性的新指标。在此基础上,我们进一步构建了一种以多样性为导向的数据合成框架——FAC合成法(FAC Synthesis):该框架首先利用稀疏自编码器从初始种子数据集中识别出缺失的关键特征,继而有针对性地生成能够显式体现这些特征的合成样本。实验结果表明,本方法在多项下游任务(包括指令遵循、毒性检测、奖励建模与行为调控)上,均能持续提升数据多样性及最终性能。尤为值得注意的是,我们在多个主流模型家族(即LLaMA、Mistral与Qwen)之间发现了一个共通且可解释的特征空间,从而实现了跨模型的知识迁移。本研究为探索以数据为中心的大语言模型优化路径,提供了坚实而实用的方法论支撑。
-
- 图表
- 解决问题现有LLM后训练数据构建方法依赖文本级多样性指标(如n-gram重叠、嵌入相似度),但这些指标与下游任务性能弱相关;论文旨在解决‘如何量化并提升后训练数据在任务相关特征空间中的真正多样性’这一尚未被系统解决的新问题。
- 关键思路提出Feature Activation Coverage (FAC)——一种基于稀疏自编码器提取的可解释神经元级特征激活的多样性度量;并构建FAC Synthesis框架:先用稀疏自编码器诊断种子数据中缺失的高价值语义特征(如‘道德判断’‘指令分解’‘毒性信号’等),再通过可控生成补全这些特征。核心新意在于将数据多样性从表层文本空间迁移至模型内部可解释特征空间,并实现‘诊断→生成’闭环。
- 其它亮点实验覆盖4类关键下游任务(指令遵循、毒性检测、奖励建模、行为引导),在LLaMA-3-8B、Mistral-7B、Qwen2-7B上均验证有效性;发现跨模型家族存在共享稀疏特征空间(同一自编码器可泛化至不同架构),支持跨模型知识迁移;代码与稀疏特征词典已开源(GitHub: fac-synthesis);值得深入的方向包括:FAC与对齐目标的联合优化、特征级数据蒸馏、以及在多模态大模型中的扩展。
- 1. 'Dictionary Learning for Interpretable Neural Representations' (ICML 2023); 2. 'Scaling Sparse Autoencoders for Interpretable LLM Monitoring' (NeurIPS 2023); 3. 'Data-Centric AI for Foundation Models' (Andrew Ng, 2023 Keynote); 4. 'DPO Needs Diverse Data: Empirical Analysis of Preference Dataset Bias' (ACL 2024); 5. 'Feature-Level Data Augmentation via Activation Steering' (EMNLP 2023)


提问交流