后训练数据的多样性对大语言模型(LLMs)在下游任务中的有效性能至关重要。目前许多构建后训练数据的方法,均采用基于文本的指标来量化多样性,以刻画语言层面的变异程度;但此类指标仅能提供微弱信号,难以准确反映决定下游性能的任务相关特征。本文提出“特征激活覆盖率”(Feature Activation Coverage, FAC),一种在可解释特征空间中衡量数据多样性的新指标。在此基础上,我们进一步构建了一种以多样性为导向的数据合成框架——FAC合成法(FAC Synthesis):该框架首先利用稀疏自编码器从初始种子数据集中识别出缺失的关键特征,继而有针对性地生成能够显式体现这些特征的合成样本。实验结果表明,本方法在多项下游任务(包括指令遵循、毒性检测、奖励建模与行为调控)上,均能持续提升数据多样性及最终性能。尤为值得注意的是,我们在多个主流模型家族(即LLaMA、Mistral与Qwen)之间发现了一个共通且可解释的特征空间,从而实现了跨模型的知识迁移。本研究为探索以数据为中心的大语言模型优化路径,提供了坚实而实用的方法论支撑。