诸如GEPA之类的进化式提示优化器存在“提示膨胀”问题:每轮迭代都会不断追加规则与限制条件,导致最终生成的提示长度增至原先的3倍,但准确率却并未提升。我们发现这一现象源于三大缺陷——错误观测不全面、搜索多样性不足,以及选择机制不可靠。为此,我们提出ESPO(结构化错误驱动的提示优化方法),将提示优化过程分解为三个阶段:
**诊断阶段(Diagnose)**:仅需一轮处理,即可将全部训练错误聚类为若干结构性模式;
**生成阶段(Propose)**:采用四种互补的候选提示生成策略,各策略具备独立的偏差倾向,从而保障生成多样性;
**筛选阶段(Select)**:运用自助法(bootstrap)稳定性选择机制,确保所选提示在不同采样子集上表现稳健。
在七个公开NLP基准数据集(Tweet、MMLU、GSM8K、HotpotQA、ScoNe、HoVer 和 PUPA)上的实验表明,ESPO相较当前最优方法GEPA,平均准确率提升+3.76个百分点(74.67% vs. 70.91%),且在所有数据集上均达到或超越GEPA性能,同时所生成提示长度缩短47%(1,004字符 vs. 1,878字符),推理速度也更快。进一步开展跨模型验证,在另外四个学生模型(Gemma 3 12B、Mistral 14B、Qwen3 32B、Claude Haiku 4.5)上,ESPO在每一模型上均取得最高平均准确率;其中在Qwen3模型上的GSM8K任务中提升最为显著,准确率从15.00%跃升至91.40%。本文附录中给出的一般化误差界,从理论上为ESPO三阶段设计分别提供了测试阶段误差gap中对应项的严格支撑;消融实验亦证实了一个关键预测:若仅增加生成多样性而未引入自助稳定性选择机制,反而会损害整体性能(准确率下降1.20个百分点)。