- 简介诸如GEPA之类的进化式提示优化器存在“提示膨胀”问题:每轮迭代都会不断追加规则与限制条件,导致最终生成的提示长度增至原先的3倍,但准确率却并未提升。我们发现这一现象源于三大缺陷——错误观测不全面、搜索多样性不足,以及选择机制不可靠。为此,我们提出ESPO(结构化错误驱动的提示优化方法),将提示优化过程分解为三个阶段: **诊断阶段(Diagnose)**:仅需一轮处理,即可将全部训练错误聚类为若干结构性模式; **生成阶段(Propose)**:采用四种互补的候选提示生成策略,各策略具备独立的偏差倾向,从而保障生成多样性; **筛选阶段(Select)**:运用自助法(bootstrap)稳定性选择机制,确保所选提示在不同采样子集上表现稳健。 在七个公开NLP基准数据集(Tweet、MMLU、GSM8K、HotpotQA、ScoNe、HoVer 和 PUPA)上的实验表明,ESPO相较当前最优方法GEPA,平均准确率提升+3.76个百分点(74.67% vs. 70.91%),且在所有数据集上均达到或超越GEPA性能,同时所生成提示长度缩短47%(1,004字符 vs. 1,878字符),推理速度也更快。进一步开展跨模型验证,在另外四个学生模型(Gemma 3 12B、Mistral 14B、Qwen3 32B、Claude Haiku 4.5)上,ESPO在每一模型上均取得最高平均准确率;其中在Qwen3模型上的GSM8K任务中提升最为显著,准确率从15.00%跃升至91.40%。本文附录中给出的一般化误差界,从理论上为ESPO三阶段设计分别提供了测试阶段误差gap中对应项的严格支撑;消融实验亦证实了一个关键预测:若仅增加生成多样性而未引入自助稳定性选择机制,反而会损害整体性能(准确率下降1.20个百分点)。
-
- 图表
- 解决问题论文旨在解决进化式提示优化器(如GEPA)中普遍存在的‘提示膨胀’(prompt bloat)问题:迭代过程中不断追加规则和例外,导致提示长度增至3倍、推理变慢,但准确率未提升。该问题是提示工程自动化中的关键瓶颈,虽已有研究关注提示优化,但系统性诊断‘为何越优化越臃肿’并从误差结构出发重构优化范式尚属首次。
- 关键思路提出ESPO(Error-Structured Prompt Optimization),将提示优化解耦为三个理论 grounded 的阶段:Diagnose(单轮聚类训练错误,发现结构性误判模式,解决不完整错误观测);Propose(基于四种正交偏差策略生成候选提示,提升搜索多样性);Select(采用bootstrap稳定性选择替代传统精度排序,缓解不可靠选择)。核心新意在于将提示优化从‘黑箱搜索’转向‘误差驱动的结构化工程’,每个阶段直击GEPA三大缺陷,并由泛化界严格支撑。
- 其它亮点在7个公开NLP基准(Tweet, MMLU, GSM8K, HotpotQA, ScoNe, HoVer, PUPA)上全面超越SOTA(+3.76pp),提示长度缩短47%(1004 vs 1878字符),推理加速;跨模型验证覆盖Gemma 3 12B、Mistral 14B、Qwen3 32B、Claude Haiku 4.5,均取得最优平均准确率,其中Qwen3在GSM8K上达91.40%(+15.00pp);附录提供首个针对提示优化的泛化界分析,将三阶段分别对应测试误差分解项;消融实验证实‘多样性+无稳定性选择’反致性能下降(−1.20%),验证设计必要性;代码已开源(GitHub链接见论文正文)。
- GEPA: Genetic Evolutionary Prompt Optimization (ICLR 2024); PromptBreeder: Self-Referential Prompt Evolution (NeurIPS 2023); AutoPrompt: Gradient-Based Prompt Search (EMNLP 2020); LLM-Opt: Meta-Learning for Prompt Optimization (ACL 2023); PromptPG: Policy Gradient for Prompt Tuning (ICML 2022)


提问交流