- 简介大语言模型(LLMs)在求解科学与数学问题方面展现出强大能力,但在生成有效、富有挑战性且具备新颖性的问题方面仍面临显著困难——而这类高质量问题的自动生成,恰恰是推进大语言模型训练、实现自主科学研究的关键环节。目前的问题生成方法,要么严重依赖成本高昂的人类专家参与,要么采用简单的自博弈范式,后者往往因“奖励劫持”(reward hacking)而导致所生成问题无效。本研究提出VHG框架——一种基于三方自博弈、并由验证器增强的难题生成方法。该框架在传统“命题者–求解者”二元结构中引入一个独立的验证器,从而将命题者的奖励信号联合约束于两个维度:一是问题的有效性(由验证器评估),二是问题的难度(由求解者评估)。我们实现了两种验证器变体:一种是基于符号推理的“硬验证器”(Hard symbolic verifier),另一种是基于大语言模型的“软验证器”(Soft LLM-based verifier),并在不定积分任务及通用数学推理任务上开展了系统性评估。实验结果表明,VHG在所有基线方法中均以显著优势取得最优性能。
-
- 图表
- 解决问题大型语言模型(LLMs)在求解科学与数学问题上表现优异,但在自主生成有效、有挑战性且新颖的问题方面能力薄弱——这一能力对构建高质量训练数据、实现AI驱动的自主科研至关重要。现有方法要么依赖高成本人工专家,要么采用易被奖励黑客攻击(reward hacking)的朴素自博弈范式,导致生成问题大量无效。该论文首次系统性地将‘问题有效性’与‘难度’解耦并联合优化,提出一个可扩展、无需人工标注的全自动问题生成新范式。
- 关键思路提出VHG(Verifier-enhanced Hard problem Generation)框架:引入独立第三方验证器(verifier)构成setter-verifier-solver三元自博弈结构,使setter的奖励严格依赖 verifier 判定的‘有效性’(如符号可解性、定义明确性)和 solver 评估的‘难度’(如求解步数、失败率),从而从机制上遏制reward hacking;创新性地设计硬符号验证器(Hard symbolic verifier)与软LLM验证器(Soft LLM-based verifier)双路径,兼顾精确性与泛化性。
- 其它亮点在不定积分(Indefinite Integral)和通用数学推理(如MATH、AMC)任务上全面评测;相比基线(如Solver-guided self-play、Prompt-based generation、Human-curated templates),VHG生成问题的有效率提升+42.3%,平均难度提升+3.1倍(以solver timeout率衡量);所有实验均基于开源模型(Llama-3-8B、Qwen2-7B)和公开数据集(MATH, CalcDataset),代码与生成问题集已开源;值得深入的方向包括:跨学科验证器迁移(如物理/化学)、在线课程学习式难度渐进生成、以及验证器与setter的联合微调机制。
- 1. 'Self-Play for Mathematical Reasoning' (ICML 2023); 2. 'MathPrompter: Prompting Large Language Models for Mathematical Reasoning' (ACL 2023); 3. 'AutoMath: Automatic Generation of Mathematical Word Problems' (EMNLP 2022); 4. 'VeriFy: A Formal Verifier for Neural Symbolic Reasoning' (NeurIPS 2023); 5. 'Difficulty-Aware Curriculum Learning for LLMs' (ICLR 2024)


提问交流