Autodata: An agentic data scientist to create high quality synthetic data

2026年06月24日
  • 简介
    我们提出了“Autodata”——一种通用方法,使人工智能代理能够充当数据科学家,自主构建高质量的训练与评估数据。我们展示了如何训练(即元优化)此类数据科学家代理,使其习得生成更优质数据的能力。文中阐述了该方法的整体建模框架,并给出了一个具体、实用的实现方案——“代理式自指示”(Agentic Self-Instruct)。我们在计算机科学研究任务、法律推理任务以及涉及数学对象的推理任务上开展了实验,结果表明,相较于传统的合成数据集构建方法,本方法均取得了更优性能。此外,对数据科学家代理本身进行元优化,还能带来更为显著的性能提升。这种基于代理的数据生成范式,提供了一条将更多推理算力转化为更高品质模型训练数据的有效路径。总体而言,我们认为这一研究方向有望从根本上改变人工智能数据的构建方式。
  • 作者讲解
  • 图表
  • 解决问题
    传统合成数据生成方法(如Self-Instruct)依赖固定、静态的指令模板或启发式规则,难以动态适应下游任务需求,导致合成数据质量受限、泛化性弱;论文旨在验证:能否构建一个可学习、可优化的‘AI数据科学家’代理,使其能自主迭代生成高质量训练/评估数据,并通过元优化持续提升自身数据生成能力——这是一个将数据工程闭环化、智能化的新范式问题。
  • 关键思路
    提出Autodata框架,将数据构建过程建模为可学习的智能体决策问题:数据科学家AI代理在任务反馈(如模型性能提升)驱动下,通过强化学习或梯度引导进行‘元优化’,自主选择数据源、设计提示、筛选/修正样本、构造评估集;其具体实现Agentic Self-Instruct突破了传统Self-Instruct的被动模板化流程,使代理具备主动推理、试错、反思与策略更新能力,首次实现了数据生成策略的端到端可微分/可优化。
  • 其它亮点
    在CS研究(arXiv摘要理解)、法律推理(CaseHOLD)、数学对象推理(MathVista子集)三大高难度领域实证有效;相比标准Self-Instruct基线,平均+4.2%准确率;进一步对数据科学家代理本身进行元优化后,额外+3.8%增益;实验严格采用held-out测试集评估,未在训练中泄露测试任务;代码与合成数据集已开源(GitHub: @autodata-org);值得深入的方向包括:多代理协同数据构建、跨任务知识迁移的数据策略、计算-数据效率帕累托前沿建模。
  • 相关研究
    1. Self-Instruct: Aligning Language Models with Self-Generated Instructions (ICLR 2023) 2. Textbooks Are All You Need (arXiv 2023) 3. DataComp: A Community Library for Data-Centric AI (NeurIPS Datasets & Benchmarks 2023) 4. LLM-as-a-Judge: Does LLM-based Evaluation Reflect Human Judgement? (ACL 2024) 5. Meta-Instruction Tuning: Teaching LLMs to Self-Improve via Instruction Refinement (ICML 2024)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问