报告主题:MUSE-AutoSkill: 通过技能创建、记忆、管理与评估实现智能体自我进化

报告日期:7月28日(周二) 10:30-11:30
报告要点:
现有大语言模型智能体通常将技能视为孤立静态的工具,难以持续复用任务经验并实现长期能力提升。智源Talk370期邀请了美国罗切斯特理工学院林华伟线上分享《MUSE-AutoSkill:通过技能创建、记忆、管理与评估实现智能体自我进化》。提出了以技能为核心的自进化智能体框架,将技能创建、记忆、管理、评估与迭代优化整合为统一生命周期,为将智能体经验沉淀为长期、可靠且可复用的技能提供了新范式。欢迎大家一起讨论交流。
论文链接:https://arxiv.org/abs/2605.27366v2

议题详情:

大语言模型(LLM)智能体依赖可复用的技能来解决复杂任务,但现有技能创建方法通常将技能视为相互孤立、静态不变的产物,限制了技能的可复用性、可靠性与长期能力提升。本文提出 MUSE-AutoSkill Agent(Memory-Utilizing Skill Evolution),一种以技能为核心的智能体框架,在统一的生命周期下创建、复用并优化技能:技能创建、记忆、管理、评估与迭代改进。MUSE 能够按需创建技能,跨任务持久化存储技能,通过技能目录进行检索,并积累技能级经验以支持后续复用与适应。在 SkillsBench 和 SkillLearnBench 的主要评测设置中,MUSE-AutoSkill 的表现优于 Hermes、Codex 和 Claude Code。在 SkillsBench 上,其自主创建的技能在成功覆盖的任务子集上超过人工编写的技能(85.24% vs. 81.17%),表明生命周期管理下的技能能够将智能体经验提炼为高效的可复用资产;MUSE 创建的技能迁移到 Hermes 上的效果也优于 Codex 或 Claude 创建的技能,迁移场景下达到 51.90% 的准确率。这些结果凸显了将技能视为长期存续、经验感知且可测试资产的重要性。

报告嘉宾:


林华伟,美国罗切斯特理工学院计算与信息科学博士候选人,师从 Prof. Weijie Zhao。他的研究方向涵盖智能体、大语言模型、生成式人工智能和人工智能安全,重点关注训练数据影响力评估、机器遗忘与多模态推理。他曾在字节跳动和亚马逊担任研究实习生,从事开放世界智能体、智能体协同推理以及大语言模型自我改进等研究。他在 ICLR、CVPR、KDD、ACL、NAACL、SIGIR 等人工智能与数据挖掘领域的重要会议上发表多篇论文,并多次受邀担任 NeurIPS、ICML、ICLR、KDD、AAAI 和 ACL Rolling Review 等会议审稿人。
 
电脑端观看地址


更多热门活动:

内容中包含的图片若涉及版权问题,请及时与我们联系删除