文婷 发自 凹非寺
量子位 | 公众号 QbitAI
好家伙,斯坦福直接把AI圈最火的“自进化AI”开成课了!

消息一出,这门课迅速被奉为Agent学习的新晋资源宝库,惊叹声刷屏:
质量太惊艳了!
又一座金矿,感谢公开!
女士们先生们,斯坦福刚刚发布了一部杰作!

还有的网友感叹:
至少我们还有斯坦福,谢谢。

太能理解大家的兴奋了,我看完整堂课的感受也是两个字:“绝了!”
当行业还在争论Agent能不能自己反思、自己纠错、甚至越用越聪明时,斯坦福的两位实战派教授Dr.Aakanksha Chowdhery和Azalia Mirhoseini已经把这个问题拆成了一门完整的教学课程CS329A《自我进化AI智能体》(Self-Improving AI Agents):
在更大规模的模型中,思维链会表现得更好。 用“三步法”即可养成一个能听懂话的AI。 可以像让猴子敲出莎士比亚一样,简单粗暴地提升AI能力。 通过堆尝试次数,小模型也有机会触达前沿大模型能力的天花板。 可以让模型形成一套“生成答案-验证结果-筛选经验-继续训练”循环,以便持续实现自我检查和进化。 生成大量内容并不稀奇,可靠反馈才是闭环能否跑起来的关键。 智能体的执行力越强,验证就越重要。
全程高密度输出,知识点密到需要暂停消化,但每跟上一段都觉得“这时间花得值爆了”!

我们火速把第一讲的内容梳理了出来,快来围观吧!
:
为什么要扩大模型规模?
故事还要从大模型最熟悉的成长方式说起。
过去几年,AI行业验证出一条朴素又昂贵的规律:随着计算量、训练数据和模型参数规模增加,测试损失通常会下降,模型在自然语言和推理等基准上的表现也会提高。
从15亿参数的GPT-2,到1750亿参数的GPT-3,再到5400亿参数的PaLM,大模型的体量一路膨胀,背后正是这条缩放定律。
△缩放定律:计算量、数据和参数规模增加时,模型损失通常下降
后来,随着模型规模逐渐扩大到一定程度后,模型开始展现出一定的零样本学习和少样本学习能力——只要给大模型一句说明,或者展示几个例子,它就能把从未见过的内容按要求处理。
△为什么继续扩大LLM:性能、少样本学习与能力涌现
△零样本学习与少样本学习示例
与此同时,模型思维链的能力也开始显现。你只把题目和答案丢给它,它可能学不会;但你如果能把中间的推导过程也一并奉上,那它处理新问题的成功率就会大大提高。
能力涌现,也就是从这里开始变得具体。
△思维链提示的基础示例
△思维链能在更大规模的模型中表现更好
模型规模的扩大,确实让它掌握了语言规律与海量的世界知识,解决了“它会不会”的问题。
但这时候的模型依然揣摩不明白用户的真实意图,也无法自主判断回答是否准确、安全和有用。
于是,行业开始用三步法给大模型补课。
能听懂人话的AI该怎样养成?
教授认为,ChatGPT现象级的用户增长与能力跃迁背后,并非单纯依赖参数规模的堆叠,而是源于以下三个关键训练阶段的层层递进:
1、预训练:
模型通过海量文本学习语言结构与世界知识,掌握“预测下一个Token”的能力。但此时的它,更像一位饱读诗书却不懂沟通的学者。
2、高质量数据与指令微调:
研究人员一方面用清洗后的高质量语料为模型“提纯”知识,另一方面将“指令-问题-回答”构造成训练样本,教会模型识别任务格式,真正理解用户意图。
△高质量数据微调:从预训练模型到能力提升
△指令微调:用指令、问题和答案构成监督样本
3、RLHF(基于人类反馈的强化学习):
研究人员先让模型对同一问题生成多个回答,再由相关领域的专家评选出更准确、有用且安全的版本;随后,这些偏好数据会被用于训练“奖励模型”,并由其引导大模型持续优化输出。
△以人类偏好训练模型的整体流程
△RLHF:从偏好比较到奖励模型,再用奖励优化生成
至此,大模型完成了第一次身份转变;它不再只会机械地补全文字,而是真正“听懂”了人话,让对话有了温度与默契。
△ChatGPT之后的关键技术节点与用户增长对比
如何简单粗暴地提升AI能力?
讲到如何最简单粗暴地提升AI能力时,教授有点损地打了个比方:
其实就像让猴子不停地敲打字机,只要尝试足够多次,总有机会敲出莎士比亚。
△Large Language Monkeys:重复采样、验证与选择
这恰是推理时扩展的核心思路(Test-Time Compute Scaling):不修改模型参数,不换模型,只是在回答时多花算力——通过让模型生成多个候选方案并择优筛选,以换取更高的回答质量。
一次不行,那就来100次;100次不行,那就来10000次!直到成功为止。
△从预训练、后训练到推理时扩展:能力提升的新轴
论文Large Language Monkeys实验里有个让人大跌眼镜的发现:一个只有20亿参数的小模型Gemma-2B,做编程题单次尝试的成功率只有0.02%——基本等于瞎蒙。
但神奇的是,让它连续答1万次后,成功率竟然飙到了7.1%,暴涨了300多倍!
更夸张的是在真实的软件工程测试(SWE-bench)中,DeepSeek-Coder-V2只要多试250次,单次尝试的解决率就能从15.9%跳到56%,直接超越了当时单次作答43%的前沿水平。
△重复采样后的模型能力对比
△推理时计算扩展与准确率提升的关系
所以说,通过这种“堆尝试次数”的办法,小模型说不定还真有机会触摸到大模型能力的天花板。
有些事是没有标准答案的
对于编程任务,验证器可以是单元测试。
代码跑得通、能够通过全部测试,就说明答案大概率正确。数学题、形式化证明等领域,也可以根据确定的答案或规则进行验证。
但如果任务是写一篇文章、或是制定一份商业战略,事情就麻烦了。

这些问题往往没有唯一答案,多数投票未必能选出最佳结果,奖励模型和LLM评审器也可能判断失误。
Large Language Monkeys论文同样发现,在缺少自动验证器的领域,常见的多数投票和奖励模型方法,在候选答案增加到数百个后便会遭遇瓶颈。
所以说,让模型多答几次不难。难的是,我们究竟凭什么相信其中一个答案。

让AI判断哪些答案更好行不行?
牛角尖钻不动;那就换个角度看看。
如果只需要让模型判断哪些答案更好,事情就开始变得有意思了。

模型可以先生成大量候选方案,再用测试、环境反馈或奖励模型筛选,最后把其中高质量的解题过程重新放回训练数据。
由此,模型便可以形成一套“生成答案-验证结果-筛选经验-继续训练”的循环。
这正是斯坦福课程所说的自我改进核心方向之一:在训练和工作流层面,让AI利用自己产生的数据与外部反馈,逐步改善后续表现。
推理模型已经展现出这种趋势。
△推理模型的典型步骤:分析、分解、评估、纠错与备选方案
遇到复杂任务时,它不再急着一次给出结果,而是先分析问题、拆分步骤、选择工具,再根据反馈检查方案。
代码写错了,就运行测试、读取报错,再继续修改;
搜索结果不够,就更换关键词;
一条路径走不通,就回溯并尝试另一种方案。
△推理模型的慢思考机制与案例
△推理模型在部分推理基准上的能力对比
过去的大模型像考试结束就立刻交卷;而现在的推理模型则开始学会检查答案。
如果高质量的推理轨迹还能回流到训练阶段,它便拥有了一本不断扩充的错题本。

不过,课上没有把这件事说得太满。
模型的提升究竟来自强化学习、更多高质量数据,还是验证机制筛出的优质样本,目前仍没有一个适用于所有场景的统一答案。模型也未必能真的像人类一样理解了自己的错误。
但从工程角度来看,只要下一次成功率提高,这个循环就已经产生了价值。
智能体工作流该怎么搭?
课上指出,智能体的核心能力包括规划、推理、工具使用与自我改进。
△智能体的核心能力
一套典型的智能体工作流通常包括LLM、工具、验证器、评审器和编排器:
LLM负责理解和生成;
工具负责实际行动;
验证器判断结果是否正确;
评审器提出改进意见;
编排器则负责像项目经理一样安排不同环节的先后顺序。
△智能体工作流及其基本编排方式
记忆是智能体保持任务连贯性的基石,非常重要,不可或缺。
但真正决定其上限的,仍是规划、多步推理与自我验证能力。
生成大量内容并不稀奇,可靠反馈才是闭环能否跑起来的关键。
△编程智能体通过终端、文件操作和执行结果形成反馈闭环
验证可以跳过吗?
不过需要明确的一点是:AI可以扩大搜索和头脑风暴的范围,但我们却不能因为它报告写得完整,就跳过事实核验。
AI可以提出实验方案,但不能代替真实实验和同行评审。
毕竟,模型依然会一本正经地胡说八道。尤其在创意写作这类缺少标准答案的任务里,什么算“更好”、哪里需要修改,本身就很难判断。
所以,智能体的执行力越强,验证就越重要。否则,它只会更利索地办错事。

另外,课上还指出,智能体真正的自我改进,应该是它不仅知道自己错了,还能找到错在哪里,下一次不再原地摔倒。
当AI拥有这项能力,它才不只是一个等待指令的工具,而是真正开始成为一个能够在工作中持续学习迭代的智能体。
One More Thing
两位教授可不是纯学院派哦!
一位亲手把PaLM从0喂到540B,一位更是在Google Brain、Anthropic、DeepMind三大厂连续通关。
她们讲的哪里是理论啊,分明是带着硝烟味的实战通关秘籍!
其中,Dr.Aakanksha Chowdhery既是斯坦福博士,也是全球为数不多的、曾端到端主导过前沿模型训练的研究者之一,涵盖dense架构与MoE架构。

△Dr. Aakanksha Chowdhery
她在Google任职期间,曾领导了540B PaLM model训练,并推动了多代Gemini MoE模型的预训练与规模扩展;此外,她还为PaLM-E、Med-PaLM以及支撑谷歌大模型体系的Pathways基础设施贡献了核心组件。
Azalia Mirhoseini则在斯坦福领导着Scaling Intelligence实验室,同时她也是前沿实验室Ricursive Intelligence的联合创始人。

△Azalia Mirhoseini
此前,她曾在多个工业界AI实验室工作多年,包括Google Brain、Anthropic和Google DeepMind,并参与了Claude和Gemini的研发。
此外,她也曾参与MoE架构研究,并共同开发用于芯片布局优化的AlphaChip。
也就是说,这门课的一位讲师亲手把大模型做大,另一位则长期研究怎样让模型在推理、系统和硬件层面继续进化。
由她们来拆解“AI如何自我改进”,确实很对题。
目前这门课才刚刚开讲,感兴趣的小伙伴们可以蹲一波后续课程更新~
参考链接:
[1]https://www.youtube.com/watch?v=6YnLB0XbTnI
[2]https://cs329a.stanford.edu/
[3]https://arxiv.org/abs/2407.21787
[4]https://github.com/ScalingIntelligence/large_language_monkeys
[5]https://openai.com/zh-Hans-CN/global-affairs/new-economic-analysis/
[6]https://www.achowdhery.com/
[7]https://profiles.stanford.edu/aakanksha-chowdhery
[8]https://profiles.stanford.edu/azalia-mirhoseini
[9]https://www.azaliamirhoseini.com/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
🌟 点亮星标 🌟
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢