7 月 15 日,明星创业公司 Thinking Machines Lab(TML)发布了他们的开放权重模型 Inkling,这是他们成立一年后发布的首款针对持续学习场景的模型。

也是本月,图灵奖得主、强化学习之父 Richard Sutton 下场创业,方向是持续学习 Agent。

「持续学习」已经成了硅谷当下的热门创业赛道。国内这边,也有一些新的创业公司,开始瞄准这个方向,并且推出了一些产品。

本月 21 日,专注于强化学习的实验室 Mind Lab 发布了基于 GLM 5.2 进行后训练的模型 Macaron V1,使用混合 LoRA 架构,原生支持持续学习。

持续学习这件事,也开始在国内成为了一门「显学」赛道。

⬆️关注 Founder Park,最及时最干货的创业分享


Founder Park 正在持续寻找值得被看见的 AI 团队与项目。

我们将通过「AI 产品市集」、内容报道、社群分发等方式,帮你触达早期用户、获得真实反馈,以及建立关键连接。

如果你正在做 AI 相关的事,欢迎和我们聊聊。 
图片



01 

持续学习:让模型用得越多越好用

从 RLHF、RLVR 到思维链再到 Agent,过去两年,模型的智能在持续提升,思维链和推理扩展让模型学会了「慢思考」,Agent 框架则通过工具调用、规划和记忆,把模型能处理的任务范围又往外推了一层。

但有一个问题是,这些能力提升要么发生在部署之前(pre-training、post-training),要么在运行时靠外部机制补充(prompt、memory、RAG、harness)。模型本身的参数,训完就不会有变动了。

Mind Lab 在官方博客中把这些外部补充手段统称为「提示词空间的迭代」——prompt、memory、RAG、skill、harness,本质上都是在参数不变的前提下,通过调整上下文和执行流程来利用经验。这条路径走出了今天几乎所有的 Agent 产品,但它有一个结构性约束:经验保存在模型之外,每次使用时必须被重新读取、重新理解 随着经验积累,上下文越来越长,记忆可能相互冲突,规则和检查不断叠加,执行成本持续上升。

更麻烦的是,把信息放进 context 不等于模型掌握了其中的规律。模型缺某项能力时,再多的 prompt 也补不上。

所谓持续学习,走的是另一条路:「参数空间的迭代」。把经验直接写进模型的可训练状态,模型面对相似任务时直接给出更合适的判断,不用每次从上下文重新读一遍。一个 Coding Agent 反复接触的代码规范,一个个人助理逐渐确认的用户偏好,都可以通过训练沉淀成稳定的行为。Mind Lab 管这个叫构建「经验智能机器」——模型的能力不再停在训练结束的那一刻,用得越多,越好用。

两条路径不是替代关系。事实可以继续放在 context、memory 和 RAG 里,验证过的操作流程可以存成 skill 和工具,反复出现、相对稳定的行为变化,才适合写进可训练参数。

参数空间的迭代本身不新鲜,SFT 和 RLHF 就是。但过去的后训练,数据、奖励、流程,全都靠人。持续学习要做的,是让训练这件事在部署之后自己转起来:模型行动,获得经验,找到信号,写回参数。

目前还没有团队把这个循环完全跑通,但一些新的尝试开始得到了验证。


02 

怎么做持续学习,硅谷有了不少新的尝试

2025 年 4 月,Sutton 和 AlphaGo 前首席研究员 David Silver 联合发表《Welcome to the Era of Experience》,判断 AI 的下一阶段能力,主要不会再来自继续吸收人类已有的数据,而是来自 Agent 自己在真实环境中行动、获取反馈、持续学习。Sutton 把这称为「经验时代」,和之前靠人类数据喂出来的「数据时代」做了区分。

2026 年 7 月,Sutton 亲自下场创业,创办 Oak Lab,从目前透露的信息看,方向正是低成本、高效持续学习的万亿参数 Agent 模型。

Thinking Machines Lab(TML)也在验证同一条路线。这家公司 2025 年 2 月由 Mira Murati 创办,五个月后完成约 20 亿美元融资,估值 120 亿美元,投资方包括 a16z、Nvidia 和 AMD。主打产品 Tinker 是面向研究者的模型微调 API,采用 LoRA 高效微调,支持 Qwen、DeepSeek、Kimi 等一系列开源模型,普林斯顿、斯坦福、伯克利的团队已经在用。

TML 的首席科学家 John Schulman(OpenAI 联合创始人、PPO 算法发明者)在 2025 年 10 月发表的《LoRA Without Regret》中给出了一个关键结论:在大多数后训练场景下,LoRA 的样本效率和最终性能与全参数微调完全一致。他把这种情况称为「低遗憾区间」(low-regret regime),发现它覆盖了绝大多数实际的后训练任务。在强化学习场景中,即便是 rank-1 的 LoRA(最小的配置)也能匹配全参数微调的效果。

这篇论文扭转了行业对 LoRA 的认知:效果几乎无损,还能独立训练、独立部署、随时回滚。持续学习在工程上能成立,前提就是这个。

7 月 15 日,TML 交出了自己的第一个模型 Inkling:975B 总参数的 MoE 开放权重模型,激活 41B,原生支持文本、图像、音频,上下文最长 100 万 token。官方说得很坦率,Inkling 不是今天最强的模型,即使在开源模型里也不是;它的定位是一个适合微调定制的基座,发布当天就能在 Tinker 上训。

LoRA 推动者不只有研究机构。Fireworks AI(估值 175 亿美元)已经能在一个基座模型上托管数百个 LoRA,根据每次请求动态选择 adapter;Together AI(刚完成 8 亿美元 C 轮,估值 83 亿美元)也将 LoRA 设为默认微调方式。

还有一些收购案例。过去一年,三家后训练方向的创业公司先后被大厂吃掉:Predibase(Google、Uber AI 团队成员创办,开发了开源 LoRA 服务框架 LoRAX)2025 年 7 月被 Rubrik 收购;OpenPipe(把生产日志自动转成微调数据)2025 年 9 月被 CoreWeave 收购;Adaptive ML(强化学习后训练的 RLOps 平台,Index Ventures、ICONIQ 投资)2026 年 6 月被 Datadog 收购。大厂的意图很明确,后训练是基础设施级的能力,值得买下来。

「基础模型 + 大量 LoRA + 持续学习和切换」的产业链正在形成。


03 

Mind Lab:把 LoRA 做成持续学习的入口

Mind Lab 成立于 2025 年 10 月,是心洲科技(Mindverse)旗下的前沿研究实验室。今年年初,Mindverse 完成累计 5000 万美元 A 轮融资,美团领投,元禾璞华、韶音、变量资本跟投,历史股东包括蚂蚁、源一、红杉中国、真格、高榕等。

早在 2023 年,Mind Lab 创始人 Andrew Chen 就与 Karthik Narasimhan(GPT-1 作者之一)、姚顺雨合作发表了 FireAct,第一篇用参数学习提升 Agent 能力的工作:把 Agent 的任务轨迹直接写进模型参数,减少对 few-shot 示例的依赖,单次执行时间从 9.0 秒降到 2.7 秒。

Mindverse 在 2025 年发布的 C 端产品 Macaron 是一个个人 AI 助理,要服务千人千面的用户,团队实践下来的体会是:光靠 prompt 和记忆做不到,个性化最终要落到模型层面。

Schulman 的论文认为 LoRA 在后训练中不打折扣,但持续学习的要求更苛刻:万亿参数的超大规模上还站得住吗?学习单元能压到多小?Mind Lab 其实比 TML 更早拿到了类似的结论。团队说,2025 年 9 月他们在大规模 MoE 模型上验证了 LoRA 强化学习无损,「做出这个结果时我们第一反应是怀疑自己。直到 TML 随后发了《LoRA Without Regret》,结论完全一致,我们反而踏实了。」

Mind Lab 的论文《On the Scaling of PEFT》把这个结论推得更远。在万亿参数的稀疏 MoE 模型(基于 Kimi K2,总参数 1.04 万亿,激活 326 亿)上,LoRA 强化学习跑通了,算力压到全参数微调的约 10%,训练曲线保持稳定。压缩极限也比预期更低:轻量适配模块可以压到 rank-1,每层只保留一个可调方向,仍然稳定可靠。

意料之外的发现是「群体智能」。在一组控制实验中,从相同的 Qwen3-30B 出发,保持训练目标和方法一致,只改变数据顺序和 masking,训出一批不同的 adapter。单个 adapter 在 AIME24 上的准确率是 36.44%,198 个不同 adapter 多数投票后提升到 48.67%——从同一个 adapter 重复采样,只能到 43.78%。不同学习轨迹带来的差异,包含超出普通采样的互补性。这个发现让团队很兴奋:「挂上去的模型越多,整体智能稳定往上走,差不多是一个自然对数 scale 的线性提升。」模型数量本身成了一个新的 scaling 维度。

Mind Lab 由此给了 LoRA 一个新定位:「持久的本地状态」。共享的基础模型管通用能力,adapter 管每个具体实例的个性化行为。


04 

Macaron V1:2M 上下文,

首个基于 GLM-5.2 完成后训练的模型

过去一年,Mind Lab 发布了不少成果:2025 年 12 月在 Kimi K2 上的万亿参数验证,2026 年 1 月的后训练基础设施 MinT,6 月的 Macaron-V1-Preview,再到 7 月的长上下文方案 LongStraw 和 Agent RL 训练框架 MindForge。Macaron V1 是这些成果的集中呈现。

V1 采用 Mixture-of-LoRA(MoL)架构:在冻结的 GLM-5.2 基座模型(744B 参数)上搭载四个 1B 的 LoRA 专家,分别负责对话(Chat)、智能体(Agent)、编程(Coding)和生成式 UI(UI4A)。新能力以插件式 LoRA 加入,不动摇已有知识,不同来源的专家可以在同一个基座上组合和路由。需要模型学新东西时,训一个新 LoRA 插进去就行,不用碰整个模型。

在大规模基座上做强化学习本身就是高门槛的事。30B 参数的模型做强化学习相对容易,参数量级到千亿、万亿,训练难度指数级上升。强化学习最麻烦的问题之一是训推不一致,训练和推理的精度偏差会漂移累积,导致结果无法收敛;万亿参数的 MoE 模型分布在多张 GPU 上,要保证不同切片之间的通信和并行计算全部以同样的精度高度对齐。据 Mind Lab 称,目前全球能在万亿参数规模上同时跑数百个 LoRA 强化学习训练的团队,只有他们和 TML

V1 在个人生活与生成式 UI 任务上超过或持平 Opus 4.8、GPT 5.5 等前沿基线,

编程任务与前沿水平接近。

国内的开源生态也对 Mind Lab 有不少助力。V1 旗舰版 Venti 基于 GLM-5.2 构建,原生支持 2M 超长上下文。轻量版 Tall(35B 级)基于通义千问构建,此前的验证实验用的是 Kimi K2。不需要从头训练基座,直接站在国内头部基模公司的肩膀上做后训练。

使用 Macaron v1 生成的喜茶风格的交互页面。

目前官方 API 已开放体验:https://mintcn.macaron.xin/

配套的 macaron-artifacts 插件可以在 Claude Code 里直接看到模型渲染的生成式 UI。


05 

以前卖的是 Token,未来卖的是学习能力

官方介绍说,Mind Lab 的商业化也从 7 月开始,两周内实现了 1000 万美金 ARR。

而且交付的,并不是单纯的推理能力和模型算力,是让模型在客户场景中的持续成长。科学研究、复杂工业、高知识密度行业都有类似的困境,通用模型很难天然理解所有任务,客户又未必愿意把核心数据交给基模公司重新训练。持续学习提供了第三条路:在通用模型基础上,用轻量训练构建专属能力,数据和模型版本都由客户自己管理。

而 LoRA 的成本弹性让这件事在商业上站得住,团队的说法是,最小的个人级 LoRA「用一个人一个月的数据去训,可能就是几十美金」;最大的、追平全参数效果的企业级 LoRA,也不过几万到几十万美金。目前公司已与国内的头部手机厂商和 AI 硬件公司建立了合作。

Mind Lab 内部有一句话:「我们希望训练模型这件事,最后能像调用模型一样简单。会用 Token,就能训 Token。」

离这个愿景还有距离。早期合作仍需要公司与客户共同定义训练目标,Mind Lab 正在尝试把训练脚本、数据处理、评估与交付逐步交给 Agent 完成,目标是让持续学习成为可以规模化使用的模型能力,不靠堆售前和定制人力,真正实现模型和 Agent 能力的自进化。

而在 Inkling 的发布演示里,TML 也让模型自己用 Tinker 写微调任务、跑训练、换上新权重,全程没有人插手。殊途同归。

方向很明确,但技术今天还没收敛。

从经验中找到可靠的学习信号仍是未解问题,现实反馈延迟、模糊、难以归因,模型的自我反思可能出错;持续更新还带来了稳定性问题,新经验可能覆盖旧能力,学什么、不学什么,本身就需要判断力。正如梁文锋所说,目前「全世界都还没有找到好的方法」。

但基模公司之外,一批专门做后训练、帮模型和 Agent 变强的公司正在冒出来,Mind Lab、TML、Oak Lab 走的都是这条路。基座模型管通用智能,至于怎么让模型在具体场景里持续变强,这活儿基模公司不一定自己干,也不一定干得最好。

图片

图片
更多阅读

真实工作流,正在成为下一代训练数据

AI-Native 组织落地和 FDE 到底怎么做,我们跟五位一线创业者聊了聊

对话 Nile:如果 To Agent 是未来,今天就应该去搭建新的电商基建了

万字复盘:从模型到可用Agent,WorkBuddy的Harness工程是怎么做的?

转载原创文章请添加微信:founderparker

内容中包含的图片若涉及版权问题,请及时与我们联系删除