近日,北航-澜舟AI联合实验室合作研究成果《WebWorld: The Browser as a World Model for Self-Improving Web Code》被国际自然语言处理顶级会议 EMNLP 2026 录用。
论文提出让浏览器作为网页代码自我改进的“世界模型”:由视觉语言模型(Visual Language Model,VLM)提出修改假设,浏览器通过真实交互复验,只有被验证有效的改进才会进入训练数据。
EMNLP(Conference on Empirical Methods in Natural Language Processing)由国际计算语言学会(ACL)旗下 SIGDAT 组织,每年举办一届,是自然语言处理领域最具影响力的国际会议之一。本届 EMNLP 2026 将于 10 月 24-29 日在匈牙利布达佩斯举行。
论文信息

论文标题:WebWorld: The Browser as a World Model for Self-Improving Web Code
作者:Jiajun Wu, Jian Yang, Yaxin Du, Wei Zhang, Haowen Wang, Junhang Cheng, Yuxuan Zhang, Tuney Zheng, Xianglong Liu, Ming Zhou
机构:Beihang University, IQuest Research, Shanghai Jiao Tong University, Langboat
论文链接:https://arxiv.org/pdf/2608.30530
数据:https://huggingface.co/collections/Multilingual-Multimodal-NLP/webworld
大模型已经可以根据一句话生成完整网页,但“第一眼看起来不错”和“真正能用”之间,仍然隔着一道很现实的鸿沟:按钮可能点不动,游戏可能不响应键盘,修好了一个区域却悄悄弄坏了另一个已经可用的控件。
在论文《WebWorld: The Browser as a World Model for Self-Improving Web Code》 中,来自 Beihang University、IQuest Research、Shanghai Jiao Tong University 和 Langboat(澜舟科技)的研究团队提出 WebWorld:不再让视觉语言模型同时扮演“提出修改”和“判断修改”的双重角色,而是把浏览器作为网页代码的可执行世界模型,让浏览器通过真实交互复验每一次修改,并只把被验证过的改进用于后续训练。
一句话概括:VLM 负责提出假设,浏览器负责给证据;只有能被浏览器复现并证明有效的网页修复,才会进入训练数据。
现有网页代码自我改进流程常见做法是:让模型看截图、提出问题、重写代码,再由模型判断页面是否更好。这个闭环看似自然,但有一个结构性缺陷:提出修复的人,也是裁判。
这会带来三个典型问题:
截图变漂亮了,但页面交互坏了。
当前问题被修好了,但之前已经正常工作的功能被破坏了。
模型更容易奖励“视觉上合理”的结果,而不是“真实可执行、可复验”的结果。
WebWorld 的核心观察是:浏览器本身就是一个现成的世界模型。它可以确定性地执行 HTML 页面,模拟点击、输入、拖拽、键盘操作,观察 DOM、控制台、截图和状态变化。与其训练一个新的世界模型,不如让 VLM 与浏览器这个真实执行环境协作。
WebWorld 将一次网页自我改进拆成三个关键机制:
Interaction Contract:把“感觉哪里不对”变成可检查目标
VLM 不直接给出“页面更好了”这样的主观判断,而是基于浏览器观测结果提出结构化批评。系统会把这份批评编译成一个交互契约,包括:
要修复的目标问题;
浏览器需要重放的动作序列;
修复后必须满足的目标谓词;
已经验证过、后续必须保留的能力;
影响范围和证据路径。
这样,修复不再是泛泛地“优化一下页面”,而是变成浏览器可以复验的明确任务。
2. Acceptance Certificate:浏览器重新执行,决定是否发证
候选补丁生成后,浏览器会重新运行页面并执行契约中的交互。如果修复确实达成目标,同时没有破坏之前已验证的能力,系统才会发出 acceptance certificate。
这个证书记录了修复目标、代码差异、证明级别、动作轨迹、截图、探针结果等证据。换句话说,WebWorld 接受的不是“看起来更好的页面”,而是“有执行证据支撑的状态转移”。
3. Quality Ratchet:只让被验证的改进进入训练
通过证书的修复会成为新的基线,并进入 SFT 训练数据;未通过的尝试会作为诊断信息反馈给下一轮修复,但不会污染训练集。
这让整个系统像一个单向棘轮:每一步都必须在新目标上取得进展,同时保留已有能力。修复可以探索,但训练数据必须干净。
研究团队构建了约 60K 个候选修复,经过浏览器复验后得到 42,860 个认证转移,并从中采样 32,800 条作为 WebWorld SFT 语料。
在 HTMLBench-400 和 MiniAppBench-Val 上,WebWorld 展现出稳定提升:
WebWorld-27B 在 HTMLBench-400 上达到 52.7,相比 Raw-27B 提升 5.3 分。
WebWorld-27B 的 TC Pass 达到 43.2%,相比 Raw-27B 提升 9.7 个百分点。
在 MiniAppBench-Val 上,WebWorld-27B 达到 85.5,相比 Raw-27B 提升 14.9 分。
在论文报告的交互式 HTML 生成设置中,WebWorld-27B 的 HTMLBench 表现超过 Kimi-K2.6 和 GPT-5.4,MiniAppBench-Val 表现达到同一梯队。
更关键的是消融实验。以 9B 模型为例:
这说明收益并不只是来自更多数据或更强提示,而是来自 browser-backed admission:只有浏览器复验通过的转移,才足够可靠地成为训练监督。
WebWorld 的价值在于把网页质量从静态截图推进到可执行证据。论文分析显示,验证式修复可以降低多类具体 GUI 失败,包括控制台错误、玩法失败、目标缺失、无响应控件、键盘失效、状态漂移和布局问题。
这对于前端生成尤其重要。一个页面可能视觉完整,却缺少真实状态变化;一个按钮可能样式正确,却没有事件处理;一个游戏界面可能很漂亮,却没有可玩的循环。WebWorld 要解决的正是这些“截图看不出来,但用户马上会遇到”的问题。
WebWorld 当前聚焦单文件交互式 HTML artifact。在更复杂的多文件项目、框架工程和真实部署环境中,还需要处理依赖复现、项目组织、脚手架协作等额外变量。
同时,浏览器只有在目标可以被执行和复验时才是可靠裁判。审美偏好、品牌一致性、可访问性细节等更主观或更细腻的问题,仍可能需要 VLM 或人工评估补充。因此,WebWorld 并不是让模型批评完全无误,而是让可执行行为的验收更可靠。
WebWorld 给网页代码自我改进提供了一个清晰方向:不要让模型只在截图空间里自问自答,而要把浏览器引入闭环,作为模型无法“糊弄”的执行裁判。
对于未来的网页生成、UI agent 和交互式 artifact 训练,这一点尤其关键:高质量监督不应来自看起来不错的最终页面,而应来自可复验、可追溯、可保留既有能力的执行轨迹。
WebWorld 成果背后是一段正在深化的合作:澜舟科技与北航共建的 AI 联合实验室今年 8 月正式对外宣布,由澜舟科技创始人周明博士与北航计算机学院的杨健博士共同领衔,主攻递归自进化、代码智能、预测模型三个方向。
WebWorld 让浏览器当"裁判"、只把验证有效的修复送进训练数据——这正是"自进化"方向最具代表性的题目之一。
自联合实验室成立以来,澜舟与北航在代码大模型的研究上硕果累累,InCoder-32B 登顶 SWE-bench,LoopCoder v2 让 7B 小模型"多想一遍"就追上超大模型。而 WebWorld 走得更远——它不再只追求"生成更好的代码",而是让模型自己发现问题、自己修改,再由浏览器复验修复是否真的有效,把"递归自进化(Recursive Self-Improvement,RSI)"从实验室的主攻方向变成了入选 EMNLP 的可验证成果。
高校的科研深度,加上企业的工程场景,往往能做出单打独斗做不出来的东西。
期待联合实验室的下一个成果。
关注「澜舟科技」公众号,回复【0903】可查看论文
更多推荐阅读👇
立即体验
LangClaw企业可信智能体操作系统现已开放体验,快来创建你的数字员工吧。
👉 扫码/进入官网申请产品试用:

https://www.langboat.com/portal/langclaw
👉扫码加入Agent用户群

商务合作:bd@langboat.com

关于澜舟科技
ABOUT
北京澜舟科技有限公司成立于2021年6月,孵化于创新工场,是中国最早以大模型为创业目标的企业之一,深耕认知智能领域,以全栈自研的孟子大模型为核心,基于可信智能体核心技术体系,构建起覆盖 LangClaw 企业智能体OS及智库、智会、智搭等产品的完整体系。
往期文章推荐
”
澜舟科技官方网站
澜舟科技公众号

期待您的关注!
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢