报告主题:ODEWorld

A Continuous Predictive Architecture via Physical-Time Flow

报告日期:
8月14日(周五) 10:30-11:30
报告要点:

让机器人把一只虾夹起来,再放进锅里。

真正困难的,可能不是认出虾,也不是找到锅,而是把握夹爪闭合的那个瞬间:早一点,夹爪会落空;晚一点,虾可能已经被推走。夹住之后,机械臂还要连续调整力度、方向和速度。整个过程没有暂停键,也不会等摄像头拍完「下一帧」再继续。但许多视觉世界模型认识时间的方式,恰恰来自这些被摄像头截取的画面。它们看到第1帧、第2帧、第3帧,并学习如何从一张图跳到下一张图。至于两帧之间发生了什么、换一种帧率后该如何预测,甚至某个关键瞬间缺失后如何还原,模型通常没有一条可以直接查询的连续轨迹。

问题也由此变得具体:如果机器人对世界的理解只存在于一格格画面里,它要怎样抓住发生在两帧之间的那一瞬间?来自清华大学智能产业研究院(AIR)与UC Berkeley BAIR的研究团队提出了ODEWorld——全球首个连续时间具身世界模型。它不再只问「下一帧是什么」,而是直接学习世界在每个时刻朝什么方向、以多快的速度变化,并由此还原一条随真实物理时间连续演化的潜空间轨迹

论文链接:
https://arxiv.org/abs/2607.27924v1

议题详情:

在我们所处的物理世界中,空间与时间本质上是连续的。然而,当前用于世界建模的机器学习范式大多局限于离散时间预测,因而难以高效地刻画物理世界的动态演化过程。为此,我们提出“物理时间流”(Physical-Time Flow)——一种全新方法,旨在学习一个作用于真实物理时间尺度上的连续潜在速度场,序列数据的底层动力学被参数化为一个常微分方程(ODE),并嵌入到结构良好、语义清晰的表征空间之中。在压缩后的潜在空间中,借助ODE求解器进行时间维度上的积分运算。

基于PT-Flow,我们进一步构建了ODEWorld一种兼具高效性与通用性的连续时间潜在世界模型。该模型通过提取随时间变化的特征,并在动力学表征空间及潜在速度场两个层面同时施加ODE约束,有效缓解了潜空间世界模型领域长期存在的“表征坍缩”问题;这亦使得模型即使在长时域预测后,仍能实现高质量的图像重建。此外,得益于其固有的连续性,ODEWorld支持任意时间分辨率的预测,甚至可实现反向时间推演,而这是绝大多数离散时间模型无法做到的。ODEWorld还能输出丰富、面向规划任务的信息,从而显著促进下游策略学习。大量实验表明,ODEWorld成功实现了面向规划的动力学抽象能力与视觉真实感之间的统一,在视频生成与机器人控制两大任务上均展现出卓越性能。

报告嘉宾:

牛浩懿,伯克利BAIR机器人PhD,师从Koushil Sreenath教授。本硕毕业于清华大学自动化系,曾于清华大学智能产业研究院詹仙园老师组实习,主要研究方向为具身强化学习,策略快速适应,以及世界模型。
 
电脑端观看地址


更多热门活动:

内容中包含的图片若涉及版权问题,请及时与我们联系删除