- 简介最近几年,用户界面(UI)理解已成为一个越来越受欢迎的话题。到目前为止,人们主要关注于网络和移动应用程序方面。本文介绍了更难的计算机UI理解任务。为了促进这一领域的研究,我们生成了一个数据集,其中包含一组视频,每个视频显示用户执行一系列操作的桌面内容。我们还提出了一个框架,由一个合成样本生成管道和一个对比学习方法组成,以对视频中的图像进行分类。我们利用图像特征的自然条件、树状关系来同时处理多个部分任务,从而规范表示学习。实验结果表明,所提出的框架在细粒度UI分类中优于以前提出的分层多标签对比损失。
-
- 图表
- 解决问题本文尝试解决计算机UI理解的难题,即通过视频数据集中的桌面图像来识别用户的操作行为。
- 关键思路本文提出了一个框架,包括合成样本生成管道和对比学习方法,以识别视频中的UI图像。该框架利用图像特征的自然条件树状关系,同时处理多个部分任务,从而规范了表示的学习。
- 其它亮点本文提出的框架在细粒度UI分类方面优于以前提出的分层多标签对比损失。作者还提供了一个数据集和开源代码来促进相关研究。
- 最近的相关研究包括“基于卷积神经网络的UI元素识别”和“基于强化学习的UI自动测试”。


提问交流