一、简要介绍

本文演示了一种学习高度语义的图像表示的方法,而不依赖于手工制作的数据增强。论文介绍了基于图像的联合嵌入预测架构(I-JEPA),这是一种用于从图像中进行自监督学习的非生成性方法。I-JEPA背后的idea很简单:从单个上下文块中,预测同一图像中不同目标块的表示。指导I-JEPA产生语义表示的核心设计选择是掩膜策略;具体来说,(a)预测图像中的几个目标块,(b)采样足够大规模的样本目标块(占图像的15%-20%),(c)使用足够丰富的(空间分布)上下文块,是至关重要的。根据经验,当与视觉transformer结合时,论文发现I-JEPA具有高度的可缩放性。例如,论文在ImageNet上使用32个A</

本文介绍了一种名为I-JEPA的自监督学习方法,通过在表示空间中预测目标块,无需依赖手工数据增强,有效提升了图像表示的语义水平。实验表明I-JEPA在各类视觉任务中表现出色,且具有高度可扩展性。
最低0.47元/天 解锁文章
486

被折叠的 条评论
为什么被折叠?



