相关实验视频
Updated: May 30, 2025

04:48
Swin-PSAxialNet: An Efficient Multi-Organ Segmentation Technique
Published on: July 5, 2024
363
利用二维预训练的视觉转换器,通过面具自动编码器生成三维模型
Muhammad Sajid1, Kaleem Razzaq Malik1, Ateeq Ur Rehman2,3,4
1Department of Computer Science, Air University, Islamabad, 44230, Pakistan.
Scientific reports
|January 25, 2025
概括
本研究介绍了一种新的3D点云自主监督学习方法,利用2D图像预训练. 该方法有效地将视觉转换器的知识转移到增强3D特征学习,在下游任务中实现高精度.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 变压器是NLP的标准,但由于领域差异,在计算机视觉中未得到充分利用.
- 自主监督学习,特别是掩盖自动编码,对NLP和计算机视觉都很有前途.
- 有限的3D数据集阻碍了高质量的3D特征学习模型的开发.
研究的目的:
- 为3D点云上的自我监督学习开发一个多尺度的掩盖自动编码 (MAE) 预先培训架构.
- 利用预训练的二维视觉模型来指导三维特征学习过程.
- 通过有效利用二维图像表示来克服有限的3D数据的挑战.
主要方法:
- 使用预先训练的视觉转换器 (ViT) 和在2D图像上训练的3D表示模型.
- 开发了一个基于3D掩盖的自动编码器,具有编码器-解码器架构,用于自主监督的预训.
- 采用了一种新的2D掩盖策略,在预训练期间保留语义上重要的点令牌.
主要成果:
- 拟议的方法在ScanObjectNN上获得了93.63%的准确性,在使用线性SVM的ModelNet40上获得了91.31%的准确性.
- 在各种下游任务中展示了有效的概括性.
- 展示了传统的基于变压器的架构可以超过专门的监督模型.
结论:
- 多尺度MAE预先培训架构有效地实现了使用2D预先训练模型在3D点云上进行自我监督的学习.
- 该方法成功地将知识从2D视觉转移到3D表示学习,解决数据稀缺问题.
- 这项工作突出了简单的变压器架构在高性能3D计算机视觉任务中的潜力.

