通过CSPA-DFN和通过扩散变压器模型的线性交叉注意力来提高LiDAR场景生成中的现实性
Shaoxun Ye1, Xiaoguang Di1, Ming Liao1
1Control and Simulation Center, Harbin Institute of Technology, Harbin 150080, China; National Key Laboratory of Modeling and Simulation for Complex Systems, Harbin 150080, China.
概括
这项研究引入了一种新的LiDAR扩散变压器模型,以提高自动驾驶产生的LiDAR场景的视觉质量. 新模型有效地减少了扭曲,并增强了细节,实现了最先进的结果.
科学领域:
- 计算机视觉 计算机视觉
- 机器人技术 机器人技术 机器人技术
- 人工智能的人工智能
背景情况:
- 点云扩散模型对于自动驾驶和机器人技术至关重要.
- 现有的模型由于信息丢失和缺乏全球3D结构指导而存在视觉质量差距.
- 在生成的LiDAR场景样本中,扭曲和工件很常见.
研究的目的:
- 提出一个新的LiDAR扩散变压器模型,用于增强LiDAR场景生成.
- 解决当前模型在视觉质量和细节保存方面的局限性.
- 改进产生现实的高保真度LiDAR场景的效果.
主要方法:
- 道空间并行注意力和扩展融合网络 (CSPA-DFN) 的整合.
- CSPA-DFN强调了通道和空间位置的详细特征,使用多尺度扩展卷积和通道分组.
- 一个后处理模块通过线性交叉注意力将voxelized特征和范围图像融合为全球3D结构信息.
主要成果:
- 在KITTI-360和nuScenes数据集上实现了LiDAR场景生成质量的最先进结果.
- 与以前的方法相比,在视觉质量和细节保存方面取得了显著的改进.
- 整合语义标签和摄像头视图进一步增强了语义理解和视觉质量.
结论:
- 拟议的LiDAR扩散变压器模型与CSPA-DFN和线性交叉注意力显著提高了LiDAR场景生成质量.
- 该方法有效地保存了详细的信息,并包含了全球3D结构指导.
- 该方法显示了通过改进场景生成来推进自动驾驶和机器人应用的前景.


