基于金字塔变压器和多尺度特征融合的立体视觉密集单眼深度估计
Zhongyi Xia1,2, Tianzhao Wu1,2, Zhuoyan Wang1,2
1College of New Materials and New Energies, Shenzhen Technology University, Shenzhen, 518118, Guangdong, China.
Scientific reports
|March 26, 2024
概括
一个新的立体金字塔变压器深度 (SPT-深度) 模型提高了立体显示器的深度估计精度. 这种方法显著减少了错误,提高了自动驾驶和电影等应用中的现实性.
科学领域:
- 计算机视觉 计算机视觉
- 深度学习 (Deep Learning) 是一种深度学习.
- 3D显示技术 3D显示技术
背景情况:
- 准确的深度估计对于电影,电视和自动驾驶中的高质量的立体显示器至关重要.
- 变压器由于固有的局限性,对深度估计任务提出了挑战.
研究的目的:
- 引入立体金字塔变压器深度 (SPT深度) 以克服变压器在深度估计方面的限制.
- 提高立体镜应用的深度估计的准确性和稳定性.
主要方法:
- 使用逐步降低采样来融合浅层和深层语义信息.
- 采用两阶段的培训过程 (细度和粗度的融合),具有不同的战略.
- 包含一个移动和尺度不变的MSE损失和边缘光滑功能,以提高性能和降低噪音.
主要成果:
- 在减少时间复杂性的情况下实现全球受感场.
- 与基线相比,在纽约大学深度V2数据集上,绝对相对误差 (Abs Rel) 减少了10%,根平均平方误差 (RMSE) 减少了36%.
- 与最先进的方法相比,显示了17%的RMSE减少.
结论:
- SPT-Depth有效地解决了变压器在深度估计方面的挑战.
- 该方法显著提高了深度图的准确性和稳定性.
- 在立体深度估计任务中实现卓越的性能.
更多相关视频
05:12Robotized Testing of Camera Positions to Determine Ideal Configuration for Stereo 3D Visualization of Open-Heart Surgery
Published on: August 12, 2021
2.0K
11:34High-resolution, High-speed, Three-dimensional Video Imaging with Digital Fringe Projection Techniques
Published on: December 3, 2013
15.7K
