相关实验视频
Updated: Aug 2, 2026

10:25
Deep Learning-Based Segmentation of Cryo-Electron Tomograms
Published on: November 11, 2022
9.0K
基于变压器的语义细分用于从非常高分辨率图像中提取建筑足迹
Jia Song1,2, A-Xing Zhu1,3, Yunqiang Zhu1
1State Key Laboratory of Resources and Environmental Information System, Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences, Beijing 100101, China.
Sensors (Basel, Switzerland)
|June 10, 2023
概括
视觉转换器网络增强语义细分,从非常高分辨率 (VHR) 图像中提取建筑足迹. 优化像图像补丁大小和嵌入尺寸这样的超参数可以提高准确性,优于传统的卷积神经网络 (CNN).
科学领域:
- 计算机视觉 计算机视觉
- 遥感 遥感 遥感 遥感
- 深度学习 (Deep Learning) 是一种深度学习.
背景情况:
- 语义细分对于非常高分辨率 (VHR) 遥感图像中的对象提取至关重要.
- 视觉转换器网络在语义细分任务中比卷积神经网络 (CNN) 提供了更好的性能.
研究的目的:
- 调查视觉变压器网络超参数对VHR图像中建筑足迹提取精度的影响.
- 在这个任务中,将基于变压器的模型与CNN的性能进行比较.
主要方法:
- 设计和比较基于变压器的模型,具有不同的超参数配置 (图像补丁,线性嵌入维度,多头自动注意).
- 分析了这些超参数对建筑足迹提取精度的影响.
主要成果:
- 较小的图像补丁和更高维度的嵌入显著提高了细分精度.
- 基于变压器的网络比具有可比模型大小和训练时间的CNN获得更高的准确性.
- 这些模型是可扩展的,可以在通用GPU上进行训练.
结论:
- 视觉变压器网络显示出在VHR遥感图像中精确提取对象的巨大潜力.
- 在这个领域,超参数调整对于优化变压器性能至关重要.
- 这些发现为未来使用深度学习的遥感应用提供了宝贵的见解.

