Related Experiment Video
Updated: Aug 5, 2026

Automated Two-dimensional Spatiotemporal Analysis of Mobile Single-molecule FRET Probes
Published on: November 23, 2021
SPFDet: CLIP Text-Prior-Guided Structure-Enhanced Detector for Fine-Grained Ship Detection in Remote Sensing Images
1School of Data Science and Big Data Technology, Central South University, Changsha 410083, China.
None:
Ship detection in remote sensing images is crucial for maritime surveillance, port management, and national security. However, existing detectors struggle with complex harbor backgrounds, large-scale variations, and fine-grained inter-class similarities among diverse ship categories. In this paper, we propose SPFDet, a CLIP text-prior-guided structure-enhanced detector that systematically addresses these challenges by integrating vision-language semantic priors with channel-selective feature enhancement. First, a Semantic Prior Component (SPC) employs a frozen CLIP text encoder to generate category-level semantic embeddings from textual descriptions of ship types, which are combined with visual scene priors and detail-aware priors to provide hierarchical domain-specific guidance. Second, a Structure-Enhanced Transformer Module (SETM), equipped with a Cross-level Channel Selection Module (CCSM) and Multi-Head Cross-Attention (MHCA), selectively enhances discriminative channel responses associated with hull contours, deck textures, and fine structural patterns across encoder layers. Third, a Fused Category-Dominated Feature (FCDF) generation mechanism integrates CLIP-based semantic priors with multi-scale visual features through category-guided attention, producing category-aware representations for precise classification and localization. We further introduce a Category-Semantic Consistency Loss to enforce alignment between predicted features and CLIP text priors. Extensive experiments on HRSC2016 and ShipRSImageNet benchmarks demonstrate that SPFDet achieves 97.2% and 72.8% mAP respectively, providing consistent improvements over strong detection baselines while maintaining competitive inference speed.