VM-RTDETR:通过视觉状态-空间二元性和多尺度融合来推进DETR,以实现强大的猪检测
Wangli Hao1, Shu-Ai Xu1, Hao Shu1
1Faculty of Software Technologies, Shanxi Agricultural University, Jinzhong 030801, China.
Animals : an open access journal from MDPI
|November 27, 2025
概括
一个新的VM-RTDETR模型改善了智能养殖中的猪检测. 它使用了新的视觉状态-空间二元化骨干和多尺度高效混合编码器,以获得更好的特征表示和准确性.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 农业技术 农业技术
背景情况:
- 在智能畜牧业中检测猪面临着全球背景和复杂环境中的多层次特征的挑战.
- 现有的方法很难有效地捕捉远程依赖性和各种规模特征,这些特征对于准确检测至关重要.
研究的目的:
- 为智能畜牧业开发一个先进的猪检测模型.
- 通过整合全球背景和多层次信息来增强特征表示.
主要方法:
- 基于增强的RT-DETR架构的拟议VM-RTDETR模型.
- 整合了视觉状态-空间二元化 (VSSD) 骨干与非因果状态-空间二元化 (NC-SSD) 进行长距离依赖.
- 设计了一个多级高效混合编码器 (M-Encoder),使用并行卷积内核进行多级特征提取.
主要成果:
- 在定制猪场数据集上,VM-RTDETR显著优于现有的主流探测器.
- 与R50-RTDETR基线相比,在平均精度 (AP),AP50和AP75中实现了高达2.35%,0.63%和2.76%的改善.
- 在复杂的农业场景中证明了增强的检测稳定性.
结论:
- VM-RTDETR模型为猪检测提供了更全面的特征表示.
- 为智能畜牧业提供高效准确的解决方案,改善在具有挑战性的条件下检测.
