强大的视听扬声器定位在杂的飞机机内,用于飞行医疗援助
1School of Computer Science, Northwestern Polytechnical University, Xi'an 710129, China.
Sensors (Basel, Switzerland)
|September 27, 2025
概括
本研究介绍了一种新的跨模态音视频融合网络 (CMAVFN),用于在具有挑战性的飞机机环境中进行主动扬声器本地化 (ASL). 该CMAVFN模型准确地识别了噪音和遮蔽物中的扬声器,改善了航空安全和通信系统.
科学领域:
- 计算机视觉 计算机视觉
- 音频信号处理 音频信号处理
- 人与计算机的交互
背景情况:
- 主动扬声器定位 (ASL) 在噪音严重的环境中至关重要,如飞机机,特别是在紧急情况下.
- 现有的ASL方法难以应对现实世界的航空挑战,例如发动机噪音,动态照明和遮蔽.
研究的目的:
- 开发一个强大的端到端网络,用于适应航空环境的主动扬声器定位 (ASL).
- 解决当前ASL系统在处理飞机机中的噪音,遮蔽和扬声器周转方面存在的局限性.
主要方法:
- 提出了一个新的跨模态视听融合网络 (CMAVFN),处理原始视频和多频道音频.
- 利用交叉模式的注意力机制来融合视觉和定向音频功能.
- 引入了双分支本地化解码器和交叉模式辅助监控,以增强时空推理.
主要成果:
- 在杂,封闭和多扬声器的航空场景中,CMAVFN展示了强大的扬声器本地化性能.
- 该模型在公共数据集和特定领域的AirCabin-ASL基准上取得了显著的结果.
- 该网络有效地处理原始视听数据,而不需要中间人脸检测.
结论:
- 拟议的CMAVFN为在具有挑战性的航空条件下进行主动扬声器定位提供了实际解决方案.
- 该框架支持为飞机机开发先进的语音驱动交互系统.
- 潜在的应用包括实时机组人员协助,语音医疗文档和飞行中的健康监测.
更多相关视频
13:12Translational Brain Mapping at the University of Rochester Medical Center: Preserving the Mind Through Personalized Brain Mapping
Published on: August 12, 2019
46.3K
06:04Systematic Hearing Performance Evaluation Process for Adolescents with Cochlear Implantation at Early Ages
Published on: March 24, 2023
756
