基于光学技术和组合模型在家庭环境中识别人类活动
Muhammad Amjad Raza1, Nasir Mehmood1, Hafeez Ur Rehman Siddiqui1
1Institute of Computer Science, Khwaja Fareed University of Engineering and Information Technology, Abu Dhabi Road, Rahim Yar Khan 64200, Punjab, Pakistan.
Sensors (Basel, Switzerland)
|March 14, 2026
概括
本研究介绍了一种基于视觉的人类活动识别 (HAR) 系统,使用姿势估计和深度学习. 该CNN-LSTM模型实现了98.78%的准确性,提供了一个精确而非侵入性的HAR解决方案.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人与计算机的交互
背景情况:
- 人类活动识别 (HAR) 对智能家居,医疗保健和辅助生活至关重要.
- 使用可穿戴传感器的传统HAR方法具有诸如用户不便和隐私问题等局限性.
- 基于视觉的HAR提供了一个非侵入性的替代方案,但面临着照明和隐私方面的挑战.
研究的目的:
- 开发和评估一种新的,保护隐私的,基于视觉的HAR系统.
- 使用骨架关键点数据对HAR进行各种深度学习架构的性能进行比较.
- 评估拟议的HAR方法的稳定性和概括能力.
主要方法:
- 利用PoseNet从视频数据中提取骨架关键点,创建保护隐私的表示.
- 采用了六种深度学习模型的组合:变压器,LSTM,GRU,MLP,1D CNN和CNN-LSTM.
- 对30名从事9项日常家庭活动的受试者的2734个活动样本进行了评估.
主要成果:
- 卷积神经网络-长期短期记忆 (CNN-LSTM) 架构在测试组中实现了最高准确率98.78%.
- 交叉验证证明了强大的概括,CNN-LSTM的平均准确率为97.21%±1.84%.
- 姿势估计有效地捕捉了运动动态,同时保持了隐私,优于基于外观的方法.
结论:
- 基于视觉的姿势估计与深度学习相结合,特别是CNN-LSTM,提供了一个高度准确和非侵入性的HAR解决方案.
- 提出的方法适用于智能医疗保健和家庭自动化系统,解决了传统方法的局限性.
- 该系统表现出强大的概括能力,使其可靠地识别未见个人的活动.


