开发基于融合功能的智能垃圾桶原型,识别声音和RGB图像
Wei-Chun Chen1, Chieh-Feng Chiang2, Yu-Hao Lin3
1Bachelor Program in Industrial Technology, National Yunlin University of Science and Technology, 123 University Road, Section 3, Douliou, Yunlin 64002, Taiwan.
Waste management (New York, N.Y.)
|June 24, 2025
概括
这项研究表明,在废物分类方面,声音比图像更好. 综合声音和图像数据的多式深度学习模型提供了更好的城市固体废物分类精度.
科学领域:
- 环境科学 环境科学
- 计算机科学 计算机科学
- 工程 工程师 工程师 工程师
背景情况:
- 城市固体废物 (MSW) 的来源分类对于循环经济至关重要.
- 现有的智能MSW分类主要使用RGB图像,对声音或多模式方法的探索有限.
研究的目的:
- 开发一个创新的智能垃圾桶 (IWB),使用多式联网深度学习方法 (MDLM) 进行增强的MSW分类.
- 调查整合图像和声音数据用于废物识别和自动分类的有效性.
主要方法:
- 构建了一个IWB原型和一个MSW数据集与音频信号和RGB图像.
- 使用Mel频 cepstral系数 (MFCC) 提取的音频特征和使用ResNet-101.1的图像特征.
- 通过合并ResNet-101和长短期内存 (LSTM) 网络功能来开发一个MDLM,用于MSW分类和自动排序.
主要成果:
- 与RGB图像相比,单独的声音模式在MSW识别中表现出优异的性能.
- 仅使用声音特征的MDLM实现了比LSTM模型更高的平均精度,证实了多式联的好处.
- IWB原型成功地对MSW进行了分类,MDLM在现实测试中表现优于LSTM.
结论:
- 多模式深度学习,集成声音和图像数据,显著提高MSW分类和自动排序能力.
- 基于声音的分类对于MSW识别比基于图像的分类更有效.
- 通过更多的图像数据进行进一步的研究,有可能提高MDLM性能,以实现可靠的废物分类.


