对可持续深度学习的数据减少方法进行深入分析
Javier Perera-Lago1, Victor Toscano-Duran1, Eduardo Paluzo-Hidalgo2
1Applied Mathematics I Department, University of Seville, Seville, Andalusia, Spain.
Open research Europe
|September 23, 2024
概括
数据减少技术可以在深度学习模型训练期间降低能源消耗. 本研究介绍了表格数据的八种方法和基于拓学的指标,以评估数据集的代表性,影响能源使用和预测性能.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 深度学习模型由于先进的模型,大数据集和计算能力,在复杂的任务上实现了高性能.
- 增加的模型复杂性和数据量导致了在培训和推断方面存在重大能源消耗和储存挑战.
- 数据减少提供了一个潜在的解决方案,以减轻与深度学习相关的环境和计算成本.
研究的目的:
- 展示和评估深度学习培训数据集的多种数据减少方法.
- 引入一种新的拓代表性指标来评估数据减少的有效性.
- 调查数据减少对能源消耗,模型性能和数据代表性的影响.
主要方法:
- 开发和实施八种不同的数据缩小技术,用于表格式数据集.
- 创建了一个Python包,以促进这些数据减少方法的应用.
- 引入了基于拓学的指标,以量化与原始数据相比缩小数据集的代表性.
- 扩展数据减少方法,用于对象检测任务中的图像数据集的应用.
主要成果:
- 实验性地比较了八种数据缩小方法的性能.
- 评估了数据集大小,代表性,能源消耗和模型预测性能之间的权衡.
- 证明了数据减少在深度学习模型训练期间潜在降低能源消耗的有效性.
结论:
- 数据减少策略可以有效地解决深度学习中的效率挑战.
- 提出的方法和指标为优化深度学习工作流提供了宝贵的工具.
- 进一步的研究可以探索这些技术在各种深度学习领域的更广泛的适用性和影响.


