基于改进的Spark组件的农田环境监测数据处理方法的设计
Ruipeng Tang1, Narendra Kumar Aridas1, Mohamad Sofian Abu Talip1
1Department of Electrical Engineering, Faculty of Engineering, University of Malaya, Kuala Lumpur, Malaysia.
Frontiers in big data
|December 6, 2023
概括
本研究介绍了FAST-Join算法,以优化农业环境监测中的大数据处理. 这种增强的Spark组件显著提高了效率,减少了数据处理时间和内存使用量.
科学领域:
- 农业科学 农业科学
- 计算机科学 计算机科学
- 数据科学数据科学数据科学
背景情况:
- 大数据技术对于智能农业数据处理越来越重要.
- 现有系统需要优化,以实现有效的农田环境监测.
研究的目的:
- 设计一个改进的Spark组件用于农业数据处理.
- 通过使用新的算法,提高Spark组件和集群的运营效率.
主要方法:
- 在Spark组件中引入了FAST-Join (关键过采样分区优化) 算法.
- 优化了对等性关联查询,以提高Spark的性能.
- 将FAST-Join与原来的Spark和Equi-join算法进行了比较.
主要成果:
- FAST-Join减少了Shuffle读写数据的读写到原始数据的0.958%和1.384%.
- 与原来的Spark.相比,计算速度增加了202.11%.
- 数据处理时间和内存使用量分别减少了128.22%和76.75%.
- FAST-Join的表现优于Equi-join,减少了68.74%和37.80%的处理时间和内存.
结论:
- 快速连接算法有效地提高了Spark组件和集群效率.
- 这种方法增强了农业大数据的数据表查询和集群计算.
- 优化大数据处理对于智能农田环境监测至关重要.


