量与多样性:数据对使用先进的ML模型检测EEG病理的影响
Martyna Poziomska1, Marian Dovgialo2, Przemysław Olbratowski3
1Faculty of Physics, University of Warsaw, Pasteura 5, Warsaw, 02-093, Poland; Łukasiewicz Research Network - Automotive Industry Institute, Jagiellońska 55, Warsaw, 03-301, Poland.
概括
大量多样化的EEG数据集提高了机器学习模型的性能,用于检测大脑病理. 更多的数据可以克服多样性问题,特别是使用先进的神经网络和元模型.
科学领域:
- 神经科学是一个神经科学.
- 人工智能的人工智能
- 生物医学工程 生物医学工程
背景情况:
- 机器学习模型越来越多地用于分析电脑电图 (EEG) 数据.
- 这些模型的性能高度依赖于培训数据的数量和多样性.
- 了解这些依赖关系对于开发强大可靠的EEG分析工具至关重要.
研究的目的:
- 调查数据数量和多样性如何影响机器学习模型在检测一般EEG病理方面的性能.
- 介绍和描述Elmiko数据集,这是一个庞大而多样化的EEG记录集.
- 确定最佳策略,以对EEG数据进行机器学习模型的训练.
主要方法:
- 使用了两个EEG数据集:一个有2993条记录 (Temple大学医院) 和Elmiko数据集,其中有39家医院的55787条记录.
- 评估了各种机器学习模型,包括基于注意力的和变压器架构,以及将神经网络与梯度增强相结合的元模型.
- 根据不同特征的数据集的准确性和稳定性评估模型性能.
主要成果:
- 小,一致的数据集允许许多模型实现高精度.
- 数据变化 (病理学,协议,标签) 显著降低模型性能.
- 增加数据数量可以提高预测准确度,并可能补偿多样性,特别是在基于变压器的网络中.
- 一个将神经网络和梯度增强与手工制作的特征集成的元模型显示出卓越的性能.
结论:
- 数据的数量和多样性是机器学习中用于EEG病理检测的关键因素.
- 更大,更多样化的数据集,如Elmiko体,对于可概括的模型性能至关重要.
- 先进的架构 (变压器) 和组合方法 (元模型) 在克服数据限制方面表现有前途.


