在不同数据库中对预测机器学习方法的性能:基于样本和报警的视角
Inês Andrade1, César Teixeira1, Mauro Pinto1
1University of Coimbra, Centre for Informatics and Systems, Department of Informatics Engineering, Coimbra, Portugal.
Frontiers in neuroscience
|July 30, 2024
概括
这项研究开发了一种针对的病人特定的发作预测算法,发现数据集的性能不同. 由于事件的稀有性,预测发作的现实模拟具有挑战性.
科学领域:
- 神经学 神经学
- 生物医学工程 生物医学工程
- 数据科学数据科学数据科学
背景情况:
- 影响全球1%的人口,其中很大一部分患有耐药性.
- 抗发作药物 (ASM) 对大约三分之一的患者无效,增加了受伤和心理痛苦的风险.
- 发作预测算法通过为耐性患者提供及时警报,有可能提高生活质量.
研究的目的:
- 在各种数据库中开发和评估一个针对患者的发作预测算法.
- 使用诸如灵敏度,每小时假阳性率 (FPR/h),特异性和AUC分数等指标来评估算法的性能.
- 为了比较不同方法 (基于样本和基于警报) 在预测和分析标准化评估中的挑战.
主要方法:
- 采用了标准化的框架,包括数据预处理,特征提取,模型训练,测试和后处理.
- 针对患者的特定算法应用于多个数据集 (EPILEPSIAE,CHB-MIT,AES,生态系统),需要对数据库进行特定的调整.
- 使用灵敏度,FPR/h,特异性和AUC来评估性能,区分基于样本和基于报警的预测策略.
主要成果:
- 预测算法在不同数据库中显示了可变的性能.
- 基于警报的方法,模拟现实生活条件,与基于样本的方法相比,产生了不太有利的结果.
- 统计分析表明,在实现显著高于机会水平的表现方面存在挑战,突出显示了发作事件的罕见性.
结论:
- 开发有效可靠的预测算法需要仔细考虑数据库特性和方法选择.
- 模拟现实生活条件来预测发作存在重大挑战,往往导致不太有利的结果.
- 未来的研究需要全面的,长期的,系统地结构化的数据集,以及现实的假设,以推进预测技术.


