越过"cookie盗窃"的身体沟:将BERT从外部数据中学到的东西应用于ADReSS挑战痴呆症检测任务
Yue Guo1, Changye Li2, Carol Roan3
1Department of Biomedical Informatics and Medical Education, University of Washington, Seattle, Washington, USA.
概括
添加外部语音数据显著改善了用于检测痴呆症的机器学习模型. 这种方法提高了从自发言语中识别阿尔茨海默病 (AD) 的准确性,克服了较小数据集的局限性.
科学领域:
- 计算语言学计算语言学
- 神经科学是一个神经科学.
- 人工智能的人工智能是人工智能.
背景情况:
- 准确的机器学习模型需要大型标记数据集,在阿尔茨海默病 (AD) 研究等医疗领域很少.
- 用于阿尔茨海默氏症研究和分类的DementiaBank库的规模有限,特别是通过自发言语 (ADReSS) 挑战识别阿尔茨海默氏症痴呆症的平衡子集.
- 之前的研究表明,结合外部数据可以改善用于痴呆症检测的传统机器学习模型.
研究的目的:
- 评估外部数据对改进最先进的深度学习模型在ADReSS挑战痴呆症检测任务中的有用性.
- 评估使用更大,新开发的语料库 (威斯康星州纵向研究 - WLS) 作为训练痴呆症检测模型的规范数据的影响.
- 调查处理挑战的方法,如在WLS数据和阶级不平衡中错过痴呆症诊断.
主要方法:
- 从威斯康星纵向研究 (WLS) 开发了一个新的1366个转录的cookie theft任务记录的集体.
- 从认知测试结果推断WLS参与者的认知状态,包括语义语言流性.
- 使用DementiaBank和WLS数据的组合训练了一个BERT模型,评估整个WLS库和认知选择的WLS数据作为规范来源.
- 探索了加权成本函数和额外的预测目标,以解决数据不平衡和来源混.
主要成果:
- 在培训BERT模型的过程中,将WLS数据纳入ADReSS数据,显然提高了痴呆症检测任务的性能.
- 添加外部WLS数据在增强模型在痴呆患者和健康对照之间进行歧视的能力方面提供了价值.
- 权重成本函数和额外的预测目标显示,有潜力减轻与类不平衡和数据来源相关的问题.
结论:
- 外在的规范性数据,如WLS体,可以显著提高深度学习模型的性能,用于从自发言语中检测阿尔茨海默病.
- 利用更大,多样化的数据集,即使是推断认知状态,也是克服医疗机器学习数据局限性的可行策略.
- 对数据整合技术和成本敏感学习的进一步研究是强大的痴呆症检测模型的必要.
更多相关视频
06:46Automated, Long-term Behavioral Assay for Cognitive Functions in Multiple Genetic Models of Alzheimer's Disease, Using IntelliCage
Published on: August 4, 2018
12.3K
12:18A Machine Learning Approach to Design an Efficient Selective Screening of Mild Cognitive Impairment
Published on: January 11, 2020
7.6K
