LLMCARE:通过LLM生成的合成数据增强的变压器模型来早期检测认知障碍
Ali Zolnour1, Hossein Azadmaleki1, Yasaman Haghbin1
1Columbia University Irving Medical Center, New York, NY, United States.
Frontiers in artificial intelligence
|November 24, 2025
概括
这项研究开发了一种基于语音的管道,用于早期发现阿尔茨海默病和相关痴呆症 (ADRD). 该系统集成了先进的NLP功能,改善了早期认知衰退的识别,以进行可扩展的查.
科学领域:
- 自然语言处理 (NLP) 是一种自然语言处理.
- 人工智能 (AI) 是一种人工智能.
- 计算语言学 计算语言学
背景情况:
- 阿尔茨海默病和相关痴呆症 (ADRD) 影响着数百万,超过一半的病例未被诊断出来.
- 早期发现认知衰退对于及时干预至关重要.
- 基于语音的NLP提供了一种可扩展的方法来识别认知障碍的微妙语言标记.
研究的目的:
- 开发和评估一个基于语音的查管道,用于早期检测ADRD.
- 通过使用大型语言模型 (LLM) 集成变压器嵌入,语言特征和合成数据增强.
- 为了对单模和多模LLM分类器进行比较,并评估对轻度认知障碍 (MCI) 队列的概括性.
主要方法:
- 使用了ADReSSo和DementiaBank数据集,包括轻度认知障碍 (MCI) 和对照组.
- 在晚期融合模型中使用基于变压器的嵌入式与手工制作的语言特征相结合.
- 使用LLM (例如MedAlpaca-7B) 进行了集成合成语音数据增强,并评估了各种LLM分类器.
主要成果:
- 融合模型在ADReSSo数据集上获得了83.32的F1得分,表现优于基线模型.
- 用MedAlpaca-7B进行合成数据增强,在2x尺度上提高了性能 (F1=85.65).
- 该管道将一般化为一个仅为MCI的队列 (德拉华州体),达到72.82.2的F1得分.
结论:
- 整合变压器嵌入和语言特征显著增强了从语音中检测ADRD.
- 通过LLM生成的合成语音提供了有效的数据增强,尽管收益有限.
- 经过验证的管道显示了可扩展,临床相关的认知障碍早期查的潜力.
