使用数据驱动方法预处理自然语言过程变量,在大量退伍军人事务人口中改善了与自杀风险的关联
Siting Li1, Maxwell Levis2, Monica DiMambro3
1Department of Biomedical Data Science, Dartmouth College, Hanover, NH, USA.
Computers in biology and medicine
|March 6, 2025
概括
一种自适应混合分类 (AMC) 方法改进了电子健康记录 (EHR) 的自然语言处理 (NLP) 以预测自杀风险. 这种方法提高了临床笔记的预测能力,有助于预防自杀的努力.
科学领域:
- 计算精神病学是一种计算精神病学.
- 临床信息学是一种临床信息学.
- 自然语言处理 (NLP) 是一种自然语言处理.
背景情况:
- 传统的自杀风险评估依赖于临床判断和自我报告.
- 电子健康记录的自然语言处理 (NLP) 为识别自杀风险预测因素提供了一种新的方法.
- 模拟NLP变量存在挑战,因为零通货膨胀和偏差分布.
研究的目的:
- 评估适应性混合分类 (AMC) 方法是否可以优化NLP数据的自杀风险预测能力.
- 为了改进从退伍军人事务 (VA) EHR笔记中提取的NLP变量的建模.
主要方法:
- 通过使用SÉANCE python包对25342名患者的NLP变量进行分析.
- 使用AMC方法对NLP措施进行分类,最大限度地提高类别之间的差异.
- 将自杀结果与AMC分类的NLP变量与原始变量和定量分类变量之间的关联进行比较.
主要成果:
- 与其他方法相比,AMC类别的变量与自杀风险的关联较强.
- 超过90%的NLP变量在单变量分析中显示出与自杀风险的显著关联.
- 使用亚样本引导的敏感性分析证实了AMC的增强预测能力.
结论:
- 基于AMC的分类显著提高了从临床文本中NLP变量的预测能力.
- 使用AMC方法转换扭曲的NLP数据显示了增强自杀风险预测模型的前景.


