监督机器学习与大型语言模型相比,用于从医疗记录中识别功能性发作
Wesley T Kerr1,2,3,4, Katherine N McFarlane1, Gabriela Figueiredo Pucci1
1Department of Neurology, University of Pittsburgh, Pittsburgh, Pennsylvania, USA.
Epilepsia
|February 17, 2025
概括
与功能性发作概率评分 (FSLS) 和ChatGPT相比,GPT-4在功能性发作 (FS) 中表现出更高的诊断准确性. 虽然LLM表现有希望,但它们的不一致性引起了对临床应用的担忧.
科学领域:
- 神经学 神经学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 功能性发作概率评分 (FSLS) 是一个监督的机器学习工具,旨在区分功能性发作 (FS) 和发作 (ES).
- 大型语言模型 (LLM) 具有识别数据中复杂模式的能力,无需经过具体的预先培训.
研究的目的:
- 将FSLS的诊断性能与两个LLM,ChatGPT和GPT-4进行比较,以区分FS和ES.
- 评估针对性机器学习方法的相对优点和弱点,与发作诊断中的一般LLM方法相比.
主要方法:
- 使用了114例匿名患者病例 (FS,ES,混合或生理发作类事件).
- 基于文本的临床数据,包括当前疾病史,EEG和神经成像结果,按序列提示向LLM展示.
- 使用统计分析,在FSLS,ChatGPT和GPT-4之间比较了诊断准确度和接收器操作特征 (ROC) 曲线 (AUC) 下的面积.
主要成果:
- 与FSLS (74%准确率,85%AUC) 和ChatGPT相比,GPT-4的诊断准确率 (85%) 和AUC (87%) 更高.
- FSLS和GPT-4之间的协议是公平的 (科恩的卡帕=40%).
- LLM表现出不一致性,在不同的场合 (33%的病例) 为相同的患者数据提供不同的预测,GPT-4的自我评估确定性与这种变异性相关.
结论:
- 根据临床病史,GPT-4和FSLS都能识别出大量的FS患者.
- 不同的预测模式表明,与FSLS等结构化得分相比,LLM使用不同的识别方法.
- 观察到的不一致性和缺乏关于LLM预测变化的自我意识,需要谨慎地将它们纳入FS诊断的临床实践.


