帮助大型语言模型使用临床表格用于神经行为诊断从文本的分类:算法开发和验证
Kaiying Lin1, Abdur Rasool2, Saimourya Surabhi3
1Institute of Linguistics, Academia Sinica, Taipei, Taiwan.
JMIR AI
|October 21, 2025
概括
大型语言模型 (LLM) 在精神病学和行为科学中显示出有限的诊断准确性. 专门的机器学习模型的性能优于当前的LLM,这表明需要用于临床应用的先进的快速工程.
科学领域:
- 人工智能的人工智能
- 精神病学是一个精神病学.
- 行为科学 行为科学
背景情况:
- 大型语言模型 (LLM) 展示了先进的能力,但它们在精神病学中的诊断实用性尚未得到充分探索.
- 使用LLM的行为科学自动诊断需要进一步调查.
研究的目的:
- 评估神经精神疾病 (自闭症,失语,抑郁症) 的LLM聊天机器人诊断性能.
- 比较直接诊断与代码生成提示策略,有和没有临床尺度.
- 与传统的机器学习分类器对比LLM的性能.
主要方法:
- 测试了ChatGPT,Gemini和Claude模型,提供直接诊断和代码生成提示.
- 使用了ASDBank,AphasiaBank和危险分析采访集团数据集.
- 评估性能与结构化临床评估尺度和没有结构化的临床评估尺度,与ML基准进行比较.
主要成果:
- 临床尺度在数据集中提供了最小的性能改进.
- 士学位的表现不一致,通常低于现有的机器学习基准.
- 代码生成改善了AphasiaBank的F1分数 (高达86.5%),但对其他数据集的直接诊断仍然很低.
结论:
- 当前的LLM聊天机器人,天真地提示,在精神病诊断中表现低于专门的机器学习模型.
- 临床评估尺度可能会提供轻微的改进,但先进的快速工程对于临床实用性至关重要.
更多相关视频
09:00Author Spotlight: Validation of SICOLE-R for Assessing Cognitive and Reading Skills in Spanish-Speaking Children and Its Role in Personalized Education
Published on: August 16, 2024
1.2K
08:05Measuring Statistical Learning Across Modalities and Domains in School-Aged Children Via an Online Platform and Neuroimaging Techniques
Published on: June 30, 2020
8.0K
