大型语言模型在神经病学委员会样式检查中的表现
Marc Cicero Schubert1,2, Wolfgang Wick1,2, Varun Venkataramani1,2
1Neurology Clinic and National Center for Tumor Diseases, University Hospital Heidelberg, Heidelberg, Germany.
JAMA network open
|December 7, 2023
概括
大型语言模型 (LLM) 在医疗保健方面表现有前途. 聊天GPT 4在神经病学考试中获得了85%的分数,超过了人类的平均值,并展示了临床神经病学应用的潜力.
科学领域:
- 人工智能在医学中的应用
- 神经学 诊断 神经学 诊断
- 大型语言模型
背景情况:
- 大型语言模型 (LLM) 显示出广泛的适用性,包括在医疗保健领域.
- 在医学委员会考试中,LLM的表现各不相同,神经学的表现在很大程度上尚未被探索.
研究的目的:
- 为了评估LLMs在神经学板式考试上的表现.
- 在评估其准确性和可靠性时,比较不同版本的LLM.
主要方法:
- 一项横截面研究使用了美国精神病学和神经病学委员会的问题库.
- 评估了两个LLM版本,即ChatGPT 3.5 (LLM 1) 和ChatGPT 4 (LLM 2),进行了评估.
- 问题根据布鲁姆的分类法 (低级与高级) 进行分类,绩效指标包括分数,信心和可重现性.
主要成果:
- LLM 2取得了85.0%的得分,明显优于LLM 1 (66.8%),超过了73.8%的人类平均水平.
- 在行为,认知和心理领域,以及在低级和高级问题上,LLM 2表现出色.
- 两种模型都表现出自信的语言,无论答案的准确性如何,可重复的答案与更高的准确性相关.
结论:
- LLM 2表现出强的表现,在没有专业培训的情况下,在神经病学委员会考试中取得合格成绩.
- 虽然高阶认知问题带来了挑战,但LLM 2的总体结果表明,临床神经病学LLM的潜力很大.
- 对LLM的进一步改进可以提高其在医疗保健和专业医疗领域的实用性.
更多相关视频
08:05Measuring Statistical Learning Across Modalities and Domains in School-Aged Children Via an Online Platform and Neuroimaging Techniques
Published on: June 30, 2020
7.6K
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
594
