大型语言模型接近眼科医学的专家级临床知识和推理:一项头对头的横截面研究
Arun James Thirunavukarasu1,2, Shathar Mahmood1, Andrew Malem3
1University of Cambridge School of Clinical Medicine, Cambridge, United Kingdom.
PLOS digital health
|April 17, 2024
概括
最先进的大型语言模型 (LLM) 在眼科领域表现有前途,GPT-4的表现相当于专家眼科医生在模拟考试中的表现. 这些先进的AI工具很快可能会提供有价值的临床援助,特别是在专家稀缺的地方.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 大型语言模型 (LLM) 在自然语言处理方面正在迅速发展.
- 在临床环境中,特别是眼科中,LLM的应用正在出现.
- 需要强大的评估基准来评估LLM的临床潜力,而不仅仅是原始分数.
研究的目的:
- 评估眼科中最先进的LLMs的临床潜力.
- 用全面的模拟检查来比较LLM绩效与专家眼科医生和正在培训的医生.
- 根据问题主题和推理的复杂性来分析LLM的表现.
主要方法:
- 最初对347个眼科问题进行了GPT-3.5和GPT-4的测试.
- 一项由87个问题组成的模拟检查对GPT-3.5,GPT-4,PaLM 2,LLaMA,专家眼科医生和实习生进行.
- 根据主题和问题类型 (回忆与推理) 分析了表现;蒙面眼科医生对LLM的答案进行了准确性,相关性和偏好等级.
主要成果:
- GPT-4 (69%) 的表现超过了GPT-3.5 (48%),LLaMA (32%) 和PaLM 2 (56%).
- 与专家眼科医生 (中位数为76%) 和眼科医生学员 (中位数为59%) 相比,GPT-4的表现良好.
- 眼科医生更喜欢GPT-4而不是GPT-3.5,评价其准确性和相关性更高.
结论:
- 法学士在眼科方面取得了专家水平的知识和推理能力.
- GPT-4的表现表明,它有可能成为医疗咨询和援助的有价值工具,特别是在服务不足的地区.
- 在临床试验之前,临床基准对于评估医疗保健中的LLM能力至关重要.


