使用大型语言模型作为紧急眼科的决策支持工具
Ante Kreso1, Zvonimir Boban2, Sime Kabic1
1University Hospital Split, Department for Ophthalmology, Croatia.
International journal of medical informatics
|March 27, 2025
概括
大型语言模型 (LLM) 在紧急眼科决策支持方面表现有前途. 在现实世界的案例研究中,GPT-4和Llama-3-70b的性能与人类专家相比较.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗决策支持 医疗决策支持
背景情况:
- 大型语言模型 (LLM) 在医学中显示出潜力.
- 它们在紧急眼科决策支持中的实用性未经现实数据证明.
研究的目的:
- 评估最先进的LLM (GPT-4,GPT-4o,Llama-3-70b) 作为紧急眼科的决策支持工具.
- 为了比较LLM的表现与人类专家眼科医生的表现.
主要方法:
- 展望性比较研究涉及73个匿名的紧急眼科病例.
- 由LLM生成的诊断和治疗计划与经过认证的眼科医生的诊断和治疗计划进行了评估.
- 两位独立专家使用4分利克特级别对LLM和人类报告进行了评分.
主要成果:
- 人类专家的平均得分为3.72.
- GPT-4 (3.52) 和Llama-3-70b (3.48) 显示了与人类专家可比的性能.
- GPT-4o得分较低 (3.20),在人类得分和GPT-4o (P < 0.001) 之间发现了统计学上显著的差异.
结论:
- 在紧急眼科中,LLM显示了作为决策支持工具的准确性.
- GPT-4和Llama-3-70b的表现与人类眼科医生的表现相当.
- 在临床紧急眼科实践中,LLM具有整合的潜力.


