一项对GPT-4o和人类眼科医生的比较研究,用于诊断青光眼瘤
Junxiu Zhang1, Yao Ma2, Rong Zhang3
1Beijing Ophthalmology and Visual Sciences Key Lab, Beijing Tongren Eye Center, Beijing Tongren Hospital, Capital Medical University, Beijing, 100730, China. zjxeye@mail.ccmu.edu.cn.
Scientific reports
|December 5, 2024
概括
像GPT-4o这样的大型语言模型在医疗保健诊断中显示出潜力,但尚未足够准确用于独立的玻璃眼瘤诊断. 人工智能可以帮助临床医生,但人类的专业知识对于初步诊断至关重要.
科学领域:
- 眼科医生 眼科 眼科
- 医疗人工智能 医疗人工智能
背景情况:
- 人工智能 (AI),特别是大型语言模型 (LLM),为改善医疗保健中的诊断准确性提供了潜力.
- 与人类专家对比AI的诊断能力的评估对于其安全融入临床实践至关重要.
研究的目的:
- 评估与人类眼科医生相比,GPT-4o在识别青光眼病例方面的诊断性能.
- 为了确定GPT-4o提供的初级和差异诊断的准确性和完整性,与经验丰富的临床医生相比.
主要方法:
- 一项前性观察性研究使用GPT-4o和三个眼科医生分析了26例青光眼病例.
- 诊断的准确性和完整性被评估使用利克特尺度.
- 统计分析涉及非参数测试,如克鲁斯卡尔-瓦利斯和曼-惠特尼U.
主要成果:
- 与所有人类眼科医生相比,GPT-4o在初级玻璃眼瘤诊断中的准确性明显较低.
- 对于初级诊断,GPT-4o的完整性得分也低于人类专家的得分.
- 对于差异诊断,GPT-4o的准确性与人类专家相提并论,并且它获得了最高的完整性得分.
结论:
- 目前的AI模型,包括GPT-4o,由于准确度较低,不适合作为绿眼病的独立诊断工具.
- 在临床环境中,GPT-4o可以作为一个有价值的辅助,特别是在复杂的病例中,但不应该取代人类眼科医生.
- 人工智能的未来进步可能会提高它在眼科中的实用性,但人类的专业知识仍然对初步诊断至关重要.


