评估在眼睛表面疾病中使用大型语言模型的可能性
Qian Ling1, Zi-Song Xu1, Yan-Mei Zeng1
1Department of Ophthalmology, the First Affiliated Hospital, Jiangxi Medical College, Nanchang University, Nanchang 330006, Jiangxi Province, China.
International journal of ophthalmology
|January 20, 2025
概括
大型语言模型 (LLM) 在眼科中表现有前途. GPT-4在回答眼表面疾病问题方面表现出色,优于其他LLM,接近专家人类的表现.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医学教育 医学教育
背景情况:
- 眼睛表面疾病 (OSD) 涵盖了一系列影响眼睛前面表面的疾病.
- 准确的诊断和OSD的管理需要专门的知识.
- 大型语言模型 (LLM) 正在成为医学信息检索和教育的潜在工具.
研究的目的:
- 评估五种不同的LLM在回答眼睛表面疾病的专业问题上的准确性和性能.
- 为了比较LLM的表现与人类眼科实习生和医生.
主要方法:
- 一个100个问题多选题考试在OSDs是由眼科教授开发的.
- 测试了五个LLM (ChatGPT-4,ChatGPT-3.5,Claude 2,PaLM2,SenseNova) 的使用情况.
- 研究人员将LLM的反应与人类组 (首席医生,主治医生,实习生,研究生) 的反应进行了比较.
主要成果:
- 在所有测试的LLMs中,ChatGPT-4表现最高.
- 聊天GPT-4的整体得分超过了所有人群,除了潜在的首席医生.
- 聊天GPT-4和PaLM2显示出高准确度和可信度,聊天GPT-4的成功率为59%.
结论:
- 在与OSD相关的问题上,ChatGPT-4在相关性和信心方面表现优异.
- PaLM2也表现出强大的准确性和信心,排名第二.
- 专业法学士,特别是GPT-4,在OSD等专业领域显示出作为有价值的教育和临床资源的巨大潜力.


