"人工智能衍生的大型语言模型在患有与年龄相关的黄斑退行症的患者中的应用和准确性"
Lorenzo Ferro Desideri1,2, Janice Roth3, Martin Zinkernagel3,4
1Department of Ophthalmology, Inselspital, University Hospital of Bern, Bern, Switzerland. lorenzoferrodes@gmail.com.
International journal of retina and vitreous
|November 19, 2023
概括
聊天GPT 3.5为与年龄相关的黄斑变性 (AMD) 患者问题提供了最准确的答案,超过了Bing AI和Google Bard. 虽然大型语言模型 (LLM) 是有前途的,但对于复杂的医疗查询,需要进一步改进.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 与年龄相关的黄斑变性 (AMD) 影响全球数百万人,使患者越来越依赖在线信息.
- 在线搜索AMD可以导致错误信息和患者焦虑.
- 大型语言模型 (LLM) 提供了一个潜在的工具,以解决有关AMD的患者查询.
研究的目的:
- 评估不同LLM在回答患者关于AMD问题的问题的有效性.
- 为了比较来自ChatGPT 3.5,Bing AI和Google Bard的响应的准确性和充分性.
- 评估LLM的绩效,包括一般的AMD信息和具体的注射前/后建议.
主要方法:
- 三个LLM (ChatGPT 3.5,Bing AI,Google Bard) 在2023年被使用.
- 患者的问题被分为一般医疗建议和前/后内注射建议.
- 答案被分为准确/充分,部分准确/充分或不准确/不足,并进行统计分析.
主要成果:
- 对于一般医疗建议,没有发现准确度的显著差异 (p=0.129).
- 在注射前后咨询方面,ChatGPT 3.5显著超过了Bing AI和谷歌Bard (p=0.0042).
- 整体可靠性 (克朗巴赫的α) 低至0.237.7,低于0.237.
结论:
- 聊天GPT 3.5在提供准确和令人满意的答案方面表现出卓越的表现,特别是对于与AMD相关的技术问题.
- LLM显示出提供精确AMD信息的潜力.
- 需要进一步开发,以提高复杂的医学查询的LLM准确性.
更多相关视频
10:14Author Spotlight: Ex Vivo OCT-Based Multimodal Imaging of Human Donor Eyes for Research into Age-Related Macular Degeneration
Published on: May 26, 2023
3.2K
09:24A Protocol to Evaluate and Quantify Retinal Pigmented Epithelium Pathologies in Mouse Models of Age-Related Macular Degeneration
Published on: March 10, 2023
1.7K
