在角膜诊所使用在线大型语言模型聊天机器人
Prem A H Nichani1, Stephan Ong Tone1,2, Sara M AlShaker1,3
1Department of Ophthalmology and Vision Sciences, University of Toronto, Toronto, Ontario, Canada.
Cornea
|December 3, 2024
概括
聊天GPT和谷歌巴德显示在眼科有希望. 在与角膜相关的查询中,ChatGPT在准确度方面表现出色,而Google Bard在可读性方面领先,没有发现患者安全风险.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 聊天机器人为医疗保健中的效率,教育和研究提供了潜力.
- 评估LLM在眼科等专业医疗领域的表现至关重要.
研究的目的:
- 评估各种LLM聊天机器人在应对与角膜相关的场景中的表现.
- 为了比较ChatGPT,WriteSonic,Google Bard和Bing Chat在眼科中的临床和研究应用.
主要方法:
- 提示的开发涵盖临床管理,患者咨询,治疗,手术和研究.
- 角膜专家对LLM答案的评估使用一个标题 (准确性,理解力,同情心,专业性,人性,全面性,质量).
- 使用12个指标评估响应可读性;针对特定标准的性能进行子组分析.
主要成果:
- 在所有标题标准中,ChatGPT的表现优于其他LLM,获得了最高的整体得分 (83.8%).
- 谷歌Bard展示了卓越的可读性,在75%的可读性指标中表现出色.
- 所有的LLM反应被认为是安全的,对患者没有风险.
结论:
- 聊天GPT为眼科相关提示提供了卓越的准确性和全面性.
- 谷歌Bard提供了增强的可读性,有利于患者的沟通.
- 法律学士学位显示出精简眼科任务的潜力,但需要医疗专业人员的监督和持续评估.


