从基于在线聊天的人工智能模型的眼科建议的适当性
Prashant D Tailor1, Timothy T Xu1, Blake H Fortes1
1Department of Ophthalmology (P.D.T., T.T.X., B.H.F., R.I., T.W.O., M.R.S., S.J.B., B.A.S., A.J.B., S.J.B., B.A.S., A.J.B., S.V.P., K.H.B., A.A.B., L.H.W., A.A.T., G.W.R., A.J.S., K.Y.W., E.D.B., S.A.M., B.G.M., J.J.C., M.C.B., D.A.T., K.D.C., W.M.S., L.A.D.) and Department of Neurology (J.J.C.), Mayo Clinic, Rochester, MN; and Department of Ophthalmology, Duke University, Durham, NC (K.Y.W.).
Mayo Clinic proceedings. Digital health
|April 5, 2024
概括
人工智能 (AI) 模型主要为患者信息网站和电子病历 (EMR) 查询提供适当的眼科建议. 然而,人工智能在临床实施之前需要进一步开发.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 在线人工智能 (AI) 模型越来越多地用于健康信息.
- 评估人工智能产生的医疗建议的准确性对于患者安全至关重要.
- 眼科是一个复杂的医疗领域,对人工智能驱动的建议提出了独特的挑战.
研究的目的:
- 评估由大型语言模型 (LLM) 生成的眼科建议的适当性.
- 在两个不同的临床环境中评估LLM反应:患者信息网站和电子病历 (EMR) 患者查询.
- 在不同眼科子专业中识别AI响应适当性的变化.
主要方法:
- 从2023年4月1日至30日进行了一项横截面的定性研究.
- 在所有子专业中生成了192个眼科问题.
- 副专家在两个背景下对LLM的反应进行了评估:患者信息网站和EMR草案的响应,分为适当,不适当或不可靠.
主要成果:
- 该LLM提供了总体平均79%的患者信息网站的适当响应和74%的EMR草案响应.
- 根据子专业的适用性有所不同,眼科瘤学 (100%和90%) 和白内障/折射手术 (92%和85%) 的得分最高.
- 角膜 (分别为56%和54%) 和耳膜炎 (分别为65%和55%) 的子专业在两种情况下都显示出较低的适当率.
结论:
- 该LLM在各种眼科子专业中表现出大多数适当的反应.
- 在各个子专业之间,在适当性方面发现了显著的差异.
- 进一步优化和改进LLM能力是必要的,以确保眼科的安全临床整合.


