人工智能在紫外线炎的决策过程中获得了大型语言模型.
Inès Schumacher1, Virginie Manuela Marie Bühler1, Damian Jaggi1
1Department of Ophthalmology, Inselspital, University Hospital of Bern, Bern, Switzerland.
International journal of retina and vitreous
|September 11, 2024
概括
大型语言模型 (LLM) 显示出膜炎护理的潜力,但需要广泛的培训. 虽然LLM可以在眼科中提供帮助,但它们生成的参考文献往往不准确,需要仔细验证.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能在医学中的应用
背景情况:
- 尿道炎涉及眼内炎症性疾病.
- 像ChatGPT这样的大型语言模型 (LLM) 在医学上越来越重要.
研究的目的:
- 探索LLM在膜炎子领域的适用性方面的优缺点.
- 评估临床膜炎病例LLM产生的反应的准确性和充分性.
主要方法:
- 在临床上,有关脑膜炎病例的相关问题被问到LLM三次.
- 根据准确性和充分性对LLM答案进行了分类.
- 统计分析包括描述性统计和可靠性测试 (科恩和弗莱斯的卡帕).
- 生成的参考文献在医学数据库中进行了准确性验证.
主要成果:
- 在LLM的回答中,各个尝试都显示出适度的一致性 (平均科恩的kappa=0.4577).
- 很大一部分生成的引用是不准确的 (42.3%无法定位,15.4%被误解/引用不正确).
- 只有42.3%的引用是准确和正确引用的.
结论:
- LLM 显示出在紫外线炎管理和眼科方面具有显著的潜力.
- 在实施LLM在特定的医疗任务之前,严格的培训和测试是必不可少的.
- 由LLM生成的引用需要仔细验证,因为经常存在不准确性.


