一个人工智能聊天机器人的性能评估在临床内科复合场景中
Michael J Maywood1, Ravi Parikh2,3, Avnish Deobhakta4
1Department of Ophthalmology, Corewell Health William Beaumont University Hospital, Royal Oak, Michigan.
Retina (Philadelphia, Pa.)
|January 25, 2024
概括
聊天GPT准确地回答了超过80%的临床玻璃甲状腺情景. 然而,它的答案并不总是全面的,一些错误的答案可能会造成潜在的伤害.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能在医学中的应用
背景情况:
- 像ChatGPT这样的大型语言模型越来越多地用于医疗信息.
- 评估它们在特殊领域的准确性至关重要,比如玻璃视网膜疾病.
研究的目的:
- 评估ChatGPT在临床玻璃甲状腺情景中的准确性和全面性.
- 分析ChatGPT使用的来源,并识别潜在的幻觉.
主要方法:
- 一项涉及40个开放式临床场景的回顾性横截面研究.
- 三名盲人视网膜专家评估了答案的正确性和完整性.
- 结果包括准确性,全面性,潜在的患者伤害和参考质量.
主要成果:
- 聊天GPT正确地回答了83%的场景,但只有52.5%是全面的.
- 根据子专业的准确性有所不同,糖尿病视网膜病变得分为100%,手术病例为70%.
- 六个错误的答案表明对患者的潜在或最终伤害.
结论:
- 聊天GPT在回答复杂的玻璃质问题方面表现出高准确度.
- 它提供全面信息和避免潜在危害的能力需要进一步改进.
更多相关视频
09:29A Standardized Obstacle Course for Assessment of Visual Function in Ultra Low Vision and Artificial Vision
Published on: February 11, 2014
13.1K
11:12Driving Simulation in the Clinic: Testing Visual Exploratory Behavior in Daily Life Activities in Patients with Visual Field Defects
Published on: September 18, 2012
17.4K
