对轨道和眼面疾病的ChatGPT评估:准确性和可读性洞察力
Michael Balas1, Ana Janic1, Patrick Daigle2
1Temerty Faculty of Medicine.
Ophthalmic plastic and reconstructive surgery
|November 21, 2023
概括
聊天GPT 4.0在提供轨道和眼部面部疾病的精确眼科信息方面表现有前途. 虽然一般来说是合适的,但为了在所有领域获得全面的准确性,需要进一步精细化.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 轨道和眼面疾病包括影响眼和周围结构的一系列复杂的疾病.
- 人工智能 (AI) 在医学教育和临床实践中的整合正在迅速发展.
- 像ChatGPT这样的大型语言模型 (LLM) 提供了信息检索和知识传播的潜力.
研究的目的:
- 评估 ChatGPT 版本 4.0.0 生成的响应的准确性和可读性.
- 评估ChatGPT 4.0在涉及轨道和眼面疾病10个基本领域的问题上的表现.
主要方法:
- 使用了一套精心策划的100个问题,涵盖轨道和眼面疾病的诊断,治疗和解释.
- 七名专家眼科医生使用7项利克特比例表来评估ChatGPT 4.0的响应是否恰当和准确.
- 通过使用类内相关系数 (ICC) 来量化评级者之间的可靠性.
主要成果:
- 在所有10个疾病领域中,ChatGPT 4.0表现出一致的准确性,平均适当性得分为5.3/6.0.0.
- 洞穴鼻抽,逆泡出血和白发作领域的得分最高 (5.5-5.6/6.0),而proptosis的得分最低 (5.0/6.0).
- 观察到中等级别的评审者之间的可靠性 (ICC=0.64),答案显示出大学/研究生水平的阅读复杂性.
结论:
- 聊天GPT 4.0显示出在轨道和眼部面部眼科中提供准确信息的巨大潜力.
- 确保所有疾病分专业的全面准确性仍然是一个挑战.
- 未来的人工智能开发应该专注于提高正确性,并可能将视觉数据解释纳入更广泛的临床应用.


