分析ChatGPT对眼科病例的反应:ChatGPT可以像眼科医生一样思考吗?
Jimmy S Chen1,2, Akshay J Reddy3, Eman Al-Sharif1,4
1Viterbi Family Department of Ophthalmology, Shiley Eye Institute, University of California, San Diego, La Jolla, California.
Ophthalmology science
|September 30, 2024
概括
像ChatGPT这样的大型语言模型可以产生眼科病例讨论,但专家可以通过通用反应和幻觉来区分人工智能生成的内容. 在临床使用之前需要进一步评估.
科学领域:
- 人工智能在医学中的应用
- 眼科 眼科研究 眼科研究
- 临床决策支持系统 临床决策支持系统
背景情况:
- 大型语言模型 (LLM) 在眼科问题解答方面表现有前途.
- 关于LLM在产生临床评估和讨论方面的能力的研究有限.
研究的目的:
- 评估通过ChatGPT生成的临床评估和计划的准确性.
- 评估眼科医生区分人类和人工智能产生的临床讨论的能力.
主要方法:
- 一项涉及16名眼科医生的横截面混合方法研究.
- 我们比较了聊天GPT生成的和人类生成的案例讨论.
- 眼科医生识别了作者,并使用利克特尺度评分信心.
主要成果:
- 在88.2%的病例中,ChatGPT准确识别了诊断;2个病例被排除在数据制造之外.
- 眼科医生在77.9%的病例中正确识别了作者,信心中等 (3.6/5).
- 人工智能产生的讨论被认为更通用,不相关,容易产生幻觉 (P < 0.01).
结论:
- 法律学士可以综合临床数据并产生眼科讨论.
- 尽管有潜力,但人工智能产生的内容存在可识别的局限性,需要进一步的现实世界验证.
- 在将AI整合到临床医疗保健提供中之前,严格的评估是必不可少的.


