评估大型语言模型来回答患者关于眼睛切除手术的问题
Niloufar Bineshfar1, Chloe Shields1, Natalia Davila1,2
1Department of Ophthalmology, Bascom Palmer Eye Institute, University of Miami Miller School of Medicine, Miami, Florida, USA.
Orbit (Amsterdam, Netherlands)
|September 30, 2025
概括
双子座和ChatGPT提供关于眼睛切除手术常见问题的准确信息. 双子座提供了更一致和可读的答案,尽管这两种模型都需要对患者教育进行仔细监督.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 患者教育对于了解眼睛切除手术,如核切除和内脏切除,至关重要.
- 大型语言模型 (LLM) 显示出在传播医疗信息方面的潜力.
- 评估LLM在回答患者特定的外科问题方面的表现是必不可少的.
研究的目的:
- 评估ChatGPT-4和Gemini在回答有关眼睛切除手术的常见问题方面的表现.
- 为了比较LLM生成的响应的一致性,准确性,适当性和潜在危害.
- 为了评估患者理解的LLM响应的可读性.
主要方法:
- 编制了一套24个常见问题关于核化和内脏切除的问题.
- 每个常见问题都向ChatGPT-4o和Gemini提出了三次.
- 分析了答案的一致性,准确性,适当性,潜在危害和可读性 (弗莱什分数).
主要成果:
- 与ChatGPT.com相比,双子号显示出更好的响应一致性 (p=0.043) 和可读性 (Flesch Ease: 39.0,Flesch-Kincaid: 11.6).
- 聊天GPT的响应时间较长 (169.3 vs 109.9个字;p<0.001).
- 这两种LLM都显示了可比的准确性 (79.2%的Gemini,77.1%的ChatGPT正确) 和低的危害潜力,引用学术和医学来源.
结论:
- 在准确性和安全性方面,ChatGPT和Gemini在回答眼睛切除手术常见问题方面是相似的.
- 双子座的反应更加一致和可读,但这两种LLM可能都超过了最佳的患者教育可读性水平.
- 临床医疗法可以帮助患者沟通和临床教育,但需要仔细实施和监督.


