通过ChatGPT 3.5,ChatGPT 4.0,Gemini和Microsoft Copilot生成的响应的可读性和适当性,用于折射手术常见问题
Fahri Onur Aydın1, Burakhan Kürşat Aksoy1, Ali Ceylan1
1University of Health Sciences Türkiye, Başakşehir Çam and Sakura City Hospital, Clinic of Ophthalmology, İstanbul, Türkiye.
Turkish journal of ophthalmology
|January 2, 2025
概括
大型语言模型 (LLM) 聊天机器人被评估为折射手术常见问题. 双子座提供了最合适的答案,尽管所有这些都需要大学阅读水平.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 越来越多地融入日常生活.
- 患者经常在网上寻找健康信息,包括关于折射手术的详细信息.
- 人工智能产生的医疗信息的准确性和清晰性至关重要.
研究的目的:
- 评估LLM聊天机器人对常见的折射手术问题的答案的适当性和可读性.
- 在这个领域比较不同LLM聊天机器人的性能.
主要方法:
- 四个受欢迎的LLM聊天机器人被查询了关于折射手术的40个常见问题.
- 两个经验丰富的折射外科医生评估了答案的适当性.
- 使用五个已建立的可读性索引来量化可读性.
主要成果:
- 双子号显示了最高的准确率 (87.5%),其次是Copilot (60%),聊天GPT 4.0 (52.5%),和聊天GPT 3.5 (45%).
- 所有评估的LLM聊天机器人都产生了难以阅读的内容,需要大学水平的教育.
- 与其他模型相比,双子座也显示出相对更好的可读性.
结论:
- 关于折射手术,LLM聊天机器人可能会提供不准确或不适当的响应.
- 虽然在测试模型中,双子座在答案适当性和可读性方面表现最好,但对于一般患者的理解需要显著改进.
- 医疗保健专业人员应谨慎行事,并核实LLM提供的信息,特别是对于复杂的医学主题,如折射手术.


