一个大型语言模型的性能评估在角质:一个比较研究的ChatGPT-3.5,ChatGPT-4.0,双子座,副驾驶员,聊天和困惑
Ali Hakim Reyhan1, Çağrı Mutaf1, İrfan Uzun1
1Department of Ophthalmology, Faculty of Medicine, Harran University, 63100 Şanlıurfa, Türkiye.
Journal of clinical medicine
|November 9, 2024
概括
这项研究评估了聊天机器人对角信息的评估. 双子座和Copilot提供了卓越的可靠性和质量,尽管可读性往往对患者来说具有挑战性.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 角患者教育依赖于可访问的在线信息.
- 评估聊天机器人生成的健康信息的准确性和质量至关重要.
研究的目的:
- 评估受欢迎的聊天机器人在回答有关角的查询时的可靠性和质量.
- 为了比较ChatGPT-3.5,ChatGPT-4.0,Gemini,Copilot,Chatsonic和Perplexity的性能,我们使用了这些工具.
主要方法:
- 使用mDISCERN和全球质量评分 (GQS) 评估了聊天机器人的响应.
- 用九个经过验证的可读性测试来评估可读性.
- 网站的问责也使用JAMA基准分数进行了检查.
主要成果:
- 与其他聊天机器人相比,Gemini和Copilot显示出更高的可靠性 (mDISCERN) 和质量 (GQS).
- 关于"什么是角?"的信息 是最常见的提供和得分很好.
- 聊天机器人可读性经常超过推水平,这对患者的健康素养构成了挑战.
结论:
- 双子座和Copilot是可靠的人工智能工具,用于 keratoconus 信息,显示出更好的可靠性和质量.
- 需要改进可读性,以使人工智能生成的内容与患者健康素养保持一致.
- 进一步的研究应侧重于优化人工智能工具,以便在眼科中有效的患者教育.
更多相关视频
07:51Full-Field Optical Coherence Microscopy for Histology-Like Analysis of Stromal Features in Corneal Grafts
Published on: October 21, 2022
1.6K
07:29Three Different Protocols of Corneal Collagen Crosslinking in Keratoconus: Conventional, Accelerated and Iontophoresis
Published on: November 12, 2015
19.8K
