基准测试四个大型语言模型在解决中国患者关于干眼疾病的询问方面的表现:一项两阶段研究
Runhan Shi1,2,3,4, Steven Liu5, Xinwei Xu6
1Department of Ophthalmology and Vision Science, State Key Laboratory of Molecular Engineering of Polymerse, Fudan University, Shanghai, 200031, China.
Heliyon
|August 8, 2024
概括
像GPT-4和Baichuan 2这样的大型语言模型 (LLM) 对回答中国患者干眼病 (DED) 问题有希望. GPT-4提供了更完整的答案,而Baichuan 2提供了更易于理解的建议.
科学领域:
- 医疗保健中的人工智能
- 眼科医生 眼科 眼科
- 自然语言处理自然语言处理.
背景情况:
- 干眼病 (DED) 是一种普遍影响许多患者的疾病.
- 获得可靠的健康信息对于管理DED等慢性疾病至关重要.
- 大型语言模型 (LLM) 正在成为患者教育和支持的潜在工具.
研究的目的:
- 评估四个LLM (GPT-4,PaLM 2,Qwen,Baichuan 2) 在响应患者关于DED的询问时的表现.
- 为了比较LLM生成的响应的准确性,完整性,可读性,有用性和安全性.
- 在现实临床环境中评估患者和专家对LLM反应的满意度.
主要方法:
- 这是一项两阶段的研究,包括横截面测试和临床评估.
- 眼科医生使用5分利克特尺度对LLM的正确性,完整性,可读性,帮助性和安全性进行评分.
- 患有DED的患者评估了表现最佳的LLM (GPT-4,Baichuan 2) 的反应,以满足和可读性.
主要成果:
- 在最初的评估中,GPT-4在所有五个领域都表现出了卓越的表现.
- 可读性分析表明,GPT-4的反应比其他LLM更复杂.
- 在第二阶段,GPT-4和Baichuan 2的表现都很好,但GPT-4提供了更完整的答案,而Baichuan 2提供了更全面的建议.
结论:
- 具体来说,LLM,特别是GPT-4和Baichuan 2,具有很大的潜力,可以为中国患者提供关于DED的准确和全面信息.
- 需要进一步的研究来优化LLM响应,以在特定的医疗环境中获得清晰度和患者理解.
- 将LLM整合到患者护理途径中可以提高健康素养和DED的自我管理.
更多相关视频
08:04A Rabbit Model of Aqueous-Deficient Dry Eye Disease Induced by Concanavalin A Injection into the Lacrimal Glands: Application to Drug Efficacy Studies
Published on: January 24, 2020
12.4K
04:06Author Spotlight: Challenges in Developing Dry Eye Animal Models and Future Research Directions
Published on: February 9, 2024
1.9K
