评估大型语言模型在患者教育和临床决策支持旋转带损伤:一个两阶段的比较研究
Yi-Lin Wang1, Li-Chao Tian1, Jing-Yuan Meng1
1Guanghua Hospital Affiliated to Shanghai University of Traditional Chinese Medicine, NO.1508, Yan'an West Road, Shanghai, 200052, China.
BMC medical informatics and decision making
|August 5, 2025
概括
双子座在回答旋转带损伤问题方面表现出卓越的准确性,而ChatGPT-4o在患者互动清晰度方面表现出色. 这两种大型语言模型都显示出医疗应用的前景.
科学领域:
- 医疗人工智能 医疗人工智能
- 骨科知识传播和传播
- 在医疗保健中的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 在医疗保健中越来越多地用于信息检索和患者沟通.
- 评估LLMs的准确性和患者友好性对于特定的医疗条件,如旋转手腕损伤至关重要.
- 需要对领先的LLM (ChatGPT-4o,ChatGPT-o1,Gemini,ERNIE Bot) 进行比较分析,以了解他们的能力.
研究的目的:
- 评估四个LLM在回答旋转手腕受伤问题的准确性.
- 在患者互动场景中评估LLM的性能.
- 为了比较ChatGPT-4o和Gemini在提供以患者为中心的响应方面的有效性.
主要方法:
- 第一个阶段:四名法学士回答了医生对旋转手套损伤的问题.
- 通过使用多项选择和临床问题来评估绩效的准确性和清晰度.
- 第二阶段:20名患者与前两名LLM (ChatGPT-4o,Gemini) 进行了互动,医生对答案的满意度,可读性,准确性,有用性和安全性进行了评分.
主要成果:
- 双子号在回答旋转手腕损伤问题方面取得了最高的整体准确性.
- 在患者互动中,ChatGPT-4o表现出更高的患者满意度和可读性得分.
- 医生评估表明,ChatGPT-4o在准确性,完整性,可读性,有用性和安全性方面表现优于Gemini.
结论:
- LLM,特别是ChatGPT-4o和Gemini,在理解和传达旋转手套损伤信息方面显示出巨大的潜力.
- 这两种模式在不同方面都表现出优势:双子座用于事实准确性,ChatGPT-4o用于患者参与.
- 进一步发展LLMs有望提高医疗知识传播和骨科患者支持.


