人工智能生成的关于肩部不稳定的患者信息仍然不理想:DeepSeek在内容完整性方面优于ChatGPT,而ChatGPT更易于阅读
Erman Öğümsöğütlü1, Bahri Bozgeyik2, Gazi Huri3,4
1Department of Orthopaedics and Traumatology, Yalova Training and Research Hospital, Yalova, Turkey.
概括
与ChatGPT相比,DeepSeek AI在肩部不稳定性信息的内容质量方面表现出色,在完整性和整体评分方面表现出色. 然而,ChatGPT为患者教育提供了更好的可读性.
科学领域:
- 医疗保健中的人工智能
- 医疗教育 技术 技术 医学教育
- 整形外科患者信息系统
背景情况:
- 患者教育对于管理肩部不稳定至关重要.
- 人工智能 (AI) 模型为传播健康信息提供了潜在的工具.
- 评估人工智能在提供准确和可访问的医疗信息方面的有效性至关重要.
研究的目的:
- 为了比较ChatGPT和DeepSeek人工智能模型在提供患者关于肩部不稳定的信息方面的表现.
- 评估人工智能对肩部不稳定的反应产生的内容质量和可读性.
主要方法:
- 对ChatGPT和DeepSeek提出了16个关于肩部不稳定的常见问题.
- 通过JAMA标准,DISCERN和4分利克特等级来评估内容质量.
- 使用弗莱什-金凯德可读性得分 (FRES) 和弗莱什-金凯德等级水平 (FKGL) 评估可读性.
主要成果:
- 两种AI模型都没有满足JAMA对患者信息的标准.
- 在DISCERN评分 (52.81比48.5) 和完整性 (p<0.001) 中,DeepSeek显著超过了ChatGPT.
- 与DeepSeek (FKGL 9.90,FRES 41.87) 相比,ChatGPT显示出更高的可读性 (FKGL 7.78,FRES 52.44) 与DeepSeek (FKGL 9.90,FRES 41.87) 相比.
结论:
- 这两种AI模型都为肩部不稳定性患者教育提供了普遍准确和临床相关的信息.
- 深度搜索在内容质量指标 (DISCERN,完整性) 中表现出色,而ChatGPT提供了更好的可读性.
- 人工智能模型显示出作为肩部不稳定的患者教育工具的潜力,每个模型都有不同的优势.

