精度和可读性之间的平衡:对人工智能聊天机器人的比较评估,用于对旋转手套撕裂患者的教育
Ali Can Koluman1, Mehmet Utku Çiftçi2, Ebru Aloğlu Çiftçi3,4
1Department of Orthopedics and Traumatology, Bakirkoy Dr. Sadi Konuk Training and Research Hospital, 34147 Istanbul, Turkey.
Healthcare (Basel, Switzerland)
|November 13, 2025
概括
人工智能 (AI) 聊天机器人在解释旋转手套撕裂方面表现不同. 双子 1.5 闪存和ChatGPT-4o提供更高的准确性,而DeepSeek-V3为患者教育提供更易读的内容.
科学领域:
- 整形外科和生物医学信息学
- 医疗保健中的人工智能
背景情况:
- 旋转手套撕裂是造成肩部疼痛和残疾的主要原因.
- 人工智能聊天机器人越来越多地用于患者教育,但它们的输出可靠性和可读性尚未得到证实.
- 国际指导方针主张患者材料在6-8年级阅读水平,一个标准往往不满足AI产生的内容.
研究的目的:
- 为了评估AI聊天机器人对旋转手套撕裂反应的可靠性,质量和可读性.
- 为了比较ChatGPT-4o,Gemini 1.5 Flash和DeepSeek-V3在旋转手套撕裂患者教育中的性能.
主要方法:
- 三个人工智能聊天机器人 (ChatGPT-4o,Gemini 1.5 Flash,DeepSeek-V3) 响应了20个患者关于旋转手套撕裂的问题.
- 整形外科医生评价了反应的可靠性和有用性 (利克尔特尺度) 和整体质量 (全球质量尺度).
- 使用六个经过验证的指数来评估可读性;统计分析包括克鲁斯卡尔-瓦利斯和ANOVA.
主要成果:
- 与DeepSeek-V3相比,Gemini 1.5 Flash和ChatGPT-4o表现出更高的可靠性和质量.
- DeepSeek-V3提供了最易读的文本 (Flesch-Kincaid等级水平≈6.5),但在准确性和质量方面得分最低.
- 没有AI模型实现了Flesch阅读易度得分超过60分,这表明复杂性超出了普通语言.
结论:
- 双子座1.5闪光和ChatGPT-4o在旋转手套撕裂信息的准确性和质量方面表现出色.
- DeepSeek-V3提供了更容易访问的内容,虽然不那么准确.
- 结合精确的人工智能模型和临床医生监督的混合方法可能会增强对旋转手套撕裂的患者教育.

