从多个接口评估和比较人工智能生成的关于肩关节整形术的信息
Suhasini Gupta1, Brett D Haislup2, Anisha Tyagi3
1T.H. Chan School of Medicine, University of Massachusetts, Worcester, MA, USA.
Journal of shoulder and elbow surgery
|February 19, 2025
概括
微软CoPilot提供了比ChatGPT更可靠,更容易阅读的关于解剖学全肩关节整形术 (aTSA) 和逆向全肩关节整形术 (rTSA) 的信息. 然而,这两种人工智能工具都应该补充,而不是取代初级患者资源.
科学领域:
- 人工智能在医学中的应用
- 整形外科手术信息传播传播
- 患者教育 技术 技术
背景情况:
- 评估人工智能生成的关于肩关节整形术的信息的质量,准确性和可读性对于患者的理解至关重要.
- 解剖学全肩关节整形术 (aTSA) 和逆向全肩关节整形术 (rTSA) 是常见的骨科手术,有不同的适应症.
- 来自ChatGPT和CoPilot等人工智能工具的面向患者的信息需要严格评估临床使用.
研究的目的:
- 为了比较aTSA和rtSA患者查询的AI生成的响应的质量,准确性和可读性.
- 通过建立的医学和可读性基准来评估OpenAI的ChatGPT和微软的CoPilot提供的信息.
- 分析人工智能生成的医疗信息的可靠性和来源多样性.
主要方法:
- 对ChatGPT 3.5和CoPilot提出了关于aTSA和rTSA的30个常见患者问题.
- 使用DISCERN,JAMA基准标准,Flesch-Kincaid阅读易度得分 (FRES) 和Flesch-Kincaid等级水平 (FKGL) 评估了这些答案.
- 分析了CoPilot的引用来源,以确定其学术和医学相关性.
主要成果:
- 这两种AI接口都提供了"良好的"质量信息 (DISCERN>50),CoPilot的整体得分更高.
- 与ChatGPT相比,CoPilot表现出更高的可靠性 (更高的JAMA评分) 和可读性 (更高的FRES).
- CoPilot提供引用,其中学术来源的百分比值得注意,而ChatGPT的回复在阅读水平上更复杂和学术.
结论:
- 与ChatGPT相比,CoPilot为肩膀关节整形查询提供了更可靠,更容易访问和更好的参考信息.
- 尽管可读性得到了改进,但CoPilot的12年级阅读水平仍然可能挑战患者的理解能力.
- 人工智能生成的内容,包括CoPilot的内容,应作为补充资源,而不是主要来源,用于患者在肩关节整形方面的教育.


