人工智能在解决有关骨质疏松症解剖症管理问题的表现
John D Milner1, Matthew S Quinn1, Phillip Schmitt1
1Department of Orthopaedic Surgery, Brown University, Warren Alpert Medical School, Providence, Rhode Island.
Sports health
|April 2, 2025
概括
像ChatGPT和Gemini这样的大型语言模型 (LLM) 显示了回答有关骨质疏松症剖析 (OCD) 的骨科问题的潜力. 聊天GPT表现出更高的清晰度和整体得分,这表明它可能是一个更适合于骨科信息检索的AI.
科学领域:
- 人工智能在医学中的应用
- 整形外科手术 整形外科手术
- 医疗信息检索 医疗信息检索
背景情况:
- 大型语言模型 (LLM) 越来越多地被用作信息来源.
- 很少有研究评估了对骨科疾病的LLM准确性,特别是骨质疏松症剖析 (OCD).
研究的目的:
- 评估ChatGPT和双子座关于骨质疏松症剖析 (OCD) 的反应的准确性和相关性.
- 将LLM回应与美国骨科外科医生学会 (AAOS) 临床实践指南进行比较.
主要方法:
- 使用2级证据的队列研究设计.
- 基于AAOS强迫症指南的提示被用于查询ChatGPT和Gemini.
- 七位整形外科医生使用5分利克特尺度对LLM的响应进行了评分,包括相关性,准确性,清晰性,完整性,基于证据的质量和一致性.
主要成果:
- 聊天GPT和Gemini都表现出色,在相关性和准确性方面得分很高.
- 在清晰度方面,ChatGPT获得了最高的平均得分 (4.771 ± 0.141).
- 双子座在相关性和准确性方面得分最高 (4.286 ± 0.296).
- 基于证据的答案在两个LLM中获得了最低的分数 (ChatGPT: 3.857 ± 0.352;双子座: 3.743 ± 0.353).
- 评价者之间的可靠性在0.4到0.67之间,准确性具有最高的可靠性 (0.67).
结论:
- 课程对提供关于强迫症诊断和治疗的准确和相关信息充满希望.
- 在骨科信息方面,ChatGPT可能比双子座更有效.
- 需要进一步的研究来验证LLM作为各种骨科疾病的可靠来源.


