大型语言模型如何准确地回答患者关于前十字带撕裂的问题? 一个比较研究研究
Salim Youssef1, Anton Brehmer1, Peter Melcher2
1University of Leipzig, Department of Orthopedics, Trauma and Plastic Surgery, Leipzig, Germany.
The Knee
|November 18, 2025
概括
五个领先的大型语言模型 (LLM) 在回答患者关于前十字带 (ACL) 撕裂问题的问题的准确性方面进行了评估. DeepSeek和Grok的准确性高于Llama,这表明模型选择对于可靠的AI驱动的患者教育至关重要.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 整形外科手术 整形外科手术
背景情况:
- 大型语言模型 (LLM) 在医学中越来越多地被使用,这促使人们对其对患者教育的可靠性进行审查.
- 在公开可用的LLM中显著的性能差异需要进行比较分析,特别是在寻求AI健康建议的年轻活跃人群中普遍存在的前十字带 (ACL) 损伤等疾病.
研究的目的:
- 评估和直接比较五个领先的LLMs在响应常见的患者询问关于ACL撕裂的准确性.
- 识别用于骨科患者教育的AI模型之间的性能潜在差异.
主要方法:
- 一个系统的搜索确定了14个关于ACL撕裂的常见患者问题.
- 询问了五个LLM (ChatGPT-4,Gemini 2.0,Llama 3.1,DeepSeek-V3,Grok3) 的问题.
- 骨科顾问在五点的利克特级别上对响应的准确性进行了评分;字数作为可读性代理. 统计分析涉及ANOVA与Tukey的HSD后期测试.
主要成果:
- 所有的LLM都获得了平均准确度3分 (大多数准确) 或更高.
- 而DeepSeek (3.61) 和Grok (3.59) 的平均准确度明显高于Llama (3.25;P < 0.05).
- 聊天GPT (3.48) 和双子座 (3.52) 也表现良好. 较长的答案与更高的准确性相关,而拉玛的较短答案不那么准确.
结论:
- 所有评估的LLM都显示出患者在ACL受伤方面的教育潜力,但存在显著的绩效差异,这凸显了模型选择的重要性.
- 临床专家评估证实了不同程度的准确性,尽管需要进一步的研究来评估准则的遵守和患者的理解.
- 这些发现强调了需要仔细考虑在医疗应用中选择LLM的必要性,特别是在面向患者的信息方面.
更多相关视频
06:28Anterior Cruciate Ligament Transection and Synovial Fluid Lavage in a Rodent Model to Study Joint Inflammation and Posttraumatic Osteoarthritis
Published on: September 2, 2025
1.0K
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1000
