评估人工智能模型在脊椎形分类和建议治疗方法中的准确性
Artur Fabijan1, Agnieszka Zawadzka-Fabijan2, Robert Fabijan3
1Department of Neurosurgery, Polish-Mother's Memorial Hospital Research Institute, 93-338 Lodz, Poland.
Journal of clinical medicine
|July 27, 2024
概括
开源人工智能模型 (OSAIMs) 在分类脊柱形严重程度方面表现有前途. 然而,人工智能模型校准对于准确的临床决策和及时的治疗建议至关重要.
科学领域:
- 人工智能在医学中的应用
- 放射学和成像分析分析.
- 骨科诊断 骨科诊断 骨科诊断
背景情况:
- 开源人工智能模型 (OSAIMs) 正在获得IT和医学的发展,用于诊断和治疗应用.
- 人工智能对临床诊断越来越感兴趣,需要对医学图像解释的OSAIM进行评估.
- 本研究的重点是评估OSAIMs用于分类脊椎病严重程度,并根据放射性描述指导治疗.
研究的目的:
- 评估各种开源人工智能模型在分类脊柱形严重性的表现.
- 评估这些人工智能模型根据放射性描述推适当治疗的能力.
- 在临床诊断背景下比较不同OSAIMs,包括一般和专业模型的准确性.
主要方法:
- 采用了两阶段的方法,分析了单曲线脊椎病的描述.
- 人工智能模型解释了放射性描述,然后由两个独立的神经外科医生进行评估.
- 统计分析包括沙皮罗-威尔克测试,中位数/四分位数范围描述,Fleiss' kappa对评价者之间的可靠性,以及性能指标 (准确性,灵敏度,特异性,F1分数).
主要成果:
- 聊天GPT 4,微软Copilot和PopAi展示了基于科布角范围的脊椎病严重程度和治疗建议的准确分类.
- 双子座和克劳德模型需要进一步校准,以符合脊椎病评估的临床标准.
- PMC-LLaMA 13B对中度脊椎病的分类范围扩大,这可能会影响临床决策和干预时间.
结论:
- 虽然一些OSAIM显示出在脊椎病评估中临床使用的潜力,但它们的准确性各不相同.
- 人工智能模型的持续改进和校准对于提高其临床适用性和可靠性至关重要.
- 这些发现强调了在将OSAIM纳入骨科诊断的常规临床实践之前严格评估的重要性.


