在计算脊柱不稳定性新形成评分 (SINS) 中评估保护隐私的大型语言模型的准确性
Li Yi Tammy Chan1, Ding Zhou Matthew Chan1, Yi Liang Tan1
1Department of Diagnostic Imaging, National University Hospital, Singapore 119074, Singapore.
Cancers
|July 12, 2025
概括
克劳德3.5从放射学报告中准确计算了脊柱不稳定性瘤得分 (SINS),显示了与临床医生的高度一致. 这表明大型语言模型 (LLM) 可以帮助评估脊髓转移.
科学领域:
- 医学成像和人工智能 医学成像和人工智能
- 瘤学和放射学 在线诊断
- 在医疗保健中的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 在医疗保健中越来越多地被使用,在诊断放射学中有潜在的应用.
- 脊柱不稳定性新型瘤评分 (SINS) 对于评估脊柱转移至关重要,但从放射学报告计算的LLM准确性尚未得到充分证实.
研究的目的:
- 评估两个维护隐私的LLM,Claude 3.5和Llama 3.1在使用放射学报告和电子医疗记录计算SINS时的准确性.
- 为了在SINS计算中比较这些LLM与人类临床医生阅读器的性能.
主要方法:
- 对124份脊髓转移患者的放射学报告进行了回顾性分析.
- 由三个专家读者 (参考标准),两个整形外科住院医生和两个法学士 (Claude 3.5,Llama 3.1) 进行独立的SINS计算.
- 评价者间的协议用总SINS和Gwet's Kappa用于单个组件的类内相关系数 (ICC) 来衡量.
主要成果:
- 无论是LLM还是临床医生,都与总SINS的参考标准达成了近乎完美的一致.
- 克劳德 3.5 (ICC = 0.984) 与拉玛 3.1 (ICC = 0.829) 相比,表现优越.
- 在所有SINS组件中,Claude 3.5的性能与临床医生读数 (ICCs从0.926到0.986) 相比.
结论:
- 克劳德3.5在计算SINS方面表现出很高的准确性,表明其作为临床工作流程中宝贵的工具的潜力.
- 像Claude 3.5这样的LLM可能有助于减少临床医生的工作量,并在评估脊髓转移时保持诊断可靠性.
- 由于观察到的性能变化,需要进一步验证和优化才能广泛将LLMs用于SINS计算的临床集成.


