甲状腺成像和报告数据系统 (TIRADS) 评估甲状腺结节中的人工智能模型之间的观察者间协议
Andrea Leoncini1, Pierpaolo Trimboli2,3
1Clinic for Radiology, Imaging Institute of Southern Switzerland, Ente Ospedaliero Cantonale (EOC), Bellinzona, Switzerland.
Endocrine
|May 15, 2025
概括
人工智能 (AI) 模型在使用不同的甲状腺成像和报告数据系统 (TIRADS) 评估甲状腺结节 (TN) 恶性瘤风险时显示变量一致. 这种变化凸显了临床医生和患者对甲状腺结节评估中AI解释的认识的需要.
科学领域:
- 医疗成像中的人工智能
- 放射学和诊断成像 放射学和诊断成像
- 瘤学和癌症研究研究.
背景情况:
- 超声波 (US) 对于评估甲状腺结节 (TN) 恶性瘤风险 (RoM) 是至关重要的.
- 国际甲状腺成像和报告数据系统 (TIRADSs) 指导TN评估.
- 人工智能 (AI) 的整合需要了解AI对TIRADS的解释,并同意TN风险分层.
研究的目的:
- 在评估TN RoM时,分析AI模型之间的观察者间协议 (IOA).
- 在不同的TIRADS类别 (ACR-TIRADS,EU-TIRADS,K-TIRADS) 中比较AI性能.
- 评估AI对TIRADS术语的解释以及风险评估的一致性.
主要方法:
- 我们使用了三种人工智能模型 (ChatGPT,Google Gemini,Claude).
- 人工智能评估使用基于ACR-TIRADS,EU-TIRADS和K-TIRADS的场景进行.
- 使用kappa (κ) 值量化观察者间的一致性.
主要成果:
- 对IOA的Kappa值在AI模型和TIRADS中存在显著差异.
- 在ACR-TIRADS中, κ在0.53到0.90之间.
- 在EU-TIRADS中, κ从0.62到0.73.7不等.
- 在K-TIRADS中, κ在0.61到0.88.8之间.
结论:
- 在人工智能驱动的TN风险评估中存在不可忽视的变化.
- 临床医生和患者应被告知AI解释的可变性.
- 需要进一步的研究来标准化AI在甲状腺结节评估中的应用.


