人工智能和放射科医生在BIRADS乳房超声波分类中的一致性:使用ChatGPT-4o进行的一项研究
Nigar Erkoc1, Elif Hazal Karlı1, Emre Tunay1
1Department of Radiology, Bagcilar Training and Research Hospital, Istanbul, Turkey.
Clinical imaging
|October 19, 2025
概括
在乳房超声波图像分析中,ChatGPT-4o与放射科医生之间存在中度一致. 虽然有希望获得明确的案例,但它与中间风险和文物作斗争,建议它作为一个补充工具.
科学领域:
- 医疗成像中的人工智能
- 放射学和诊断成像 放射学和诊断成像
- 乳房超声波解释解释
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于医学图像分析.
- 对人类专家进行AI诊断性能评估对于临床整合至关重要.
- 乳腺成像依赖于像BI-RADS这样的标准化分类系统.
研究的目的:
- 评估ChatGPT-4o在乳房超声波图像上分配BI-RADS类别的诊断一致性.
- 为了比较ChatGPT-4o的性能与经验丰富的放射科医生.
- 评估AI在乳腺损伤分类中的一致性.
主要方法:
- 追溯分析了350名患者的405张乳房超声波图像.
- 由两位经验丰富的放射科医生进行独立审查和BI-RADS分类.
- 通过使用标准化提示符,通过ChatGPT-4o对相同图像进行评估.
- 使用科恩的卡帕和弗莱斯的卡帕来衡量协议的统计分析.
主要成果:
- 放射科医生之间具有很高的观察者间一致性 (科恩的 κ = 0.832).
- 聊天GPT-4o与放射科医生 (κ = 0.5930.621) 有中度至实质性的一致性.
- 对 BI-RADS 1 和 5 的一致性最高;对 BI-RADS 3 的一致性较低.
- 放射科医生和AI之间的总体一致性很大 (弗莱斯的 κ = 0.682).
- 人工智能偶尔会超越BI-RADS 3病例和错误分类的解剖结构.
结论:
- 聊天GPT-4o在解释乳房超声波方面显示出潜力,特别是在明显的良性和恶性发现方面.
- 在分类中等风险病变和解释文物方面存在限制.
- 目前的人工智能性能表明,它可以作为专家放射科医生的辅助,而不是替代.


