基于ACR TI-RADS的甲状腺结节超声波特征分析中ChatGPT-4o在观察者内部和观察者间的可靠性:基于图像的研究
Ziman Chen1, Nonhlanhla Chambara2, Shirley Yuk Wah Liu3
1Department of Health Technology and Informatics, The Hong Kong Polytechnic University, Kowloon 999077, Hong Kong.
Diagnostics (Basel, Switzerland)
|October 29, 2025
概括
像ChatGPT-4o这样的大型语言模型对某些甲状腺结节超声波特征显示了适度的观察者内部一致性,但与专家分析的一致性很低. 需要进一步开发可靠的AI辅助医学图像解释.
科学领域:
- 人工智能在医学中的应用
- 医学成像分析 医学成像分析
- 甲状腺结节诊断 甲状腺结节诊断
背景情况:
- 大型语言模型 (LLM) 的进步使医疗图像分析的应用成为可能.
- 使用美国放射学学院甲状腺成像报告和数据系统 (ACR TI-RADS) 准确评估甲状腺结节超声波特征,对于患者管理至关重要.
- 评估LLM在这一领域的表现对于临床整合至关重要.
研究的目的:
- 评估基于ACR TI-RADS的甲状腺结节超声波特征分析中ChatGPT-4o在观察者内部的一致性.
- 评估ChatGPT-4o与专家放射科医生在分类这些特征之间的观察者间协议.
- 为了确定与专家分类相比,ChatGPT-4o的评估的一致率.
主要方法:
- 一项横截面研究分析了100个甲状腺结节的超声波图像.
- 根据ACR TI-RADS指南,ChatGPT-4o评估了结节的特征 (组成,回声性,形状,边缘,回声焦点).
- 观察者内部可靠性通过在一周后重复分析来测试;观察者内部可靠性与使用科恩的卡帕和一致率的专家放射科医生进行了评估.
主要成果:
- 聊天GPT-4o在组合 (Kappa=0.449) 和回声源焦点 (Kappa=0.404) 上显示出适度的观察者内部协议,在回声源性上显示出实质性的协议 (Kappa=0.795).
- 对形状 (Kappa=-0.051) 和利率 (Kappa=0.154) 的一致性较低.
- 聊天GPT-4o与专家之间的观察者间一致性通常很低 (卡帕范围: -0.006至0.238),总体一致率在46.6%至48.2%之间.
结论:
- ChatGPT-4o对甲状腺结节超声波特征表现出可变的观察者内部一致性.
- 在大多数特征中,观察者之间与专家分析的一致性很低,这表明当前人工智能对此任务的能力有限.
- 虽然ChatGPT-4o在特定功能方面具有前景,但在甲状腺结节超声波分析中需要显著改进,以获得可靠的专家级性能.


