从超声波图像中估计甲状腺结节特征和癌症风险的ChatGPT-4的准确性
Esteban Cabezas1, David Toro-Tobon2, Thomas Johnson3
1Knowledge and Evaluation Research Unit, Division of Endocrinology, Diabetes, Metabolism, and Nutrition, Department of Medicine, Mayo Clinic, Rochester, Minnesota.
概括
人工智能模型GPT-4和GPT-4o显示了甲状腺结节超声波分析的潜力,但需要进一步改进. 它们目前的性能不足于最佳,特别是对于高风险的结节,在临床使用之前需要更多的验证.
科学领域:
- 医疗成像中的人工智能
- 放射学和诊断成像 放射学和诊断成像
- 内分泌学和甲状腺学.
背景情况:
- 甲状腺结节很常见,需要准确的特征来进行适当的管理.
- 美国放射学学院甲状腺成像报告和数据系统 (TI-RADS) 为分类甲状腺结节提供了一个标准化的框架.
- 人工智能工具正在探索,以协助医疗图像分析和提高诊断效率.
研究的目的:
- 评估GPT-4和GPT-4o在识别甲状腺结节特征和TI-RADS类别的超声波图像中的诊断性能.
- 将这些AI模型的准确性与专家放射科医生的评估进行比较.
主要方法:
- 一项比较验证研究,使用来自开放数据库的202张甲状腺超声波图像.
- 专家放射科医生为TI-RADS的特征和类别制定了一个参考标准,用于完整和截图的图像.
- 要求GPT-4和GPT-4o分析图像,并将它们的输出与已建立的参考标准进行比较.
主要成果:
- 对于大多数TI-RADS类别的完整图像,GPT-4的特异性很高,但敏感性很低,导致整体准确性变化.
- 对于低风险结节,GPT-4获得了25.0%的灵敏度和99.5%的特异性. 在中度可疑类别中,敏感度为75%,特异性为22.2%.
- 人工智能模型很难识别特定的特征,如异声回声性和回声焦点,并且在裁剪图像时,性能略有下降.
结论:
- GPT-4和GPT-4o显示了提高甲状腺结节分类效率的潜力.
- 目前的人工智能模型的性能不足于最佳,特别是在高风险的甲状腺结节方面.
- 进一步的研究,改进和验证对于这些AI工具在甲状腺成像中的临床实施至关重要.


