基于ChatGPT-5的大型语言模型分析与FDA批准的AI-CAD系统进行甲状腺结节超声波评估
Ziman Chen1, Mengting Ye2, Jieyi Liang2
1Department of Health Technology and Informatics, The Hong Kong Polytechnic University, Kowloon, Hong Kong.
European journal of radiology
|January 6, 2026
概括
聊天GPT-5显示甲状腺结节分类的可行性,但具有较低的诊断性能比S-Detect. 大型语言模型 (LLM) 尚未适用于医学成像应用.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 在瘤学瘤学.
背景情况:
- 多模式大语言模型 (LLM) 在医疗图像分析方面表现有前途.
- 在甲状腺超声波中LLMs的诊断能力需要验证.
- 聊天GPT-5是最新的多式联络法学士.
研究的目的:
- 探索ChatGPT-5用于甲状腺结节分类的可行性.
- 将ChatGPT-5的诊断性能与FDA批准的计算机辅助诊断系统S-Detect进行比较.
主要方法:
- 一项前性研究包括141名患有186个甲状腺结节的患者.
- S-Detect和ChatGPT-5分析了超声波图像以进行二进制分类.
- 组织病理学被用作黄金标准;卡帕统计数据,灵敏度,特异性,准确性和AUC被计算.
主要成果:
- 这两种系统都能区分良性和恶性结节 (P < 0.05).
- 对于ChatGPT-5 (卡帕=0.224),S-Detect显示了适度的协议 (卡帕=0.579) 和公平的协议.
- 与ChatGPT-5相比,S-Detect的灵敏度 (91.9%) 和准确度 (82.3%) 更高 (50.8%的灵敏度,59.1%的准确度). 对于S-Detect (77.4%) 的AUC明显大于ChatGPT-5 (63.3%).
结论:
- 聊天GPT-5可用于甲状腺结节的分类.
- 聊天GPT-5的诊断性能低于S-Detect系统的诊断性能.
- 像ChatGPT-5这样的当前LLM还不足以用于医学成像应用.


