评估大型语言模型用于对良性和恶性肺瘤的自动诊断
Yinghan Jiang1, Jianzhong He2, Bingsen He3
1Department of Pathology, The First People's Hospital of Yunnan Province/The Affiliated Hospital of Kunming University of Science and Technology, Kunming, Yunnan 650032, China; Academy of Biomedical Engineering, Kunming Medical University, Kunming, Yunnan 650500, China.
Pathology, research and practice
|November 27, 2025
概括
像ChatGPT-4o这样的大型语言模型显示了帮助肺瘤诊断的潜力. 虽然不取代病理学家,但人工智能为挑战良性肺病变提供了快速分析,提高了诊断效率.
科学领域:
- 计算病理学计算病理学
- 人工智能在诊断中的应用
- 瘤学研究的研究.
背景情况:
- 肺部瘤的组织病理学诊断具有挑战性.
- 人工智能和大型语言模型提供了新的诊断辅助工具.
研究的目的:
- 评估ChatGPT-4o在从组织病理图像诊断肺部瘤方面的表现.
- 将AI诊断能力与经验丰富的病理学家进行比较.
主要方法:
- 对250张基因病理图像的回顾性分析 (每张50张LUAD,LUSC,神经内分泌瘤,支气管腺瘤,肺瘤).
- 聊天GPT-4o分析了HE染色图像用于诊断解释.
- 性能指标 (准确度,灵敏度,特异性,F1得分,时间) 与两位病理学家相比.
主要成果:
- 聊天GPT-4o的准确率达到了79.6%,低于人类病理学家 (p<0.001).
- 人工智能在良性病变上表现相对较好,但在差异化恶性瘤和神经内分泌瘤方面遇到了困难.
- 人工智能诊断速度接近实时 (<10秒),比人类快得多.
结论:
- 聊天GPT-4o展示了作为一个快速,可扩展的AI工具的潜力,用于肺瘤诊断,特别是良性病变.
- 人工智能可以作为辅助来支持病理学家,并提高临床病理学效率.
- 目前的AI性能并不能取代专家病理学家的判断.


