在甲状腺细针吸收细胞学中的多式大型语言模型的快速工程和诊断准确性
Bibhas Saha Dalal1, Kaushik Mukhopadhyay2, Dwaipayan Roy3
1Department of Pathology, All India Institute of Medical Sciences (AIIMS), Kalyani, West Bengal, India.
Bioinformation
|September 22, 2025
概括
大型语言模型 (LLM) 在甲状腺细针吸收细胞学 (FNAC) 图像分析中显示出有限的准确性. 结构化提示改善了一些指标,但未能实现可靠的诊断性能,用于临床使用.
科学领域:
- 细胞病理学 细胞病理学
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 精细针吸收细胞学 (FNAC) 对于甲状腺结节的评估至关重要.
- 大型语言模型 (LLM) 在分析FNAC图像中的作用目前尚不清楚.
- 准确的细胞学分类会影响患者的管理和治疗决策.
研究的目的:
- 在甲状腺FNAC图像分析中评估两个领先的LLM (GPT-4o和Claude 3.5索内特) 的性能.
- 为了比较LLM驱动的FNAC解释的通用和结构化提示的有效性.
- 评估LLM输出与专家细胞病理学诊断的诊断准确性和一致性.
主要方法:
- 分析了63例甲状腺FNAC病例,每个病例使用了8张显微镜图像 (Pap和MGG染色,10x/40x放大).
- 两种LLM,GPT-4o和Claude 3.5 Sonnet,使用通用和结构化提示进行了测试.
- 基于贝塞斯达甲状腺细胞病理报告系统 (TBSRTC) 的一致性,灵敏度,特异性和评价者之间的协议来评估性能.
主要成果:
- 与通用提示相比,结构化提示提高了贝塞斯达一致性和接近匹配率.
- 然而,在LLM和人类专家之间,评审者间的一致性仍然很低 (κ ≤0.09).
- 虽然结构化提示的特异性达到100%,但灵敏度显著下降 (≤11.8%),表明持续的错误分类.
结论:
- 目前的LLM显示出潜力,但缺乏在甲状腺FNAC分析中独立临床应用所需的准确性和可靠性.
- 在将LLM整合到细胞病理学工作流程之前,领域特定的培训和严格的验证是必不可少的.
- 需要进一步的研究来完善LLM的能力,以应对外科病理学的复杂诊断任务.


