评估通用大型语言模型作为宫细胞学诊断支持工具的评估
Thiyaphat Laohawetwanit1, Sompon Apornvirat1, Aleksandra Asaturova2
1Division of Pathology, Chulabhorn International College of Medicine, Thammasat University, Pathum Thani, Thailand.
Pathology, research and practice
|August 10, 2025
概括
像ChatGPT o3和Gemini 2.5 Pro这样的通用大型语言模型 (LLM) 在诊断宫细胞学方面显示出有限的准确性. 这些人工智能工具不推用于常规诊断支持,原因是不一致性,特别是异常细胞发现.
科学领域:
- 计算病理学计算病理学
- 医学中的人工智能
- 宫癌查 宫癌查
背景情况:
- 一般用途的大型语言模型 (LLM) 的细胞病理学应用在很大程度上尚未被探索.
- 评估人工智能工具用于宫细胞学诊断支持对于推进查技术至关重要.
研究的目的:
- 为了评估定制的ChatGPT-4 (GPT),ChatGPT o3和Gemini 2.5 Pro.的诊断准确性和一致性.
- 确定这些LLM作为宫细胞学诊断支持工具的实用性.
主要方法:
- 分析了200张帕帕尼科劳染色的宫细胞学图像 (100张正常,100张异常).
- 图像被GPT,ChatGPT o3和Gemini 2.5 Pro多次评估. 这些图像被GPT,ChatGPT o3和Gemini 2.5 Pro多次评估.
- 对每个AI模型的诊断准确性和一致性进行了测量.
主要成果:
- 在区分正常细胞与异常细胞学方面,LLM表现出高灵敏度 (85.4%-100%),但具有可变的特异性 (67.2%-92.7%).
- 聊天GPT o3在识别正常病例方面表现出色,但在LSIL,HSIL和ADC等异常诊断方面遇到了困难.
- 连锁思维提示和多个图像提交都没有显著改善AI准确性;对感染的性能很差.
结论:
- 聊天GPT o3和双子座2.5 Pro具有互补的强度,但缺乏用于异常宫细胞学的必要的准确性和一致性.
- 目前不建议使用通用LLM作为宫细胞学中独立的诊断支持工具.


