在病理学报告中提高恶性瘤检测和瘤分类:对大型语言模型的比较评估
Sabrina B Neururer1,2, Hasan Taha1,2, Helmut Muehlboeck1
1Department of Clinical Epidemiology, Tirol Kliniken GmbH, Innsbruck, Tirol, Austria.
Studies in health technology and informatics
|April 24, 2025
概括
大型语言模型 (LLM) 显著提高了癌症数据分类的准确性和效率. 这些先进的人工智能工具对提高公共卫生监测和瘤学临床决策具有很大的前景.
科学领域:
- 计算病理学计算病理学
- 人工智能在瘤学中的应用
- 医疗信息学 医疗信息学
背景情况:
- 癌症注册需要准确有效的恶性瘤记录.
- 目前的手工方法是劳动密集型的,容易出现错误.
研究的目的:
- 评估大型语言模型 (LLM) 在分类恶性瘤中的有效性.
- 评估从病理学报告中识别瘤类型的LLM绩效.
主要方法:
- 使用了227份病理学报告的合成数据集.
- 四个LLM和一个基于分数的算法与专家标记的数据进行了对比.
主要成果:
- LLM,特别是GPT-4o和Llama3.3,实现了高灵敏度和特异性.
- 在恶性瘤检测和瘤分类方面,LLM显著超过了传统算法.
结论:
- 在癌症数据分类的准确性和效率方面,LLM提供了显著的进步.
- 在癌症治疗方面,LLM显示出改善公共卫生监测和临床决策的潜力.


