在IBD基因病理学报告的解释中GPT-5的性能
Marcello Maida1,2, Alessandro Vitello1,2, Fabio Salvatore Macaluso3
1Department of Medicine and Surgery, University of Enna "Kore", Enna, Italy.
United European gastroenterology journal
|December 17, 2025
概括
像GPT-5这样的大型语言模型在解释炎症性肠病 (IBD) 组织学报告方面表现有前途,达到高准确度. 然而,GPT-5在IBD-Unclassified诊断方面遇到了困难,这凸显了专家监督的必要性.
科学领域:
- 胃肠病学 胃肠病学
- 数字病理学数字病理学
- 人工智能在医学中的应用
背景情况:
- 组织病理学解释对于诊断炎症性肠病 (IBD),区分克罗恩病 (CD),性结肠炎 (UC),IBD-未分类 (IBD-U) 和非IBD结肠炎 (NIBDC) 是至关重要的.
- 观察者之间的变化和有限的专业知识可能会损害IBD组织学中的诊断准确性.
- 大型语言模型 (LLM) 为解释复杂的组织学报告提供了临床支持的潜在解决方案.
研究的目的:
- 评估GPT-5在解释IBD组织学报告中的诊断性能.
- 将GPT-5的准确性与人类专家进行比较,包括胃肠病理学家和胃肠病学家.
- 评估基于LLM的解释与IBD诊断中的参考标准的可靠性和一致性.
主要方法:
- 分析了100份现实生活中的四个诊断类别 (CD,UC,IBD-U,NIBDC) 的乳腺直肠镜组织学报告.
- 由专家病理学家建立一个参考标准.
- 由GPT-5独立分类,胃肠道病理学家,IBD专家胃肠道学家和非专家胃肠道学家.
主要成果:
- GPT-5获得了最高的准确率 (76.0%) 和与参考标准的实质一致 (κ=0.671),优于人类组 (准确率为63.2%-69.2%, κ=0.508-0.588).
- 对于CD和UC来说,GPT-5显示出完美的回忆力,对于NIBDC来说,回忆力高 (96.0%),但对于IBD-U来说,回忆力差 (8.0%) 和F1评分 (14.3%).
- 在病理学家和IBD专家中,评价者之间的可靠性是适度的,在非专家中是公平的,这表明人类解释的变化.
结论:
- 在解释IBD组织学报告时,GPT-5显示出可靠的性能和高准确性,作为潜在的支持工具.
- 该法学士的实用性是显著的,特别是在设置有限的访问专家病理学家或IBD专家的设置.
- 在诊断IBD-Unclassified时,GPT-5的不可靠性需要仔细考虑,并对该类别进行持续的专家人体审查.
更多相关视频
07:43Using 22C3 Anti-PD-L1 Antibody Concentrate on Biopsy and Cytology Samples from Non-small Cell Lung Cancer Patients
Published on: September 25, 2018
10.9K
06:52Optimized Workflow for Iterative Bleaching Extends Multiplexity Imaging of Highly Autofluorescent Clinical Samples
Published on: July 11, 2025
740
