在不可切除的肝细胞癌中预测免疫疗法反应:大型语言模型和人类专家的比较研究
Jun Xu1,2,3,4, Junjie Wang1,2, Junjun Li5
1Hefei Cancer Hospital of CAS, Institute of Health and Medical Technology, Hefei Institutes of Physical Science, Chinese Academy of Sciences, Hefei, 230031, P. R. China.
Journal of medical systems
|May 15, 2025
概括
大型语言模型 (LLM) 在预测肝细胞癌 (HCC) 免疫治疗反应方面表现有前途. 双子-GPT的准确性与高级医生相美,为HCC治疗的临床决策提供了一个潜在的新工具.
科学领域:
- 在瘤学瘤学.
- 人工智能的人工智能
- 医学成像分析 医学成像分析
背景情况:
- 肝细胞癌 (HCC) 是一种具有有限的免疫疗法反应预测生物标志物的侵袭性恶性瘤.
- 大型语言模型 (LLM) 为临床决策中的多模式数据分析提供了潜力.
- 在预测HCC免疫疗法反应方面,LLM与人类专家的比较有效性尚未得到充分证实.
研究的目的:
- 评估GPT-4,GPT-4o和Gemini在预测无法切除的HCC的免疫治疗反应方面的表现.
- 将LLM绩效与不同专业水平的放射科医生和瘤学家进行比较.
- 评估LLM协议并确定最佳策略,以提高预测准确度.
主要方法:
- 使用多模式数据 (临床信息和CT图像) 对186名无法切除的HCC患者的回顾性分析.
- 通过使用"投票"和"OR规则"方法的零射击提示来评估LLM (GPT-4,GPT-4o,Gemini).
- 绩效指标包括准确度,灵敏度,曲线下的面积 (AUC) 和评价者之间的一致性 (kappa统计).
主要成果:
- 使用"OR规则方法",GPT-4o实现了65%的准确度和47%的灵敏度,与中间医生相比.
- 双子-GPT显示AUC为0.69,类似于高级医生 (AUC:0.72),精度为68%,优于初级/中级医生.
- 在初级医生中,LLM的模型间一致性 (κ = 0.590.70) 比医生间一致性 (κ = 0.15) 高.
结论:
- LLM,特别是Gemini-GPT,显示出潜在的价值工具,用于预测HCC的免疫疗法反应.
- 双子-GPT的性能在准确性方面与高级医生相美,尽管灵敏度仍然较低.
- 与人类专家协议相比,LLM显示出更高的模型间一致性,这表明了标准化评估的潜力.


