利用大型语言模型的基于指南的临床决策支持系统:乳腺癌的案例研究
Solène Delourme1,2, Akram Redjdal1,3, Jacques Bouaud1
1Sorbonne Université, Université Sorbonne Paris Nord, INSERM, LIMICS, Paris, France.
Methods of information in medicine
|January 29, 2025
概括
大型语言模型 (LLM) 在改善癌症护理的临床决策支持系统 (CDSS) 方面表现有前途. 然而,尽管在回答问题方面准确度很高,但LLM仍难以可靠地为复杂患者病例提供有效的治疗建议.
科学领域:
- 在瘤学瘤学.
- 医疗信息学 医疗信息学
- 人工智能的人工智能
背景情况:
- 多学科瘤委员会 (MTB) 对于癌症患者的治疗决策至关重要,但也面临诸如病例超载等挑战.
- 临床决策支持系统 (CDSS) 旨在协助临床医生,但未得到充分利用.
- 大型语言模型 (LLM) 提供了一个提高CDSS效率和可用性的机会.
研究的目的:
- 评估LLM作为问答 (QA) 系统的潜力,以提高针对乳腺癌的基于指南的CDSSOncoDoc2的可用性.
- 评估不同的提示工程技术 (PETs) 以在CDSS背景下优化LLM性能.
主要方法:
- 乳腺癌患者摘要 (BCPS) 和OncoDoc2生成的问题被用来创建LLMs的提示.
- 通过对200个BCPS的准确性,精度,回忆和F1得分进行比较,对各种LLM和PET进行了比较.
- 通过将OncoDoc2的LLM信息建议与MTB临床医生的建议进行比较,对30个额外的BCPS进行验证,来评估表现最好的LLM/PET.
主要成果:
- 使用增强的零射击PET的Mistral和OpenChat模型实现了最高的QA性能 (75.57%的准确性,56.59%的F1得分).
- 然而,这种LLM增强的OncoDoc2方法作为CDSS表现不佳,只有16.67%的建议符合黄金标准.
- 这表明LLM的质量保证能力与其在产生临床建议方面的有效性之间存在很大的差距.
结论:
- 在OncoDoc2决策树中的所有标准对于准确的患者特定建议至关重要.
- 尽管在质量保证任务中准确度高 (75.57%),但在理解复杂的医疗细微差别以实现可靠的CDSS应用方面,LLM面临重大挑战.
- 需要进一步发展,以弥合LLM能力与其有效整合到临床决策支持之间的差距.


