使用大型语言模型进行增强的临床试验匹配:关于患者查自动化的研究
Jacob Beattie1, Sarah Neufeld1, Daniel Yang1
1Department of Radiation Oncology, University of Texas (UT) Southwestern Medical Center, Dallas, USA.
Cureus
|June 10, 2024
概括
大型语言模型 (LLM) 通过自动化患者查,显著改善了临床试验匹配. 这种由人工智能驱动的方法提高了准确性和效率,加速了医学研究入学率.
科学领域:
- 人工智能在医学中的应用
- 自然语言处理应用程序
- 临床试验优化 临床试验优化
背景情况:
- 临床试验匹配至关重要,但面临的挑战是手动查众多患者和复杂的标准.
- 当前的手动流程耗时,容易出现错误,并可能导致错过的入学机会.
- 大型语言模型 (LLM) 提供了自动化和提高患者查准确性的潜力.
研究的目的:
- 评估LLM (GPT-3.5 Turbo和GPT-4) 在临床试验匹配中用于自动化患者查的有效性.
- 评估基于LLM的查对专家注释的标准的准确性,敏感性,特异性和F1分数.
- 确定临床试验资格评估LLM应用中的挑战和潜在改进.
主要方法:
- 利用了2018年n2c2挑战赛的202个纵向患者记录,根据13个选择标准进行注释.
- 采用载体数据库嵌入医疗文件并识别相关部分.
- 应用的LLM (GPT-3.5 Turbo,GPT-4) 具有结构化和思维链提示,用于系统的文档评估.
主要成果:
- GPT-3.5 Turbo实现了0.81的精度,0.80的灵敏度,0.82的特异性,以及0.79的微F1得分.
- GPT-4表现出卓越的性能,准确度为0.87,灵敏度为0.85,特异性为0.89,F1得分为0.86微.
- 识别了地面真相数据中的潜在错误标签,影响了准确的评估.
结论:
- 人工智能和LLM显示出显著的潜力,以提高临床试验匹配的准确性和效率.
- 自动查可以减少研究人员的工作量,提高患者入学率.
- 需要进一步的研究来验证这种方法与现实世界的临床数据.


