在瘤学试验中用于毒性提取的大型语言模型:前列腺放射治疗中的现实世界的基准
Federico Mastroleo1, Mariana Borras-Osorio2, Shiv P Patel2
1Department of Radiation Oncology, Mayo Clinic, Rochester, MN, United States; Division of Radiation Oncology, IEO, European Institute of Oncology, IRCCS, Milan, Italy; Department of Oncology and Hemato-Oncology, University of Milan, Milan, Italy.
概括
大型语言模型 (LLM) 可以在瘤学试验中自动进行毒性分级,显示出接近人类可靠性的性能. 这些工具为临床研究中毒性监测提供了可扩展,具有成本效益的支持.
科学领域:
- 在瘤学瘤学.
- 临床试验 临床试验
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 在瘤学临床试验中,准确的毒性评估至关重要.
- 目前的方法,如常用术语对不良事件的标准 (CTCAE),是劳动密集型的,并且具有观察者间的可变性.
- 大型语言模型 (LLM) 为自动化不良事件提取和分级提供了一个潜在的解决方案.
研究的目的:
- 评估现成的LLM的性能和成本效益,用于提取和分级毒性.
- 使用标准化的方法来比较不同的LLM.
主要方法:
- 五个LLM (双子2.0闪光灯,双子2.5闪光灯,双子2.5专业,GPT-4o,GPT-5) 进行了评估.
- 采用了一个规则增强的几次射击提示策略.
- 使用了来自前列腺放射治疗试验 (NCT02874014) 的数据,其中包括8968个毒性记录.
- 评估的指标包括二进制和等级准确性,精度,回忆,特异性,F1得分,科恩的卡帕和计算成本.
主要成果:
- 所有的LLM都实现了高二进制精度 (84.6-87.4%) 和中等等级精度 (79.1-82.3%).
- GPT-4o显示了最高的二进制和等级精度,而Gemini 2.5 Pro显示了最高的灵敏度.
- 计算成本差异很大,Gemini 2.0 Flash是最具成本效益的.
- 科恩的kappa表明LLM提取和参考标准之间存在温和的协议.
结论:
- 现成的LLM可以提取临床相关的毒性,其性能接近人类间评分器的可靠性.
- 将LLM集成到瘤学工作流中是可行的,为毒性监测和数据抽象提供可扩展,低成本的支持.
- 虽然等级级准确性需要进一步改进,但LLM显示出提高临床研究效率的希望.
更多相关视频
05:39Author Spotlight: Radiotherapy and Clonogenic Assays for Advancing Cancer Research and Personalized Medicine
Published on: April 5, 2024
1.2K
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.6K
